#Qwen
PewDiePie diz que a OpenAI baniu a conta dele duas vezes por destilação enquanto treinava o Ajax, um Qwen 3.5 9B local com recusas removidas pelo Heretic. O que é destilação de modelo, como a OpenAI detecta (o relatório do caso Moonshot saiu dois dias antes), o que tem dentro do Ajax e onde fica a linha entre dado sintético legítimo e ban na sua conta.
A Alibaba anunciou o Qwen3.8-Flash-Next: 125B totais com apenas 6B ativos por token, mais 51B em embeddings N-gram e uma atenção esparsa redesenhada. O que foi confirmado pela Qwen, o que ainda é estimativa da comunidade, quanta memória ele pede de verdade e por que a arquitetura está sendo publicada antes do Qwen 4. Nenhum benchmark oficial saiu até agora.
A Alibaba lançou o Qwen 3.8 27B e alguém abriu o diff contra o 3.6: 59 de 59 nós do grafo mapeiam um pra um, e o único campo diferente é metadado. Mesma arquitetura, DeepSWE triplicando de 13,3 para 42,2. Aqui vão os benchmarks reais (e o que a tabela do vendor omite), a conta de VRAM que a imprensa simplificou, o KV cache de 64KB por token, o bug do template Jinja que derruba tool call no dia 1, e a diferença entre o 27B denso e o 3.8 Max de 2,4T. Com o contraponto que ninguém fez.
A Alibaba vai publicar os pesos do Qwen3.8-Max, 2,4 trilhões de parâmetros, na semana de 10 de agosto: é a primeira vez que um modelo classe Max abre. A conta honesta do que isso significa na prática: quanto pesa em VRAM, por que nem um nó de 8 H200 fecha, por que o Qwen3.8-27B é o checkpoint que realmente te interessa, e o detalhe que quase ninguém está olhando, a licença que ainda não foi anunciada.
A Alibaba soltou o Qwen 3.8 Max, MoE de 2.4 trilhões de parâmetros que ela diz ser o segundo do mundo, atrás só do Fable 5. Sem benchmark público no lançamento, o único teste independente deu 80/100 contra 83 do Kimi K3. Aqui: o que ele é, quanto custa (Token Plan de US$ 6 a 68), como acessar via API e onde cada modelo da família Qwen 3.8 se encaixa.