Qwen3.8-Flash-Next: 125B com 6B ativos, o MoE que a Alibaba lançou pra preparar o Qwen4
A Alibaba anunciou o Qwen3.8-Flash-Next e a primeira conta que a comunidade fez foi desconfortável: raiz quadrada de 125 vezes 6 dá mais ou menos 27.
Ou seja: um MoE de 125 bilhões de parâmetros que, pela regra de bolso do "denso equivalente", se comporta como um modelo denso de 27B.
Se a conta estiver certa, a novidade aqui não é performance. É arquitetura. E é isso que torna esse lançamento mais interessante que a maioria dos anúncios de modelo do mês.
Neste post você vai ver o que foi confirmado, o que ainda é estimativa da comunidade, quanta RAM esse modelo pede na prática e por que a Alibaba está soltando essa peça agora, antes do Qwen 4.
TL;DR
- O que é: o Qwen 3.8 Flash Next é um MoE de 125B parâmetros totais com apenas 6B ativos por token, mais 51B em embeddings N-gram. Multimodal, com atenção esparsa redesenhada.
- Por que importa: a Qwen chamou de "preview da arquitetura do Qwen 4" — é a peça de engenharia do próximo ciclo chegando antes do modelo principal.
- Custo/Acesso: pesos anunciados para ModelScope e Hugging Face. Quantizações da comunidade (GGUF e NVFP4) já começaram a aparecer.
- Status dos benchmarks: nenhum número oficial publicado até agora. O que circula é estimativa.
O que foi confirmado (e o que não foi)
Vale separar as duas coisas logo de cara, porque nesse tipo de lançamento a linha entre spec e boato some rápido.
Confirmado pela Qwen: 125B de parâmetros totais, 6B ativos por token, mais 51B em embeddings N-gram. Arquitetura Mixture-of-Experts. Modelo multimodal. E a descrição que a própria equipe usou: um preview da arquitetura do Qwen 4. O plano declarado é entregar as melhorias de arquitetura agora, antes do rollout completo da próxima família.
Não confirmado: performance. A Qwen não publicou nenhum comparativo — nem contra a própria linha Qwen 3, nem contra concorrente ocidental. Os 125B e 6B ativos são spec anunciada; qualquer número de benchmark que você vir circulando hoje é estimativa de terceiro ou extrapolação.
Essa distinção não é preciosismo. É o que separa quem escolhe modelo com critério de quem escolhe modelo por thread do X.
O ritmo em que isso acontece é o problema real: entre o anúncio, a quantização da comunidade e a primeira eval séria, passam-se dois dias. Acompanhar sozinho uma área nesse ritmo não é questão de disciplina, é questão de ambiente — e é o que a gente resolve construindo junto no Clã Beer and Code, toda semana, ao vivo.
A conta do "denso equivalente" — e o que ela realmente prevê
A fórmula que apareceu em todo lugar é a raiz quadrada do produto entre parâmetros totais e ativos:
√(125B × 6B) ≈ 27B
É uma regra de bolso conhecida para estimar a capacidade de um MoE em relação a um modelo denso. Ela diz, grosso modo: esse modelo deve entregar qualidade na faixa de um denso de 27B, gastando computação de um modelo de 6B na inferência.
Duas ressalvas importantes antes de você usar isso como decisão de arquitetura.
Primeira: é uma heurística, não um teorema. Ela ignora qualidade do roteamento, receita de treino, dados e — no caso específico aqui — os 51B de embeddings N-gram, que não entram na conta e claramente fazem alguma coisa.
Segunda: capacidade não é a métrica que importa pra você. Latência e custo por tarefa são. Um MoE com 6B ativos gera token na velocidade de um modelo pequeno, mas ocupa memória de um modelo grande. Você paga em RAM o que economiza em FLOPs.
Reparou que é exatamente o trade-off inverso do que a maioria assume quando vê "125B"? É por isso que a conta importa.
Atenção esparsa: por que existe antes do Qwen 4
A parte que a comunidade menos comentou é a mais relevante em engenharia.
Junto do MoE, a Qwen mexeu no mecanismo de atenção — uma atenção esparsa redesenhada, no lugar da atenção densa tradicional. Em atenção densa, o custo cresce com o quadrado do tamanho do contexto: dobrou o contexto, quadruplicou a conta. Em atenção esparsa, cada token só olha para um subconjunto dos outros, e o custo cresce bem mais devagar.
Aplicação prática: contexto longo deixa de ser um imposto proibitivo. Impacto em produto: é o que viabiliza agente que roda por horas mantendo histórico, RAG com janela grande sem estourar orçamento, e análise de repositório inteiro sem chunking agressivo.
E aqui está o motivo de a Alibaba soltar isso agora. Arquitetura nova quebra runtime. llama.cpp, vLLM, SGLang, MLX — todos precisam implementar suporte a um kernel de atenção diferente. Lançar a arquitetura numa peça de 125B seis semanas antes da família principal dá tempo para o ecossistema se ajustar. Quando o Qwen 4 chegar, o suporte já existe.
É jogo de plataforma, não de benchmark.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãQuanta máquina você precisa
Aqui a conversa fica concreta. 125B de parâmetros totais precisam estar carregados na memória, mesmo que só 6B sejam ativados por token.
Estimativa por quantização, contando só os pesos:
| Quantização | Memória aproximada só de pesos |
|---|---|
| BF16 / FP16 | ~250 GB |
| FP8 | ~125 GB |
| Q4 (4-bit) | ~65–70 GB |
Some contexto (o KV cache cresce com a janela) e overhead do runtime. Na prática, a faixa que a comunidade aponta é 128 GB de memória unificada ou mais para rodar com folga em quantização média: Strix Halo da AMD, Mac Studio com memória alta, DGX Spark da NVIDIA.
Não é modelo de notebook. Se você quer entender onde ficam os limites reais de rodar modelo grande na sua própria máquina, já destrinchamos isso aqui.
O detalhe bom: como só 6B são ativados por token, a velocidade de geração é muito melhor do que um denso de 125B na mesma máquina. Você espera menos por token — desde que caiba na memória. É o trade-off inteiro em uma frase.
Onde o Qwen 3.8 Flash Next se encaixa na linha Qwen 3.8
A Alibaba já tem várias peças no mesmo número de versão, e é fácil se perder.
O Qwen3.8-27B é o denso da faixa média — olhamos ele quando saiu. O Qwen3.8-Max é o topo de linha, com pesos abertos. O Flash-Next não substitui nenhum dos dois: ele é a peça experimental, o veículo da arquitetura nova.
Se a estimativa de 27B equivalente se confirmar, o posicionamento fica claro — qualidade parecida com o denso de 27B, com throughput bem maior e apetite de memória bem maior também. Escolha entre eles é escolha de restrição: você tem RAM sobrando ou tem GPU sobrando?
Limitações e pontos de atenção
Sem benchmark oficial, nada de decisão de produção. A Qwen não publicou score nenhum. Rodar seu próprio eval, no seu domínio, com o seu dataset, continua sendo a única resposta confiável. Modelo novo em produção com base em thread de rede social é como fazer deploy na sexta.
Suporte de runtime vai demorar. Arquitetura de atenção nova significa que o suporte no llama.cpp, vLLM e companhia chega em ondas, com bug. As primeiras quantizações da comunidade que aparecem em lançamento assim costumam ter problema de qualidade que ninguém detecta na primeira semana — inclusive as que já subiram no Hugging Face agora.
Licença. Não foi divulgada junto com o anúncio. A linha Qwen historicamente usa licenças permissivas, mas "historicamente" não é o mesmo que "esta versão". Se o uso é comercial, leia o arquivo de licença antes de subir qualquer coisa.
Memória não é opcional. Não adianta querer rodar isso com offload agressivo pra disco. Modelo MoE com offload vira apresentação de slides.
FAQ
Vale trocar meu Qwen3.8-27B por ele? Hoje, não — não tem número que justifique. A troca faz sentido se o gargalo do seu caso for throughput e você tiver RAM sobrando. Se o gargalo for qualidade, espere as evals.
Roda em GPU de consumidor? Numa RTX 4090 ou 5090 sozinha, não: 24–32 GB não seguram 125B nem em Q4. A rota realista é memória unificada grande ou multi-GPU.
Vai ter versão FP8? Não foi confirmado no anúncio. Quantizações da comunidade em GGUF e NVFP4 já começaram a aparecer, mas quant de terceiro na primeira semana é para testar, não para produção.
Isso significa que o Qwen 4 está perto? Significa que a arquitetura dele está fechada o suficiente para ser publicada. É um sinal forte, mas ninguém anunciou data.
O ponto
O Qwen3.8-Flash-Next é menos um lançamento de modelo e mais um lançamento de arquitetura com um modelo em volta.
Os 125B chamam atenção, mas o número que descreve o comportamento dele é 6B — e o que muda o jogo de verdade é a atenção esparsa, que vai ser o padrão da próxima família inteira.
Se você constrói produto com IA, o hábito que sobrevive a esse ciclo é um só: esperar o eval antes de trocar de modelo. Anúncio de spec é marketing de arquitetura. Número no seu domínio é engenharia.
Assim que os benchmarks oficiais saírem, a gente atualiza este post com os números.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã