~/beer-and-code
▪ próximo evento Workshop: Loop Engineering — Pare de Ser o Operador do Agente · 19 Ago · 19h (horário de Brasília) — duração de 2 a 4 horas, ao vivo via Google Meet garantir vaga
~ / noticias / qwen-3-8-max $
Notícias

Qwen 3.8 Max chegou: a Alibaba lançou um "Fable open source"? Benchmarks e primeiro teste

LS Lucas Souza · · 8 min de leitura
Qwen 3.8 Max chegou: a Alibaba lançou um "Fable open source"? Benchmarks e primeiro teste

A Alibaba soltou o Qwen 3.8 Max no palco do World AI Conference, em Xangai, e o efeito foi imediato: metade da internet gritando que é o "Fable open source", a outra metade dizendo que foi um tropeço de marketing. No meio, um detalhe que ninguém deveria pular: no dia do anúncio, não existia tabela de benchmark, model card nem licença.

O modelo é grande. 2.4 trilhões de parâmetros, multimodal, janela de 1 milhão de tokens. A Alibaba diz que ele é o segundo mais forte do mundo, atrás só do Fable 5 da Anthropic. Só que essa nota veio de avaliação interna. Ninguém de fora rodou.

Neste post a gente separa o que é fato do que é narrativa: o que o Qwen 3.8 Max realmente é, o que a comunidade já testou nas primeiras 24 horas, e como você acessa hoje sem cair na confusão com o qwen3:8b antigo.

TL;DR

  • O que é: Qwen3.8-Max-Preview, modelo multimodal de 2.4T de parâmetros (MoE esparso) da Alibaba, anunciado em 19/07/2026 no WAIC de Xangai.
  • Modalidades: texto, imagem, vídeo e documento. Contexto de 1M tokens. API compatível com os protocolos da OpenAI e da Anthropic.
  • Benchmarks: nenhum público. O "segundo só atrás do Fable 5" é eval interna da Alibaba, sem tabela nem metodologia.
  • Acesso/custo: preview via Token Plan, Qoder e QoderWork, a 10% do preço padrão. Open weights prometido, sem data nem licença.

O contexto: por que o Qwen 3.8 pegou fogo

Primeiro, o nome. Se você buscar "qwen 3.8" agora, metade dos resultados ainda aponta pro qwen3:8b — aquele modelo denso de 8 bilhões de parâmetros que roda de graça no seu notebook. Não é ele. O Qwen 3.8 Max é outra categoria: 2.4 trilhões de parâmetros, três ordens de grandeza acima. A SERP ainda não separou os dois, e é exatamente por isso que quem chega primeiro no termo certo educa o mercado.

Segundo, o timing. O Qwen 3.8 saiu dois dias depois do Kimi K3, da Moonshot AI — outro modelo chinês, 2.8 trilhões de parâmetros, esse já com pesos abertos. Detalhe que quase ninguém comenta: a Alibaba detém cerca de 36% da Moonshot. Então tem competição interna de portfólio rolando, com os dois lados empurrando a fronteira ao mesmo tempo.

Terceiro, o pano de fundo. Em poucos meses saíram o GLM 5.2 da Z.AI (que encostou no Claude Opus 4.8), o Kimi K3 (que bateu o Fable 5 em benchmarks específicos) e agora o Qwen 3.8, o maior dos três. Não é um lançamento isolado. É uma onda de laboratório chinês mirando o topo — e escolhendo open weights como arma de commoditização.

A parte técnica que a Alibaba não contou também importa. Quantos dos 2.4 trilhões de parâmetros ficam ativos por token? Num MoE esparso, esse é o número que define custo real de inferência. Não foi divulgado. "Confia, é o número 2" é justamente o tipo de afirmação que uma tabela de benchmark existe pra resolver — e ela não veio.

O que a comunidade já testou

Aqui a briga fica interessante, porque os dois lados têm razão parcial.

O lado empolgado. No Hacker News, o fio do Qwen 3.8 estourou — o comentário mais votado passou de 900 pontos. Devs testando a geração de imagem multimodal ficaram impressionados: pediram um SVG de um pelicano e o modelo, por conta própria, adicionou um peixinho no bico. Detalhe criativo que não estava no prompt. Nas primeiras impressões de código e full-stack, tem gente jurando que passa fácil de Sonnet no dia a dia.

O lado cético. O mesmo fio virou debate geopolítico e, no meio da poeira, a crítica técnica que sobrou foi dura: Qwen tem fama de "benchmark specialist" — modelo que brilha em teste e escorrega em produção, principalmente em seguir instrução. E o teste independente mais sério que apareceu até agora não confirma o hype. Numa tarefa de arquitetura de software com limite de 60 minutos, o trilogyai comparou Qwen 3.8 Max contra o Kimi K3:

Métrica Qwen 3.8 Max Kimi K3
Nota final (com penalidades) 80/100 83/100
Tool calls 44 53
Citações do repositório 354 274
Falhas de gateway 0 2 comandos negados

Repara: o Qwen foi mais econômico em tool calls e citou mais o repositório (sinal de que leu mais contexto antes de agir), mas perdeu pro Kimi K3 na nota final depois das penalidades por erro factual. Ou seja: bom, sólido, mas não o "esmaga tudo" que o palco do WAIC vendeu. E o Kimi K3, lembra, é o modelo da casa vizinha em que a própria Alibaba investe.

A leitura honesta das primeiras 24 horas: o Qwen 3.8 Max é competente e provavelmente melhor que o 3.7 em código e workflow de escritório. Mas "segundo do mundo" continua sendo alegação de fabricante até a Artificial Analysis e a LMArena rodarem o modelo.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

Como acessar hoje (e por que "open source" tem asterisco)

Enquanto os pesos não caem, o acesso é pago e via canais da Alibaba. O modelo aparece como Qwen3.8-Max-Preview.

  • Token Plan — assinatura por crédito, do Lite de US$ 6 (2.500 créditos/semana) ao Pro de US$ 68 (40.000 créditos/semana). Não tem preço por token publicado, então previsão de custo fica no escuro.
  • Qoder e QoderWork — as ferramentas de agente/IDE da própria Alibaba.
  • Preview a 10% do preço padrão, por tempo limitado.

A API é compatível com os protocolos da OpenAI e da Anthropic. Na prática, você troca a base_url e a chave, e a maioria dos SDKs funciona:

from openai import OpenAI

client = OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="SUA_CHAVE_ALIBABA",
)

resp = client.chat.completions.create(
    model="qwen3.8-max-preview",
    messages=[
        {"role": "user", "content": "Refatore este endpoint pra usar cache e explique o trade-off."}
    ],
)
print(resp.choices[0].message.content)

Sobre o "Fable open source" do título: por enquanto é só promessa. A Alibaba disse que os pesos vão abrir "em breve", mas não deu data nem licença. E mesmo quando abrir, tem um detalhe que mata o self-host da maioria: os pesos devem passar de 1.2 TB. GPU comum carrega 141 GB. Então "open" não vai virar "roda na minha máquina" tão cedo — vai virar "roda em quem tem cluster ou provedor que suba pra você".

Limitações e pontos de atenção

  • Zero benchmark de terceiro. Todo número de performance hoje vem da Alibaba. Não é mentira, mas é marketing até prova independente.
  • Parâmetro ativo não divulgado. Sem isso, você não estima custo de inferência de verdade num MoE.
  • É preview. Model card e licença ainda não existem. Não construa produto crítico em cima de algo que pode mudar de comportamento ou de preço amanhã.
  • Instrução em produção. A fama da linhagem Qwen é escorregar em obediência a instrução sob carga. Se for testar, teste no seu caso real, com seus prompts, não no benchmark bonito.
  • Não é o qwen3:8b. De novo: o modelo local de 8B não tem nada a ver com esse de 2.4T. Não confunda na hora de baixar.

FAQ rápido

Qwen 3.8 Max já é open source? Não. Hoje é preview proprietário via Token Plan, Qoder e QoderWork. A Alibaba prometeu pesos abertos, mas sem data nem licença definida.

Dá pra rodar local? Na teoria, quando abrir. Na prática, não pra quase ninguém: os pesos passam de 1.2 TB. Isso é território de cluster, não de notebook.

É melhor que o Claude? A Alibaba diz que fica só atrás do Fable 5. Não há benchmark independente que confirme. O único teste sério que apareceu colocou ele levemente atrás do Kimi K3 numa tarefa de arquitetura. Espere Artificial Analysis e LMArena antes de acreditar no ranking.

Como acesso agora? Via Token Plan (assinatura por crédito) ou pelas ferramentas Qoder. API compatível com OpenAI/Anthropic — troca base_url e chave. Fora disso, é esperar cair no OpenRouter ou os pesos abrirem.

Conclusão

O Qwen 3.8 Max é real, é grande e é competente. Mas a distância entre "modelo forte da China" e "segundo melhor do mundo" é exatamente do tamanho dos benchmarks que ainda não existem. Chegou primeiro no termo? Chegou. Provou o título? Ainda não.

O padrão aqui vale pra qualquer lançamento: não é a contagem de parâmetros que decide, é o modelo rodando no seu problema, com seus dados, sob sua avaliação. Testar rápido, medir com método e não comprar hype de palco — isso é engenharia de IA, não torcida. É esse tipo de leitura que a gente faz junto no Clã Beer and Code, a maior comunidade de engenharia de IA do Brasil, onde a turma coloca modelo novo em produção antes da SERP entender o que aconteceu.

O próximo capítulo é previsível: quando os pesos abrirem e a Artificial Analysis publicar a tabela, a gente vai saber se era Fable open source ou só o maior modelo com o menor benchmark. Até lá, testa você mesmo — e desconfia de quem já cravou o placar.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando