~/beer-and-code
~ / noticias / qwen-3-8-max $
Notícias

Qwen 3.8 Max chegou: a Alibaba lançou um "Fable open source"? Benchmarks e primeiro teste

LS Lucas Souza · · 8 min de leitura
Qwen 3.8 Max chegou: a Alibaba lançou um "Fable open source"? Benchmarks e primeiro teste

A Alibaba soltou o Qwen 3.8 Max no palco do World AI Conference, em Xangai, e o efeito foi imediato: metade da internet gritando que é o "Fable open source", a outra metade dizendo que foi um tropeço de marketing. No meio, um detalhe que ninguém deveria pular: no dia do anúncio, não existia tabela de benchmark, model card nem licença.

O modelo é grande. 2.4 trilhões de parâmetros, multimodal, janela de 1 milhão de tokens. A Alibaba diz que ele é o segundo mais forte do mundo, atrás só do Fable 5 da Anthropic. Só que essa nota veio de avaliação interna. Ninguém de fora rodou.

Neste post a gente separa o que é fato do que é narrativa: o que o Qwen 3.8 Max realmente é, o que a comunidade já testou nas primeiras 24 horas, e como você acessa hoje sem cair na confusão com o qwen3:8b antigo.

TL;DR

  • O que é: Qwen3.8-Max-Preview, modelo multimodal de 2.4T de parâmetros (MoE esparso) da Alibaba, anunciado em 19/07/2026 no WAIC de Xangai.
  • Modalidades: texto, imagem, vídeo e documento. Contexto de 1M tokens. API compatível com os protocolos da OpenAI e da Anthropic.
  • Benchmarks: nenhum público. O "segundo só atrás do Fable 5" é eval interna da Alibaba, sem tabela nem metodologia.
  • Acesso/custo: preview via Token Plan, Qoder e QoderWork, a 10% do preço padrão. Open weights prometido, sem data nem licença.

O contexto: por que o Qwen 3.8 pegou fogo

Primeiro, o nome. Se você buscar "qwen 3.8" agora, metade dos resultados ainda aponta pro qwen3:8b — aquele modelo denso de 8 bilhões de parâmetros que roda de graça no seu notebook. Não é ele. O Qwen 3.8 Max é outra categoria: 2.4 trilhões de parâmetros, três ordens de grandeza acima. A SERP ainda não separou os dois, e é exatamente por isso que quem chega primeiro no termo certo educa o mercado.

Segundo, o timing. O Qwen 3.8 saiu dois dias depois do Kimi K3, da Moonshot AI — outro modelo chinês, 2.8 trilhões de parâmetros, esse já com pesos abertos. Detalhe que quase ninguém comenta: a Alibaba detém cerca de 36% da Moonshot. Então tem competição interna de portfólio rolando, com os dois lados empurrando a fronteira ao mesmo tempo.

Terceiro, o pano de fundo. Em poucos meses saíram o GLM 5.2 da Z.AI (que encostou no Claude Opus 4.8), o Kimi K3 (que bateu o Fable 5 em benchmarks específicos) e agora o Qwen 3.8, o maior dos três. Não é um lançamento isolado. É uma onda de laboratório chinês mirando o topo — e escolhendo open weights como arma de commoditização.

A parte técnica que a Alibaba não contou também importa. Quantos dos 2.4 trilhões de parâmetros ficam ativos por token? Num MoE esparso, esse é o número que define custo real de inferência. Não foi divulgado. "Confia, é o número 2" é justamente o tipo de afirmação que uma tabela de benchmark existe pra resolver — e ela não veio.

O que a comunidade já testou

Aqui a briga fica interessante, porque os dois lados têm razão parcial.

O lado empolgado. No Hacker News, o fio do Qwen 3.8 estourou — o comentário mais votado passou de 900 pontos. Devs testando a geração de imagem multimodal ficaram impressionados: pediram um SVG de um pelicano e o modelo, por conta própria, adicionou um peixinho no bico. Detalhe criativo que não estava no prompt. Nas primeiras impressões de código e full-stack, tem gente jurando que passa fácil de Sonnet no dia a dia.

O lado cético. O mesmo fio virou debate geopolítico e, no meio da poeira, a crítica técnica que sobrou foi dura: Qwen tem fama de "benchmark specialist" — modelo que brilha em teste e escorrega em produção, principalmente em seguir instrução. E o teste independente mais sério que apareceu até agora não confirma o hype. Numa tarefa de arquitetura de software com limite de 60 minutos, o trilogyai comparou Qwen 3.8 Max contra o Kimi K3:

Métrica Qwen 3.8 Max Kimi K3
Nota final (com penalidades) 80/100 83/100
Tool calls 44 53
Citações do repositório 354 274
Falhas de gateway 0 2 comandos negados

Repara: o Qwen foi mais econômico em tool calls e citou mais o repositório (sinal de que leu mais contexto antes de agir), mas perdeu pro Kimi K3 na nota final depois das penalidades por erro factual. Ou seja: bom, sólido, mas não o "esmaga tudo" que o palco do WAIC vendeu. E o Kimi K3, lembra, é o modelo da casa vizinha em que a própria Alibaba investe.

A leitura honesta das primeiras 24 horas: o Qwen 3.8 Max é competente e provavelmente melhor que o 3.7 em código e workflow de escritório. Mas "segundo do mundo" continua sendo alegação de fabricante até a Artificial Analysis e a LMArena rodarem o modelo.

Como acessar hoje (e por que "open source" tem asterisco)

Enquanto os pesos não caem, o acesso é pago e via canais da Alibaba. O modelo aparece como Qwen3.8-Max-Preview.

  • Token Plan — assinatura por crédito, do Lite de US$ 6 (2.500 créditos/semana) ao Pro de US$ 68 (40.000 créditos/semana). Não tem preço por token publicado, então previsão de custo fica no escuro.
  • Qoder e QoderWork — as ferramentas de agente/IDE da própria Alibaba.
  • Preview a 10% do preço padrão, por tempo limitado.

A API é compatível com os protocolos da OpenAI e da Anthropic. Na prática, você troca a base_url e a chave, e a maioria dos SDKs funciona:

from openai import OpenAI

client = OpenAI(
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
    api_key="SUA_CHAVE_ALIBABA",
)

resp = client.chat.completions.create(
    model="qwen3.8-max-preview",
    messages=[
        {"role": "user", "content": "Refatore este endpoint pra usar cache e explique o trade-off."}
    ],
)
print(resp.choices[0].message.content)

Sobre o "Fable open source" do título: por enquanto é só promessa. A Alibaba disse que os pesos vão abrir "em breve", mas não deu data nem licença. E mesmo quando abrir, tem um detalhe que mata o self-host da maioria: os pesos devem passar de 1.2 TB. GPU comum carrega 141 GB. Então "open" não vai virar "roda na minha máquina" tão cedo — vai virar "roda em quem tem cluster ou provedor que suba pra você".

Limitações e pontos de atenção

  • Zero benchmark de terceiro. Todo número de performance hoje vem da Alibaba. Não é mentira, mas é marketing até prova independente.
  • Parâmetro ativo não divulgado. Sem isso, você não estima custo de inferência de verdade num MoE.
  • É preview. Model card e licença ainda não existem. Não construa produto crítico em cima de algo que pode mudar de comportamento ou de preço amanhã.
  • Instrução em produção. A fama da linhagem Qwen é escorregar em obediência a instrução sob carga. Se for testar, teste no seu caso real, com seus prompts, não no benchmark bonito.
  • Não é o qwen3:8b. De novo: o modelo local de 8B não tem nada a ver com esse de 2.4T. Não confunda na hora de baixar.

FAQ rápido

Qwen 3.8 Max já é open source? Não. Hoje é preview proprietário via Token Plan, Qoder e QoderWork. A Alibaba prometeu pesos abertos, mas sem data nem licença definida.

Dá pra rodar local? Na teoria, quando abrir. Na prática, não pra quase ninguém: os pesos passam de 1.2 TB. Isso é território de cluster, não de notebook.

É melhor que o Claude? A Alibaba diz que fica só atrás do Fable 5. Não há benchmark independente que confirme. O único teste sério que apareceu colocou ele levemente atrás do Kimi K3 numa tarefa de arquitetura. Espere Artificial Analysis e LMArena antes de acreditar no ranking.

Como acesso agora? Via Token Plan (assinatura por crédito) ou pelas ferramentas Qoder. API compatível com OpenAI/Anthropic — troca base_url e chave. Fora disso, é esperar cair no OpenRouter ou os pesos abrirem.

Conclusão

O Qwen 3.8 Max é real, é grande e é competente. Mas a distância entre "modelo forte da China" e "segundo melhor do mundo" é exatamente do tamanho dos benchmarks que ainda não existem. Chegou primeiro no termo? Chegou. Provou o título? Ainda não.

O padrão aqui vale pra qualquer lançamento: não é a contagem de parâmetros que decide, é o modelo rodando no seu problema, com seus dados, sob sua avaliação. Testar rápido, medir com método e não comprar hype de palco — isso é engenharia de IA, não torcida. É esse tipo de leitura que a gente faz junto no Clã Beer and Code, a maior comunidade de engenharia de IA do Brasil, onde a turma coloca modelo novo em produção antes da SERP entender o que aconteceu.

O próximo capítulo é previsível: quando os pesos abrirem e a Artificial Analysis publicar a tabela, a gente vai saber se era Fable open source ou só o maior modelo com o menor benchmark. Até lá, testa você mesmo — e desconfia de quem já cravou o placar.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

tocando