#China
A DeepSeek republicou os pesos do V4-Flash em 31/07 sem mudar o nome do modelo na API: quem chama deepseek-v4-flash acordou rodando outro modelo, sem changelog. Os números reais do 0731 (82,7 no Terminal Bench, mas 79% na medição independente), onde ele ganha do GPT-5.6 Luna e onde perde, os 169 GB pra rodar local e o que fazer se seu agente aponta pra um nome de modelo que virou alvo móvel.
A Moonshot AI publicou os pesos abertos do Kimi K3 um dia antes do prometido: 2,8 trilhões de parâmetros, licença MIT modificada e formato MXFP4 nativo. A conta que o hype não faz: 1,4 TB de VRAM só para carregar os pesos, nó de 8 GPUs que não fecha e um break-even de 6.200 tokens por segundo para empatar com a API a US$ 3 / US$ 15. Mais o que as sanções americanas alcançam de quem baixa peso no Brasil.
Os EUA acusam formalmente labs chineses de roubo de tecnologia, a China rebate e OpenAI e Anthropic se uniram contra os modelos open-weight. Separamos fato de rumor nas sanções à IA chinesa open source e mostramos o playbook pra quem roda Kimi K3, DeepSeek ou Qwen em produção: o que a sanção alcança (e o que não) num stack no Brasil.
A Alibaba soltou o Qwen 3.8 Max, modelo de 2.4 trilhões de parâmetros que ela diz ser o segundo do mundo, atrás só do Fable 5. Sem benchmark público. Testamos os dois lados da briga: quem grita "melhor que Sonnet" e quem chama de tropeço.
A Moonshot AI lançou o Kimi K3: 2,8 trilhões de parâmetros, pesos abertos e 3º lugar na Artificial Analysis, acima do Claude Opus 4.8. Separamos o benchmark verificável do hype — incluindo o "5x mais barato" que não fecha na conta.
A Alibaba baniu o Claude Code dos funcionarios e mandou trocar pelo Qoder, alegando um mecanismo de deteccao de China. Separamos o fato tecnico (o que a Anthropic embutiu e por que) do panico geopolitico EUA x China, com o checklist pra quem roda coding agent em codigo sensivel no Brasil.
O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.
O owl-alpha rodou disfarçado no OpenRouter por semanas, liderou rankings e sumiu. Era a LongCat 2.0 da Meituan: MoE de 1,6 trilhão de parâmetros, treinada sem NVIDIA. A história do modelo fantasma e o que ela ensina pra quem constrói com IA.
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.