#Modelos Open Source
A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.
Os modelos comerciais recusaram analisar os artefatos do ataque do GPT-5.6. A forense dos 17 mil eventos de log rodou em GLM 5.2, open-weight, na infra da própria Hugging Face. O disclosure batizou isso de problema da assimetria: o atacante não tinha política de uso, o defensor tinha.
Os EUA acusam formalmente labs chineses de roubo de tecnologia, a China rebate e OpenAI e Anthropic se uniram contra os modelos open-weight. Separamos fato de rumor nas sanções à IA chinesa open source e mostramos o playbook pra quem roda Kimi K3, DeepSeek ou Qwen em produção: o que a sanção alcança (e o que não) num stack no Brasil.
A poolside lançou o Laguna S 2.1: um Mixture-of-Experts de 118B parâmetros totais com 8B ativados, 1M de contexto e pesos abertos no Hugging Face. Fui olhar os benchmarks reais em vez da manchete: onde ele ganha, onde apanha feio, e por que a história de verdade é o preço, não a performance.
O Kimi K3 corrigiu 15 falhas de segurança que Codex e Fable recusaram por "cyber guardrails". Na mesma semana, a HuggingFace foi invadida e teve a perícia travada pelo próprio guardrail. Quando o freio da IA protege, e quando desarma o defensor.
A Alibaba soltou o Qwen 3.8 Max, MoE de 2.4 trilhões de parâmetros que ela diz ser o segundo do mundo, atrás só do Fable 5. Sem benchmark público no lançamento, o único teste independente deu 80/100 contra 83 do Kimi K3. Aqui: o que ele é, quanto custa (Token Plan de US$ 6 a 68), como acessar via API e onde cada modelo da família Qwen 3.8 se encaixa.
Kimi K3 custa US$ 3 de entrada e US$ 15 de saída por milhão de tokens na API (chat grátis no kimi.com), 1,7x mais barato que o Claude Opus 4.8, não os "5x" da timeline. Fizemos a conta honesta do preço, separamos o benchmark verificável do hype e mostramos onde ele bate (e onde não bate) o Claude.
O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.
O owl-alpha rodou disfarçado no OpenRouter por semanas, liderou rankings e sumiu. Era a LongCat 2.0 da Meituan: MoE de 1,6 trilhão de parâmetros, treinada sem NVIDIA. A história do modelo fantasma e o que ela ensina pra quem constrói com IA.
A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. Como o peak/valley funciona, a pegadinha de fuso que joga a favor de quem coda em Brasília e o que conferir no cron. A tabela oficial atual do V4 Pro e do Flash está no post do 0813.
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.
Modelos open source fecharam o gap em 2026. Mas "open source" não é "local" e "local" não é "de graça". A conta honesta de quando rodar LLM local compensa: custo, privacidade e velocidade.