#Llm
Saiu o Claude Sonnet 5. Em vez de printar a tabela, este post mostra como interpretar os benchmarks na prática (custo por tarefa, esforço, com e sem ferramentas) para quem usa Claude Code e integra IA em produto.
A HP Inc. virou uma das primeiras grandes a rodar a OpenAI Frontier, a plataforma de gestão de agentes da OpenAI. Separamos o que foi entregue do que é promessa, e o que isso revela sobre botar agente em produção.
Os EUA mandaram a Anthropic desligar o Fable 5 e o Mythos 5 para qualquer estrangeiro — e o Brasil caiu no bloqueio por tabela. Uma empresa já processa o governo americano para derrubar a ordem. Explicamos o que a diretiva proíbe, por que você foi afetado e o que o processo pode mudar.
A Anthropic vendeu o Fable 5 como o modelo mais alinhado da casa. Dias depois, já tinha jailbreak circulando. Separamos o que de fato quebrou, o que é demonstração de pesquisa vs. risco real, e o que isso muda na arquitetura de quem coloca LLM em produção.
Pela primeira vez o governo dos EUA decidiu quem pode usar um modelo de IA antes do lançamento. O caso GPT-5.6, com fontes, e o que muda pra quem constrói software com IA.
Qual a diferença entre GPT-5.6 Sol, Terra e Luna? Mesma geração, três tiers: Sol é o topo agêntico ($5/$30 por 1M de tokens), Terra o meio-termo ($2/$12) e Luna o barato e rápido ($0,20/$1,20). Com a tabela vigente desde o corte de 30/07, quando cada um vale a pena e quando o Sol é só desperdício de orçamento.
A OpenAI liberou o GPT-5.5-Cyber dentro do programa Daybreak, um modelo que acha, valida e corrige vulnerabilidades num fluxo automatizado. O que ele faz na prática, onde entra no fluxo do dev e até onde dá pra confiar correção de vuln a um modelo.
A Mistral lançou o OCR 4 e ele foi pro topo do Hacker News. O que muda na extração de PDF, como compara com a leitura do ChatGPT/Gemini e quando vale plugar na sua stack.
Viralizou a fala atribuída ao chefe da NSA de que o Mythos, modelo de fronteira da Anthropic, invadiu "quase todos" os sistemas classificados "em horas". O modelo é real. A acusação do hack, nem tanto. Separando fato de boato.
Curadoria dos projetos reais que devs dos EUA construíram com o Claude Fable 5 nas primeiras 72 horas, antes de a Anthropic desligar o modelo por diretiva de controle de exportação dos EUA.
A Sakana AI lançou o Sakana Fugu: um LLM treinado para orquestrar um pool de outros modelos (chamar, delegar, verificar e sintetizar) atrás de uma única API compatível com OpenAI. Por que a tese de "capacidade frontier sem o risco de export controls" importa, e o que isso ensina sobre arquitetura de orquestração de agentes.
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.