#Llm
Em duas semanas, dois físicos de elite — Giorgio Parisi (Nobel) e Yuji Tachikawa — creditaram ao Claude a solução de problemas travados há meses ou anos. O padrão importa mais que a manchete: problema maduro, confiança calibrada e verificação em loop, aplicável a qualquer trabalho técnico.
Sam Altman disse que o GPT-5.6 descobriu matemática nova e a internet surtou. O que exatamente foi alegado, o que "descobrir matemática" significa pra um LLM, e por que os matemáticos pisam no freio.
O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.
O owl-alpha rodou disfarçado no OpenRouter por semanas, liderou rankings e sumiu. Era a LongCat 2.0 da Meituan: MoE de 1,6 trilhão de parâmetros, treinada sem NVIDIA. A história do modelo fantasma e o que ela ensina pra quem constrói com IA.
A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. O que é o peak/valley, quanto cai fora do pico e a conta vs Claude Opus 4.8 pra dev brasileiro, com a pegadinha de fuso que joga a seu favor.
Saiu o Claude Sonnet 5. Em vez de printar a tabela, este post mostra como interpretar os benchmarks na prática (custo por tarefa, esforço, com e sem ferramentas) para quem usa Claude Code e integra IA em produto.
A HP Inc. virou uma das primeiras grandes a rodar a OpenAI Frontier, a plataforma de gestão de agentes da OpenAI. Separamos o que foi entregue do que é promessa, e o que isso revela sobre botar agente em produção.
Os EUA mandaram a Anthropic desligar o Fable 5 e o Mythos 5 para qualquer estrangeiro — e o Brasil caiu no bloqueio por tabela. Uma empresa já processa o governo americano para derrubar a ordem. Explicamos o que a diretiva proíbe, por que você foi afetado e o que o processo pode mudar.
A Anthropic vendeu o Fable 5 como o modelo mais alinhado da casa. Dias depois, já tinha jailbreak circulando. Separamos o que de fato quebrou, o que é demonstração de pesquisa vs. risco real, e o que isso muda na arquitetura de quem coloca LLM em produção.
Pela primeira vez o governo dos EUA decidiu quem pode usar um modelo de IA antes do lançamento. O caso GPT-5.6, com fontes, e o que muda pra quem constrói software com IA.
A OpenAI lançou o GPT-5.6 em três modelos: Sol, Terra e Luna. O que muda entre eles, quanto custa cada um e quando usar qual, sem hype.
A OpenAI liberou o GPT-5.5-Cyber dentro do programa Daybreak, um modelo que acha, valida e corrige vulnerabilidades num fluxo automatizado. O que ele faz na prática, onde entra no fluxo do dev e até onde dá pra confiar correção de vuln a um modelo.