#Llm
A Mistral lançou o OCR 4 e ele foi pro topo do Hacker News. O que muda na extração de PDF, como compara com a leitura do ChatGPT/Gemini e quando vale plugar na sua stack.
Viralizou a fala atribuída ao chefe da NSA de que o Mythos, modelo de fronteira da Anthropic, invadiu "quase todos" os sistemas classificados "em horas". O modelo é real. A acusação do hack, nem tanto. Separando fato de boato.
Curadoria dos projetos reais que devs dos EUA construíram com o Claude Fable 5 nas primeiras 72 horas, antes de a Anthropic desligar o modelo por diretiva de controle de exportação dos EUA.
A Sakana AI lançou o Sakana Fugu: um LLM treinado para orquestrar um pool de outros modelos (chamar, delegar, verificar e sintetizar) atrás de uma única API compatível com OpenAI. Por que a tese de "capacidade frontier sem o risco de export controls" importa, e o que isso ensina sobre arquitetura de orquestração de agentes.
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.
O GPT 5.6 foi lançado em três modelos (Sol, Terra e Luna), com acesso restrito pelo governo dos EUA. O que se confirmou dos vazamentos, os preços e o que ainda é incógnita.
Embedding sozinho erra mais do que você imagina. Veja como combinar busca lexical (BM25), busca semântica e um reranker cross-encoder para subir a qualidade do RAG em produção, com código em Python e LangChain.
Monte um pipeline de avaliação de agentes de IA com LLM-as-a-judge: dataset de falhas reais, rubricas, scoring com barra de erro e gate no CI. Sem eval, deploy é no escuro.
Modelos open source fecharam o gap em 2026. Mas "open source" não é "local" e "local" não é "de graça". A conta honesta de quando rodar LLM local compensa: custo, privacidade e velocidade.
O que são sistemas multiagentes, quando vale dividir o trabalho em vários agentes e como orquestrar de forma assíncrona com asyncio. Arquitetura orquestrador-worker, o padrão de produção da Anthropic e quando NÃO dividir.
Lista prática e opinativa das ferramentas de engenharia de contexto que seguram um agente em produção: gestão de janela, compressão, recuperação e observabilidade. Com APIs nativas, números reais e o que dá errado.
RAG tradicional busca uma vez e reza. Agentic RAG decide quando buscar, o que buscar e quando parar. Veja a diferença real, com números de paper, e monte o loop de decisão sem explodir o custo.