~/beer-and-code
▪ próximo evento MasterClass: O Mapa do Engenheiro de IA · 27 Jul · 19h ✦ grátis garantir vaga
~ / tag / #llm $ grep

#Llm

91 posts
25 #ia · #llm
Mistral OCR 4: testei o novo modelo e ele lê PDF melhor que o ChatGPT?

A Mistral lançou o OCR 4 e ele foi pro topo do Hacker News. O que muda na extração de PDF, como compara com a leitura do ChatGPT/Gemini e quando vale plugar na sua stack.

24 Jun · 8 min
26 #ia · #llm
Mythos da Anthropic "invadiu a NSA em horas"? O que é fato e o que é boato

Viralizou a fala atribuída ao chefe da NSA de que o Mythos, modelo de fronteira da Anthropic, invadiu "quase todos" os sistemas classificados "em horas". O modelo é real. A acusação do hack, nem tanto. Separando fato de boato.

24 Jun · 7 min
27 #ia · #llm
Fable 5 casos de uso: o que os EUA construíram nas 72h antes do bloqueio

Curadoria dos projetos reais que devs dos EUA construíram com o Claude Fable 5 nas primeiras 72 horas, antes de a Anthropic desligar o modelo por diretiva de controle de exportação dos EUA.

23 Jun · 9 min
28 #ia · #agentes
Sakana Fugu: o modelo que rege Fable 5 e Mythos sem treinar nenhum frontier

A Sakana AI lançou o Sakana Fugu: um LLM treinado para orquestrar um pool de outros modelos (chamar, delegar, verificar e sintetizar) atrás de uma única API compatível com OpenAI. Por que a tese de "capacidade frontier sem o risco de export controls" importa, e o que isso ensina sobre arquitetura de orquestração de agentes.

22 Jun · 8 min
29 #ia · #llm
GLM 5.2: o melhor modelo de código open source é chinês, MIT e 6x mais barato

A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.

22 Jun · 8 min
30 #openai · #ia
GPT 5.6 foi lançado: Sol, Terra e Luna, preços e tudo o que sabemos (rastreador)

O GPT 5.6 foi lançado em três modelos (Sol, Terra e Luna), com acesso restrito pelo governo dos EUA. O que se confirmou dos vazamentos, os preços e o que ainda é incógnita.

22 Jun · 9 min
31 #ia · #embeddings
RAG híbrido na prática: BM25, embeddings e reranker

Embedding sozinho erra mais do que você imagina. Veja como combinar busca lexical (BM25), busca semântica e um reranker cross-encoder para subir a qualidade do RAG em produção, com código em Python e LangChain.

21 Jun · 9 min
32 #ia · #ai-agents
Como criar evals para agentes de IA com LLM-as-a-judge

Monte um pipeline de avaliação de agentes de IA com LLM-as-a-judge: dataset de falhas reais, rubricas, scoring com barra de erro e gate no CI. Sem eval, deploy é no escuro.

21 Jun · 12 min
33 #ia · #llm
Modelos de IA open source valem a pena em 2026? A conta real de rodar local

Modelos open source fecharam o gap em 2026. Mas "open source" não é "local" e "local" não é "de graça". A conta honesta de quando rodar LLM local compensa: custo, privacidade e velocidade.

20 Jun · 8 min
34 #ia · #ai-agents
Sistemas multiagentes: arquitetura e orquestração assíncrona na prática

O que são sistemas multiagentes, quando vale dividir o trabalho em vários agentes e como orquestrar de forma assíncrona com asyncio. Arquitetura orquestrador-worker, o padrão de produção da Anthropic e quando NÃO dividir.

16 Jun · 10 min
35 #ia · #ai-agents
Ferramentas de engenharia de contexto que eu uso em produção

Lista prática e opinativa das ferramentas de engenharia de contexto que seguram um agente em produção: gestão de janela, compressão, recuperação e observabilidade. Com APIs nativas, números reais e o que dá errado.

16 Jun · 10 min
36 #ia · #embeddings
Agentic RAG: quando seu RAG precisa virar agente

RAG tradicional busca uma vez e reza. Agentic RAG decide quando buscar, o que buscar e quando parar. Veja a diferença real, com números de paper, e monte o loop de decisão sem explodir o custo.

16 Jun · 9 min
Conheça o Clã Beer and Code
tocando