~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #llm $ grep

#Llm

122 posts
61 #openai · #ia
GPT 5.6: data de lançamento, o vazamento no Codex e o que os rumores acertaram (rastreador)

Este rastreador seguiu o GPT 5.6 da string vazada nos logs do Codex até o lançamento de 26/06/2026, cruzando o que os rumores acertaram (a data, a família de três tiers) com o que caiu (1,5M de contexto, modo UltraFast). A escolha entre Sol, Terra e Luna e a tabela de preço vigente estão no comparativo dedicado.

22 Jun · 9 min
62 #ia · #embeddings
RAG híbrido na prática: BM25, embeddings e reranker

Embedding sozinho erra mais do que você imagina. Veja como combinar busca lexical (BM25), busca semântica e um reranker cross-encoder para subir a qualidade do RAG em produção, com código em Python e LangChain.

21 Jun · 9 min
63 #ia · #ai-agents
Como criar evals para agentes de IA com LLM-as-a-judge

Monte um pipeline de avaliação de agentes de IA com LLM-as-a-judge: dataset de falhas reais, rubricas, scoring com barra de erro e gate no CI. Sem eval, deploy é no escuro.

21 Jun · 18 min
64 #ia · #llm
Modelos de IA open source valem a pena em 2026? A conta real de rodar local

Modelos open source fecharam o gap em 2026. Mas "open source" não é "local" e "local" não é "de graça". A conta honesta de quando rodar LLM local compensa: custo, privacidade e velocidade.

20 Jun · 8 min
65 #ia · #ai-agents
Sistema multiagente: quando vale dividir e quando é overhead

O que são sistemas multiagentes, quando vale dividir o trabalho em vários agentes e como orquestrar de forma assíncrona com asyncio. Arquitetura orquestrador-worker, o padrão de produção da Anthropic e quando NÃO dividir.

16 Jun · 15 min
66 #ia · #ai-agents
Ferramentas de engenharia de contexto que eu uso em produção

Lista prática e opinativa das ferramentas de engenharia de contexto que seguram um agente em produção: gestão de janela, compressão, recuperação e observabilidade. Com APIs nativas, números reais e o que dá errado.

16 Jun · 10 min
67 #ia · #embeddings
Agentic RAG: quando seu RAG precisa virar agente

RAG tradicional busca uma vez e reza. Agentic RAG decide quando buscar, o que buscar e quando parar. Veja a diferença real, com números de paper, e monte o loop de decisão sem explodir o custo.

16 Jun · 12 min
68 #ia · #llm
Claude Opus 4.8 vs Minimax M3 vs Qwen 3: paguei caro, paguei barato e rodei de graça

Construí o mesmo encurtador de links três vezes, sem mão humana no código, com Opus 4.8 (US$100/mês), Minimax M3 (US$20) e Qwen 3.6 local na RTX 4080. Tempo, resultado e veredito honesto sobre pago, barato e de graça.

15 Jun · 9 min
69 #ia · #llm
Fable 5 bloqueado: o OpenRouter Fusion prova que painel de modelos já supera qualquer frontier

O Claude Fable 5 durou três dias disponível antes de ser bloqueado pelo governo dos EUA. Enquanto isso, o OpenRouter publicou dados que mudam a pergunta: e se painel de modelos baratos já superar qualquer frontier solo em deep research?

15 Jun · 7 min
70 #ia · #agentes
O que é Harness de IA? O ambiente que faz seu agente parar de travar

O harness é o ambiente que roda o agente — loop, ferramentas, estado e guardrails. É ele, não o modelo, que decide se seu agente aguenta produção ou trava na primeira tarefa de verdade.

15 Jun · 9 min
71 #openai · #cache
Reduzir custo de API de IA: os vazamentos de token mais comuns

Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.

14 Jun · 10 min
72 #rag · #llm
Estourou o limite de tokens do ChatGPT: por que a IA esquece e como resolver

A IA não esquece por burrice. É a janela de contexto. Entenda pela dor o limite de tokens e as quatro saídas: resumo, RAG, chunking e memória.

13 Jun · 10 min
Conheça o Clã Beer and Code
tocando