~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / autor / lucas-souza-virgu $ whoami
Lucas Souza

Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

280 posts
01 #openai · #harness
GPT-6 Astra vs Claude Fable 5.1 vs GPT-5.6 Sol: os números, o preço e o 99,9% que depende do harness

A OpenAI lançou o GPT-6 Astra em 03/09/2026 pelo mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, o índice independente onde o Fable ainda lidera, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% dependendo só do harness. Mais o que muda na sua API com o primeiro modelo "Critical" em cyber.

03 Set · 18 min
02 #monitoramento · #claude
Quem conserta o Claude quando o Claude cai? A resposta oficial da Anthropic é o silêncio

O Claude caiu hoje e o Codex junto. Do outro lado, engenheiros da Anthropic com o mesmo terminal travado. Eles têm servidor privado? Trocam pra outro modelo? Voltam a ler log na mão? A resposta, cruzando palestra do time de confiabilidade, código vazado, postmortems e 358 incidentes do status page.

03 Set · 17 min
03 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min
04 #ia · #ai-agents
Quando usar agente de IA: o teste dos 3 minutos

Metade dos "projetos de IA" que revisei em 2026 se resolviam com um if e um SELECT. A outra metade virou agente porque o time queria dizer que tinha IA. Aqui está o teste dos 3 minutos: 4 perguntas que decidem se o seu problema pede um if, uma query, um prompt, um fluxo determinístico ou um agente de verdade. Com 5 casos reais, o veredito de cada um (spoiler: 1 em 5 era agente) e o custo invisível de errar pra cima.

02 Set · 18 min
05 #ai-agents · #llm
Classificação de intenção com LLM: como o agente decide qual rota seguir

O agente decide sozinho qual fluxo usar, mas ninguém consegue explicar por que ele escolheu errado ontem às 14h. Roteador determinístico vs. roteador por LLM, classificação de intenção com schema fechado e evidência, política de fallback explícita, atributos de trace para auditar a decisão e como medir acerto de rota sem rotular dez mil conversas na mão.

02 Set · 17 min
06 #ia · #api
JSON que não quebra: structured output em LLM sem parser defensivo

Se o seu código tem um try/catch em volta de um json_decode da resposta do modelo, você não tem contrato. Tem esperança. Como garantir saída estruturada de verdade no LLM: constrained decoding no provider, schema que o modelo consegue cumprir, validação semântica e retry com orçamento fixo, sem loop infinito e sem parser defensivo.

02 Set · 16 min
07 #claude · #anthropic
Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)

A Anthropic lançou o Claude Fable 5.1 em 01/09/2026. Ele bate o Opus 5 em todos os benchmarks publicados, mas quase sempre por 2 a 3 pontos, e custa o dobro por token. Os números oficiais, a conta real de uma sessão agentic com cache quente (onde a razão de custo cai de 2x para 1.3x), a árvore de decisão entre Fable 5.1, Opus 5 e Sonnet 5, e os 3 breaking changes que quebram seu código se você só trocar o model id.

01 Set · 15 min
08 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min
09 #claude · #contexto
Claude Opus 5 piorou? Melhor nos benchmarks, pior de conviver

As threads dizem que o Claude Opus 5 regrediu, e o Google já responde que sim. Mas a explicação mais provável não é nerf de modelo: é que a Anthropic cortou mais de 80% do system prompt embutido do Claude Code na geração Claude 5. Os defaults de contenção saíram, e a responsabilidade migrou para o seu CLAUDE.md. O que dá pra medir, o que é percepção e como domar sem trocar de fornecedor.

01 Set · 7 min
10 #claude · #processo
Claude Max 20x: o processo que diz que o limite entrega 6x, não 20x

Uma ação coletiva na Califórnia (Kahn v. Anthropic, 3:26-cv-05763) alega que o plano Claude Max 20x entrega entre 6x e 8x o uso do Pro, não 20x. O que a petição sustenta com documentos internos, por que o multiplicador só vale na sessão de 5 horas enquanto o teto semanal é o que realmente trava, e como descobrir em qual dos dois você esbarra antes de renovar.

01 Set · 8 min
11 #ia · #rag
Alucinação de IA: por que acontece no seu sistema (e o que grounding resolve de verdade)

Alucinação não é bug do modelo, é ausência de amarra. Por que o nome atrapalha o diagnóstico, as técnicas que prendem a resposta no dado que é seu, a validação em tempo real que permite botar o sistema na frente de cliente pagante, e o que ainda vai escapar depois de tudo isso.

01 Set · 13 min
12 #ai-agents · #llm
LangGraph, Mem0, LangChain, MCP: do que você realmente precisa

Mapa honesto do ecossistema de orquestração e memória de agentes. O que LangGraph, Mem0, LangChain e MCP realmente fazem, o ponto em que cada um deixa de ser overhead, e a árvore de decisão de 5 perguntas antes de instalar qualquer coisa.

01 Set · 15 min
Conheça o Clã Beer and Code
tocando