~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / autor / lucas-souza-virgu $ whoami
Lucas Souza

Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

294 posts
13 #ai-agents · #whatsapp
Da tela ao diálogo: interfaces de linguagem natural são a maior oportunidade aberta para o dev brasileiro

O brasileiro vive no WhatsApp, adotou o Pix em cinco anos e já compra pelo chat. As empresas ainda entregam formulário: só 17% usaram IA em 2025. Com dados do Gartner, Cetic.br, Banco Central e Opinion Box, por que a migração da tela para interfaces de linguagem natural é a maior oportunidade aberta para o dev brasileiro, o que construir agente significa na prática e as ressalvas que a tese precisa encarar.

14 Set · 15 min ›
14 #harness · #llm
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek lançou o V4.1 Flash e a timeline recortou a linha boa do benchmark. Comparamos o modelo com Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e GPT-6 Astra em preço e performance, mostramos onde ele realmente lidera, onde cai 20 pontos, e o dado escondido no model card: o scaffold muda o resultado quarenta vezes mais que a troca de modelo.

10 Set · 11 min ›
15 #openai · #harness
GPT-6 Astra vs Fable 5.1 vs GPT-5.6 Sol: o que é, preço e benchmarks

GPT-6 Astra é o novo modelo topo de linha da OpenAI, lançado em 03/09/2026 a $10/$50 por milhão de tokens, o mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% só trocando o harness.

03 Set · 18 min ›
16 #monitoramento · #claude
Quem conserta o Claude quando o Claude cai? A resposta oficial da Anthropic é o silêncio

O Claude caiu hoje e o Codex junto. Do outro lado, engenheiros da Anthropic com o mesmo terminal travado. Eles têm servidor privado? Trocam pra outro modelo? Voltam a ler log na mão? A resposta, cruzando palestra do time de confiabilidade, código vazado, postmortems e 358 incidentes do status page.

03 Set · 17 min ›
17 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min ›
18 #ia · #ai-agents
Quando usar agente de IA: o teste dos 3 minutos

Metade dos "projetos de IA" que revisei em 2026 se resolviam com um if e um SELECT. A outra metade virou agente porque o time queria dizer que tinha IA. Aqui está o teste dos 3 minutos: 4 perguntas que decidem se o seu problema pede um if, uma query, um prompt, um fluxo determinístico ou um agente de verdade. Com 5 casos reais, o veredito de cada um (spoiler: 1 em 5 era agente) e o custo invisível de errar pra cima.

02 Set · 18 min ›
19 #ai-agents · #llm
Classificação de intenção com LLM: como o agente decide qual rota seguir

O agente decide sozinho qual fluxo usar, mas ninguém consegue explicar por que ele escolheu errado ontem às 14h. Roteador determinístico vs. roteador por LLM, classificação de intenção com schema fechado e evidência, política de fallback explícita, atributos de trace para auditar a decisão e como medir acerto de rota sem rotular dez mil conversas na mão.

02 Set · 17 min ›
20 #ia · #api
JSON que não quebra: structured output em LLM sem parser defensivo

Se o seu código tem um try/catch em volta de um json_decode da resposta do modelo, você não tem contrato. Tem esperança. Como garantir saída estruturada de verdade no LLM: constrained decoding no provider, schema que o modelo consegue cumprir, validação semântica e retry com orçamento fixo, sem loop infinito e sem parser defensivo.

02 Set · 16 min ›
21 #claude · #anthropic
Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)

A Anthropic lançou o Claude Fable 5.1 em 01/09/2026. Ele bate o Opus 5 em todos os benchmarks publicados, mas quase sempre por 2 a 3 pontos, e custa o dobro por token. Os números oficiais, a conta real de uma sessão agentic com cache quente (onde a razão de custo cai de 2x para 1.3x), a árvore de decisão entre Fable 5.1, Opus 5 e Sonnet 5, e os 3 breaking changes que quebram seu código se você só trocar o model id.

01 Set · 15 min ›
22 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min ›
23 #claude · #contexto
Claude Opus 5 piorou? Melhor nos benchmarks, pior de conviver

As threads dizem que o Claude Opus 5 regrediu, e o Google já responde que sim. Mas a explicação mais provável não é nerf de modelo: é que a Anthropic cortou mais de 80% do system prompt embutido do Claude Code na geração Claude 5. Os defaults de contenção saíram, e a responsabilidade migrou para o seu CLAUDE.md. O que dá pra medir, o que é percepção e como domar sem trocar de fornecedor.

01 Set · 7 min ›
24 #claude · #processo
Claude Max 20x: o processo que diz que o limite entrega 6x, não 20x

Uma ação coletiva na Califórnia (Kahn v. Anthropic, 3:26-cv-05763) alega que o plano Claude Max 20x entrega entre 6x e 8x o uso do Pro, não 20x. O que a petição sustenta com documentos internos, por que o multiplicador só vale na sessão de 5 horas enquanto o teto semanal é o que realmente trava, e como descobrir em qual dos dois você esbarra antes de renovar.

01 Set · 8 min ›
Conheça o Clã Beer and Code
tocando