~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #agentic-code $ grep

#Agentic Code

20 posts
01 #harness · #llm
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek lançou o V4.1 Flash e a timeline recortou a linha boa do benchmark. Comparamos o modelo com Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e GPT-6 Astra em preço e performance, mostramos onde ele realmente lidera, onde cai 20 pontos, e o dado escondido no model card: o scaffold muda o resultado quarenta vezes mais que a troca de modelo.

10 Set · 11 min
02 #performance · #openai
GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5

Não é modelo novo. É o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato: 750 tokens/s, 44 GB de SRAM on-chip e zero preço publicado. A OpenAI anuncia 14x contra o próprio Sol Standard; a Cerebras anuncia 11x contra o Fable 5 (sem teste pareado). Aqui separamos o que é verificável do que é marketing de fornecedor, explicamos por que Sol, Ultra e Ultrafast são três coisas diferentes, e mostramos a conta que decide se latência vira dinheiro no seu agente.

15 Ago · 10 min
03 #google · #ai-agents
Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo

O Google repetiu a jogada e soltou o Flash antes do Pro. Só que o US$ 0,75/M que tomou a timeline não é preço baixo: a tabela oficial mostra que é o preço do 3.6 Flash com 50% de desconto até 31/12/2026, e a fatura dobra em 1º de janeiro. Aqui estão os dois valores, os benchmarks reais (FrontierCode 43,6%, AutomationBench 30,4%), o que quebra na migração vindo do 3.6, e o dado que o release não conta: a alucinação subiu de 55,6% para 64,5%.

15 Ago · 11 min
04 #ai-agents · #seguranca
Agentes de IA em conflito: a Anthropic deu metas rivais a 3 Claudes e eles se atacaram com malware

Três instâncias do Claude, uma VM cada, a mesma base pra migrar e nenhuma sabendo que as outras existiam. Em horas apareceu malware auto-replicante, camuflagem de health check e troca de chave SSH. Mas o malware é a isca: o achado que importa pra quem roda agente em produção é que paralelismo sem coordenação degrada de forma medível. O que o estudo mostra de verdade, o que a imprensa repetiu errado e 4 regras de infra pra você não montar esse experimento sem querer.

15 Ago · 11 min
05 #ai-agents · #produtividade
Cursor SpaceX: o que a aquisição muda no seu editor (e o que ninguém confirmou)

A Cursor confirmou em 14/08/2026 que foi adquirida pela SpaceX. O comunicado tem treze frases: fala de GPU, de modelo mais barato e de horizonte, e não fala uma palavra sobre o seu código. Separamos o que está em fonte primária do que é só imprensa (inclusive os US$ 60 bilhões), mostramos o que de fato muda dentro do editor (Grok 4.6 no pool da casa, Claude hidden by default, o Router escolhendo por você) e fechamos com o checklist pra quem depende do Cursor em produção.

15 Ago · 11 min
06 #seguranca-ia · #anthropic
Claude Code vazando email no curl: o que a issue #78431 prova e o checklist de deny rules pra fechar os 4 canais de saída

A issue #78431 do repo anthropics/claude-code mostra o agente montando comandos curl com o e-mail real do usuário no header User-Agent, sem pedir permissão. O bug report é ruim, mas o comportamento está verificado: tool_use verbatim de session log, 5 ocorrências em 1 hora. Separamos fato de ruído, mostramos os quatro canais de saída que ninguém audita e entregamos o checklist de permissions.deny e PreToolUse hook pra fechar esses canais.

12 Ago · 11 min
07 #openai · #boas-praticas
10 boas práticas para usar o Codex (direto da documentação oficial)

Varremos a documentação oficial nova do Codex (learn.chatgpt.com) e condensamos as 10 boas práticas que a própria OpenAI recomenda: prompting por resultado, AGENTS.md vivo, permissões restritas, escolha de modelo, skills, cloud e automação.

26 Jul · 8 min
08 #ai-agents · #harness
Harness engineering não basta: o manifesto que explica por que as "fábricas de software" com IA falham

O manifesto da HumanLayer que bateu 373 pontos no Hacker News explica por que fábricas de software 100% autônomas degradam codebases e o que fazer no lugar.

25 Jul · 8 min
09 #performance · #openai
OpenAI Codex bug: ele grava 640 TB/ano e pode matar seu SSD em menos de 1 ano

O Codex tem um sink de log em SQLite que roda em TRACE global e grava ~640 TB/ano, o suficiente pra queimar a vida útil de um SSD de 1 TB em menos de um ano. E ele ignora o RUST_LOG. Entenda a causa, diagnostique e pare o sangramento com uma linha.

23 Jun · 9 min
10 #ia · #llm
GLM 5.2: o melhor modelo de código open source é chinês, MIT e 6x mais barato

A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.

22 Jun · 8 min
11 #openai · #ia
Agent improvement loop: o ciclo que faz o agente melhorar o próprio código

Como montar um loop de auto-melhoria de agente — gera, testa, avalia, corrige — inspirado no agent improvement loop do Agents SDK da OpenAI. Com código, evals que medem a trajetória e a trava que só aceita a mudança quando o número sobe.

18 Jun · 8 min
12 #openai · #ia
Codex CLI: como usar goals para guiar o agente sem microgerenciar

O recurso /goal do Codex CLI faz o agente da OpenAI perseguir um objetivo sozinho. Aprenda a escrever um goal como contrato — com escopo, verificação e condição de parada — em vez de um prompt com esperança embutida.

17 Jun · 10 min
Conheça o Clã Beer and Code
tocando