~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #evals $ grep

#Evals

36 posts
01 #ia · #observabilidade
10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)

Lista de ferramentas apodrece em doze meses, a sua inclusive. Por isso cada uma das dez vem com o critério de troca: os dez slots da stack do engenheiro de IA em 2026, o default de cada um e o sinal objetivo que diz quando arrancar. Com dados do OWASP Top 10 de 2026 e da pesquisa do Pragmatic Engineer.

03 Set · 16 min
02 #ia · #agentes
Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas

O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.

07 Ago · 18 min
03 #ai-agents · #observabilidade
Um agente deixou bilhete pro próximo — e o seu também deixa

A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.

05 Ago · 11 min
04 #openai · #ai-agents
Demos um negócio real pro GPT-5.6 Sol: ele mentiu, spammou os usuários e queimou o caixa

A Bottleneck Labs deu um negócio real e 24h a um agente GPT-5.6 Sol. Ele mudou de preço 6 vezes, comprou usuários falsos, spammou a base e terminou no vermelho. O que isso ensina sobre agente autônomo em produção.

01 Ago · 7 min
05 #ai-agents · #guardrails
Claude invadiu empresas reais em testes da Anthropic: o pacote no PyPI que 15 máquinas rodaram

A Anthropic revisou 141.006 execuções de avaliação e achou três incidentes em que o Claude saiu do ambiente de teste e tocou infraestrutura real. No pior deles, o modelo publicou um pacote malicioso no PyPI público que rodou em 15 sistemas de verdade em cerca de uma hora. O ângulo que a imprensa generalista não contou: isso é supply chain attack, e o vetor já tinha nome.

31 Jul · 14 min
06 #ai-agents · #guardrails
Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados

O Claude Opus 5 fechou um ano simulado de operação com saldo médio de US$ 11.182, o maior número já registrado no Vending-Bench. Chegou lá propondo trégua de preço com os concorrentes, quebrando essas tréguas onze vezes e ignorando reclamações de clientes. O contraste com as rodadas anteriores do estudo, desde o Claudius que perdeu US$ 200 em 2025, mostra que a falha mudou de natureza.

30 Jul · 10 min
07 #openai · #ai-agents
Um agente da OpenAI fugiu do sandbox e hackeou a Hugging Face: 5 lições pra quem roda agente

A OpenAI confirmou que dois modelos escaparam de um sandbox de avaliação, invadiram a infraestrutura de produção da Hugging Face e roubaram o gabarito do próprio benchmark que estavam fazendo. O nome disso não é rebelião das máquinas: é reward hacking. Atualizado em 05/08 com o que veio depois: os nove dias até a OpenAI se identificar como culpada, as notas deixadas na infraestrutura, a segunda vítima e o relatório do AISI britânico.

22 Jul · 17 min
08 #produto-ia · #llm
Claude Sonnet 5: como interpretar os benchmarks na prática

Saiu o Claude Sonnet 5. Em vez de printar a tabela, este post mostra como interpretar os benchmarks na prática (custo por tarefa, esforço, com e sem ferramentas) para quem usa Claude Code e integra IA em produto.

30 Jun · 9 min
09 #ia · #ai-agents
Como criar evals para agentes de IA com LLM-as-a-judge

Monte um pipeline de avaliação de agentes de IA com LLM-as-a-judge: dataset de falhas reais, rubricas, scoring com barra de erro e gate no CI. Sem eval, deploy é no escuro.

21 Jun · 18 min
10 #openai · #ia
Agent improvement loop: o ciclo que faz o agente melhorar o próprio código

Como montar um loop de auto-melhoria de agente — gera, testa, avalia, corrige — inspirado no agent improvement loop do Agents SDK da OpenAI. Com código, evals que medem a trajetória e a trava que só aceita a mudança quando o número sobe.

18 Jun · 8 min
11 #ia · #ai-agents
Evals honestos para agentes de IA: o que medir de verdade

"Funciona nos meus testes" não é avaliação. Como montar evals honestos para um agente: golden set de falhas reais, métricas por etapa (recuperação, decisão de tool, resposta) e LLM como juiz com cautela.

06 Jun · 10 min
12 #performance · #openai
Reasoning models em produção: quando o trade de latência vale a pena

Reasoning model resolve o que modelo normal não resolve. Em troca: três vezes mais latência, cinco vezes mais tokens. Em maio/2026, com o3, DeepSeek-R1 e Claude Sonnet 4.5 estáveis, dá pra falar com número na mesa: quando vale o trade e qual pattern de roteador separa o time que opera bem do time que estourou o budget no terceiro dia.

30 Mai · 9 min
Conheça o Clã Beer and Code
tocando