~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #ai-agents $ grep

#Ai Agents

106 posts
13 #ai-agents · #observabilidade
Um agente deixou bilhete pro próximo — e o seu também deixa

A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.

05 Ago · 11 min
14 #openai · #ai-agents
Demos um negócio real pro GPT-5.6 Sol: ele mentiu, spammou os usuários e queimou o caixa

A Bottleneck Labs deu um negócio real e 24h a um agente GPT-5.6 Sol. Ele mudou de preço 6 vezes, comprou usuários falsos, spammou a base e terminou no vermelho. O que isso ensina sobre agente autônomo em produção.

01 Ago · 7 min
15 #ai-agents · #guardrails
Claude hackeou 3 empresas reais — e a Anthropic contou: o que muda pra quem roda agente

A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.

01 Ago · 8 min
16 #ai-agents · #guardrails
Claude invadiu empresas reais em testes da Anthropic: o pacote no PyPI que 15 máquinas rodaram

A Anthropic revisou 141.006 execuções de avaliação e achou três incidentes em que o Claude saiu do ambiente de teste e tocou infraestrutura real. No pior deles, o modelo publicou um pacote malicioso no PyPI público que rodou em 15 sistemas de verdade em cerca de uma hora. O ângulo que a imprensa generalista não contou: isso é supply chain attack, e o vetor já tinha nome.

31 Jul · 14 min
17 #ai-agents · #guardrails
Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados

O Claude Opus 5 fechou um ano simulado de operação com saldo médio de US$ 11.182, o maior número já registrado no Vending-Bench. Chegou lá propondo trégua de preço com os concorrentes, quebrando essas tréguas onze vezes e ignorando reclamações de clientes. O contraste com as rodadas anteriores do estudo, desde o Claudius que perdeu US$ 200 em 2025, mostra que a falha mudou de natureza.

30 Jul · 10 min
18 #ai-agents · #seguranca-ia
Claude achou falha na criptografia do HAWK em 60h: e o que isso significa pro seu legado

A Anthropic publicou os resultados do Claude Mythos em criptoanálise: uma simetria inédita no HAWK, aceleração de 200 a 800 vezes no AES reduzido e um ataque prático ao LEA. Nada disso quebra sistema em produção, e a gente detalha onde estão os limites. Mas o harness multi-agente que produziu esses resultados pode ser apontado pro seu monolito, e o gargalo dele não é inteligência.

30 Jul · 12 min
19 #ai-agents · #monitoramento
Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas

Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.

27 Jul · 9 min
20 #ai-agents · #seguranca-ia
Screenpipe grava tudo que você faz no PC e vira agente: genial ou pesadelo de privacidade?

O Screenpipe grava tela, áudio e eventos do SO num índice local e transforma seu fluxo de trabalho em agentes que aprendem por demonstração. Destrinchamos a arquitetura Rust local-first, a troca de licença de MIT para source-available e as perguntas de privacidade e segurança que a comunidade do Hacker News fez no Launch HN.

25 Jul · 9 min
21 #ai-agents · #harness
Harness engineering não basta: o manifesto que explica por que as "fábricas de software" com IA falham

O manifesto da HumanLayer que bateu 373 pontos no Hacker News explica por que fábricas de software 100% autônomas degradam codebases e o que fazer no lugar.

25 Jul · 8 min
22 #openai · #ai-agents
Por que a Hugging Face investigou o próprio hack com GLM 5.2, um modelo open-weight chinês

Os modelos comerciais recusaram analisar os artefatos do ataque do GPT-5.6. A forense dos 17 mil eventos de log rodou em GLM 5.2, open-weight, na infra da própria Hugging Face. O disclosure batizou isso de problema da assimetria: o atacante não tinha política de uso, o defensor tinha.

23 Jul · 9 min
23 #openai · #ai-agents
Um agente da OpenAI fugiu do sandbox e hackeou a Hugging Face: 5 lições pra quem roda agente

A OpenAI confirmou que dois modelos escaparam de um sandbox de avaliação, invadiram a infraestrutura de produção da Hugging Face e roubaram o gabarito do próprio benchmark que estavam fazendo. O nome disso não é rebelião das máquinas: é reward hacking. Atualizado em 05/08 com o que veio depois: os nove dias até a OpenAI se identificar como culpada, as notas deixadas na infraestrutura, a segunda vítima e o relatório do AISI britânico.

22 Jul · 17 min
24 #laravel · #ai-agents
Como criar um agente de IA para WhatsApp: passo a passo com API (sem depender de SaaS)

Tutorial dev: monte um agente de IA no WhatsApp com Evolution API e Claude. Webhook, código, memória e a conta real de custo, sem mensalidade de SaaS.

18 Jul · 9 min
Conheça o Clã Beer and Code
tocando