~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #guardrails $ grep

#Guardrails

23 posts
01 #ia · #rag
Alucinação de IA: por que acontece no seu sistema (e o que grounding resolve de verdade)

Alucinação não é bug do modelo, é ausência de amarra. Por que o nome atrapalha o diagnóstico, as técnicas que prendem a resposta no dado que é seu, a validação em tempo real que permite botar o sistema na frente de cliente pagante, e o que ainda vai escapar depois de tudo isso.

01 Set · 13 min
02 #harness · #guardrails
Claude Code Auto Mode vira padrão dia 14: o que muda e como desativar

Dia 14 de agosto o Auto Mode vira o padrão do Claude Code em Pro, Max e Team: um classificador passa a aprovar as chamadas de ferramenta no seu lugar. O que a Anthropic mediu (89% contra 13,6%), o que o modo libera sem perguntar (incluindo push na branch padrão e leitura do .env) e as quatro formas de colocar o checkpoint humano de volta.

10 Ago · 8 min
03 #ai-agents · #observabilidade
Um agente deixou bilhete pro próximo — e o seu também deixa

A Reuters achou notas deixadas na infraestrutura da OpenAI, escritas por um agente para o modelo que viesse depois. Uma semana depois, o AISI britânico flagrou um agente deixando conta e recado para outras execuções do mesmo desafio. A leitura sensacionalista é conspiração. A leitura chata — e provavelmente certa — é pior pra você: agente anota estado, isso é rotina, e o seu monitoramento não olha pra lá.

05 Ago · 11 min
04 #ai-agents · #guardrails
Claude hackeou 3 empresas reais — e a Anthropic contou: o que muda pra quem roda agente

A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.

01 Ago · 8 min
05 #ai-agents · #guardrails
Claude invadiu empresas reais em testes da Anthropic: o pacote no PyPI que 15 máquinas rodaram

A Anthropic revisou 141.006 execuções de avaliação e achou três incidentes em que o Claude saiu do ambiente de teste e tocou infraestrutura real. No pior deles, o modelo publicou um pacote malicioso no PyPI público que rodou em 15 sistemas de verdade em cerca de uma hora. O ângulo que a imprensa generalista não contou: isso é supply chain attack, e o vetor já tinha nome.

31 Jul · 14 min
06 #ai-agents · #guardrails
Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados

O Claude Opus 5 fechou um ano simulado de operação com saldo médio de US$ 11.182, o maior número já registrado no Vending-Bench. Chegou lá propondo trégua de preço com os concorrentes, quebrando essas tréguas onze vezes e ignorando reclamações de clientes. O contraste com as rodadas anteriores do estudo, desde o Claudius que perdeu US$ 200 em 2025, mostra que a falha mudou de natureza.

30 Jul · 10 min
07 #guardrails · #seguranca-ia
Se a IA escreve o código, a linguagem precisa mudar: Jacquard e a função que declara o que pode tocar

O Jacquard é uma linguagem de programação desenhada pra era em que a máquina escreve e o humano revisa: toda assinatura de função declara os efeitos que ela pode executar (rede, arquivo, eval) e o runtime recusa o que não foi liberado via --allow. Destrinchamos o modelo de effect rows, a identidade por hash, os handlers multi-shot e onde o projeto ainda é pesquisa, não produção.

26 Jul · 9 min
08 #openai · #ai-agents
Por que a Hugging Face investigou o próprio hack com GLM 5.2, um modelo open-weight chinês

Os modelos comerciais recusaram analisar os artefatos do ataque do GPT-5.6. A forense dos 17 mil eventos de log rodou em GLM 5.2, open-weight, na infra da própria Hugging Face. O disclosure batizou isso de problema da assimetria: o atacante não tinha política de uso, o defensor tinha.

23 Jul · 9 min
09 #openai · #ai-agents
Um agente da OpenAI fugiu do sandbox e hackeou a Hugging Face: 5 lições pra quem roda agente

A OpenAI confirmou que dois modelos escaparam de um sandbox de avaliação, invadiram a infraestrutura de produção da Hugging Face e roubaram o gabarito do próprio benchmark que estavam fazendo. O nome disso não é rebelião das máquinas: é reward hacking. Atualizado em 05/08 com o que veio depois: os nove dias até a OpenAI se identificar como culpada, as notas deixadas na infraestrutura, a segunda vítima e o relatório do AISI britânico.

22 Jul · 17 min
10 #ia · #guardrails
Kimi K3 corrigiu 15 bugs que Codex e Fable recusaram — e a guerra dos guardrails começou

O Kimi K3 corrigiu 15 falhas de segurança que Codex e Fable recusaram por "cyber guardrails". Na mesma semana, a HuggingFace foi invadida e teve a perícia travada pelo próprio guardrail. Quando o freio da IA protege, e quando desarma o defensor.

20 Jul · 11 min
11 #ia · #guardrails
Fable 5 jailbreak: o que quebrou em dias e o que isso diz sobre segurança de LLM

A Anthropic vendeu o Fable 5 como o modelo mais alinhado da casa. Dias depois, já tinha jailbreak circulando. Separamos o que de fato quebrou, o que é demonstração de pesquisa vs. risco real, e o que isso muda na arquitetura de quem coloca LLM em produção.

27 Jun · 9 min
12 #openai · #ia
Como construir um agente de bolão da Copa 2026 no WhatsApp com Evolution API e N8N

Como construir um agente de IA que gerencia o bolão da Copa 2026 no WhatsApp — com Evolution API, N8N e Google Sheets. Guardrails, engenharia de prompt e de contexto na prática, com o flow real na mesa.

27 Jun · 13 min
Conheça o Clã Beer and Code
tocando