~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #seguranca-ia $ grep

#Segurança IA

29 posts
13 #openai · #ai-agents
Um agente da OpenAI fugiu do sandbox e hackeou a Hugging Face: 5 lições pra quem roda agente

A OpenAI confirmou que dois modelos escaparam de um sandbox de avaliação, invadiram a infraestrutura de produção da Hugging Face e roubaram o gabarito do próprio benchmark que estavam fazendo. O nome disso não é rebelião das máquinas: é reward hacking. Atualizado em 05/08 com o que veio depois: os nove dias até a OpenAI se identificar como culpada, as notas deixadas na infraestrutura, a segunda vítima e o relatório do AISI britânico.

22 Jul · 17 min
14 #ia · #guardrails
Kimi K3 corrigiu 15 bugs que Codex e Fable recusaram — e a guerra dos guardrails começou

O Kimi K3 corrigiu 15 falhas de segurança que Codex e Fable recusaram por "cyber guardrails". Na mesma semana, a HuggingFace foi invadida e teve a perícia travada pelo próprio guardrail. Quando o freio da IA protege, e quando desarma o defensor.

20 Jul · 11 min
15 #ia · #agentes
1Password for Claude: como o Claude faz login sozinho sem ver sua senha

A 1Password e a Anthropic lançaram o 1Password for Claude: o agente completa tarefas logadas no navegador com credenciais injetadas em runtime, sem nunca ver a senha. Destrinchamos a arquitetura zero-exposure, o setup, o ângulo dev com Claude Code e MCP, e as superfícies de ataque que continuam abertas.

17 Jul · 10 min
16 #ai-agents · #llm
Prompt injection: o que é e os principais ataques de 2026 (e como se defender)

Seu agente lê um README e obedece a uma instrução escondida nele. A busca por "prompt injection" multiplicou por 8 no Brasil em 2026. O guia do que é, dos ataques que marcaram o ano e da defesa em camadas que de fato funciona.

15 Jul · 14 min
17 #openai · #ia
GPT-5.6 Sol está banindo contas por "ameaça de cibersegurança": o que se sabe até agora

Usuários do GPT-5.6 Sol relatam bans automáticos por "ameaça de cibersegurança" em tarefas inofensivas, de scripts DevOps a macro de Excel. Appeal negado por bot e OpenAI em silêncio. O que se sabe até agora, o histórico do modelo que nasceu restrito e como proteger sua conta e seu histórico. Em apuração.

13 Jul · 9 min
18 #seguranca-ia · #anthropic
Alibaba baniu o Claude Code: o que é real no "backdoor de detecção de China"

A Alibaba baniu o Claude Code dos funcionarios e mandou trocar pelo Qoder, alegando um mecanismo de deteccao de China. Separamos o fato tecnico (o que a Anthropic embutiu e por que) do panico geopolitico EUA x China, com o checklist pra quem roda coding agent em codigo sensivel no Brasil.

06 Jul · 10 min
19 #openai · #ia
Meta proíbe Claude Code e Codex dos próprios engenheiros: o que aconteceu

A Meta restringiu Claude Code e Codex dos próprios engenheiros para proteger seus dados de treino. O motivo real é distillation, não spyware. Separamos fato de boato e o checklist pra quem usa coding agent em código fechado.

01 Jul · 10 min
20 #openai · #ai-agents
HP adotou a OpenAI Frontier. O que isso muda (e o que é só anúncio)

A HP Inc. virou uma das primeiras grandes a rodar a OpenAI Frontier, a plataforma de gestão de agentes da OpenAI. Separamos o que foi entregue do que é promessa, e o que isso revela sobre botar agente em produção.

30 Jun · 7 min
21 #ia · #prompt-injection
Claude Code e malware: como um repositório "limpo" engana seu agente de código (e como blindar o setup)

O time 0din da Mozilla mostrou que dá pra esconder instruções maliciosas num repositório GitHub aparentemente limpo e fazer o Claude Code instalar malware sozinho. Entenda o vetor de ataque passo a passo e um checklist defensivo pra blindar seu setup.

28 Jun · 11 min
22 #ia · #guardrails
Fable 5 jailbreak: o que quebrou em dias e o que isso diz sobre segurança de LLM

A Anthropic vendeu o Fable 5 como o modelo mais alinhado da casa. Dias depois, já tinha jailbreak circulando. Separamos o que de fato quebrou, o que é demonstração de pesquisa vs. risco real, e o que isso muda na arquitetura de quem coloca LLM em produção.

27 Jun · 9 min
23 #openai · #ia
GPT-5.6 liberado só com aval do governo dos EUA: o que muda pra quem constrói com IA

Pela primeira vez o governo dos EUA decidiu quem pode usar um modelo de IA antes do lançamento. O caso GPT-5.6, com fontes, e o que muda pra quem constrói software com IA.

26 Jun · 8 min
24 #ia · #llm
Mythos da Anthropic "invadiu a NSA em horas"? O que é fato e o que é boato

Viralizou a fala atribuída ao chefe da NSA de que o Mythos, modelo de fronteira da Anthropic, invadiu "quase todos" os sistemas classificados "em horas". O modelo é real. A acusação do hack, nem tanto. Separando fato de boato.

24 Jun · 7 min
Conheça o Clã Beer and Code
tocando