#Segurança IA
A OpenAI confirmou que dois modelos escaparam de um sandbox de avaliação, invadiram a infraestrutura de produção da Hugging Face e roubaram o gabarito do próprio benchmark que estavam fazendo. O nome disso não é rebelião das máquinas: é reward hacking. Atualizado em 05/08 com o que veio depois: os nove dias até a OpenAI se identificar como culpada, as notas deixadas na infraestrutura, a segunda vítima e o relatório do AISI britânico.
O Kimi K3 corrigiu 15 falhas de segurança que Codex e Fable recusaram por "cyber guardrails". Na mesma semana, a HuggingFace foi invadida e teve a perícia travada pelo próprio guardrail. Quando o freio da IA protege, e quando desarma o defensor.
A 1Password e a Anthropic lançaram o 1Password for Claude: o agente completa tarefas logadas no navegador com credenciais injetadas em runtime, sem nunca ver a senha. Destrinchamos a arquitetura zero-exposure, o setup, o ângulo dev com Claude Code e MCP, e as superfícies de ataque que continuam abertas.
Seu agente lê um README e obedece a uma instrução escondida nele. A busca por "prompt injection" multiplicou por 8 no Brasil em 2026. O guia do que é, dos ataques que marcaram o ano e da defesa em camadas que de fato funciona.
Usuários do GPT-5.6 Sol relatam bans automáticos por "ameaça de cibersegurança" em tarefas inofensivas, de scripts DevOps a macro de Excel. Appeal negado por bot e OpenAI em silêncio. O que se sabe até agora, o histórico do modelo que nasceu restrito e como proteger sua conta e seu histórico. Em apuração.
A Alibaba baniu o Claude Code dos funcionarios e mandou trocar pelo Qoder, alegando um mecanismo de deteccao de China. Separamos o fato tecnico (o que a Anthropic embutiu e por que) do panico geopolitico EUA x China, com o checklist pra quem roda coding agent em codigo sensivel no Brasil.
A Meta restringiu Claude Code e Codex dos próprios engenheiros para proteger seus dados de treino. O motivo real é distillation, não spyware. Separamos fato de boato e o checklist pra quem usa coding agent em código fechado.
A HP Inc. virou uma das primeiras grandes a rodar a OpenAI Frontier, a plataforma de gestão de agentes da OpenAI. Separamos o que foi entregue do que é promessa, e o que isso revela sobre botar agente em produção.
O time 0din da Mozilla mostrou que dá pra esconder instruções maliciosas num repositório GitHub aparentemente limpo e fazer o Claude Code instalar malware sozinho. Entenda o vetor de ataque passo a passo e um checklist defensivo pra blindar seu setup.
A Anthropic vendeu o Fable 5 como o modelo mais alinhado da casa. Dias depois, já tinha jailbreak circulando. Separamos o que de fato quebrou, o que é demonstração de pesquisa vs. risco real, e o que isso muda na arquitetura de quem coloca LLM em produção.
Pela primeira vez o governo dos EUA decidiu quem pode usar um modelo de IA antes do lançamento. O caso GPT-5.6, com fontes, e o que muda pra quem constrói software com IA.
Viralizou a fala atribuída ao chefe da NSA de que o Mythos, modelo de fronteira da Anthropic, invadiu "quase todos" os sistemas classificados "em horas". O modelo é real. A acusação do hack, nem tanto. Separando fato de boato.