~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã ›
~ / noticias / pewdiepie-openai-ajax-destilacao $
Notícias

PewDiePie banido pela OpenAI duas vezes: o que é destilação e o que o Ajax tem a ver com isso

LS Lucas Souza · · 10 min de leitura
PewDiePie banido pela OpenAI duas vezes: o que é destilação e o que o Ajax tem a ver com isso

PewDiePie foi banido pela OpenAI. Duas vezes. O maior youtuber individual do planeta resolveu treinar o próprio modelo de IA, o Ajax, e no meio do caminho perdeu a conta.

O motivo, segundo o próprio PewDiePie, veio escrito no e-mail: destilação. Ele usou a saída de um modelo da OpenAI para montar os dados de treino do Ajax, um modelo local de 9 bilhões de parâmetros que roda em placa de vídeo de casa.

Neste post você vai ver o que aconteceu de fato no caso PewDiePie x OpenAI, o que é destilação de modelo, como a OpenAI detecta esse padrão (ela publicou um relatório sobre isso dois dias antes), o que tem dentro do Ajax e onde fica a linha entre dado sintético legítimo e ban na sua conta.

TL;DR

  • O que aconteceu: PewDiePie diz que a OpenAI baniu a conta dele, devolveu após recurso e baniu de novo. Um dos e-mails cita "distillation".
  • O modelo: Ajax, um fine-tuning do Qwen 3.5 9B feito para o Odysseus, o workspace de IA self-hosted dele. Recusas removidas com o Heretic.
  • Custo/Acesso: pesos ainda não publicados. A página oficial diz "coming soon", sem licença definida.
  • Por que importa pra você: gerar dado de treino com API de terceiro é a mesma atividade que derrubou a conta dele. E a detecção ficou muito melhor nos últimos meses.

O que aconteceu: PewDiePie banido pela OpenAI duas vezes

O Felix Kjellberg apresentou o Ajax esta semana. É um modelo ajustado por ele para rodar dentro do Odysseus, o ambiente self-hosted que ele vem construindo: interface, memória, arquivos, e-mail, calendário, agentes.

Para treinar, ele precisava de dados-semente. Exemplos de boa qualidade de um modelo forte resolvendo tarefas. E foi buscar isso na OpenAI.

A sequência, segundo o Tom's Hardware e o Free Press Journal:

  1. A OpenAI baniu a conta. Um dos e-mails cita explicitamente "distillation".
  2. Ele recorreu. A conta voltou.
  3. Ele rodou o processo de novo para gerar os dados-semente. Segundo ban.

A reação dele ao segundo: "How did they even know?". Como eles sabiam?

Dois avisos antes de seguir. Primeiro: tudo isso é o relato dele. A OpenAI não comentou o caso publicamente. Segundo: no X circula que o modelo destilado foi o GPT-6.1 Sol e que ele usou um truque para ler o raciocínio escondido. As reportagens que eu li falam em "um modelo da OpenAI" e em "um método que ele encontrou para extrair mais informação", sem nomear o modelo. Trate o detalhe como não confirmado.

O que é destilação de modelo (e por que o raciocínio vale mais que a resposta)

Destilação é treinar um modelo menor, o aluno, usando as saídas de um modelo maior, o professor. Você manda milhares de tarefas para o professor, guarda as respostas e usa esse material como dataset de treino do aluno.

É técnica antiga e legítima. Todo lab faz isso com os próprios modelos. É assim que nasce um modelo "mini" a partir de um grande.

O problema começa quando o professor é de outra empresa.

Os termos de uso da OpenAI proíbem duas coisas que, juntas, descrevem exatamente esse pipeline: extrair saída de forma automatizada e usar essa saída para desenvolver modelos que concorram com os dela. Não importa se você é um lab chinês com 15 mil contas ou um youtuber com uma.

E tem uma camada a mais. A resposta final de um modelo ensina o aluno a acertar. O raciocínio intermediário, o chain-of-thought, ensina o aluno a pensar. É por isso que os labs escondem ou criptografam essa parte. E é por isso que quem destila corre atrás dela.

Esse é o tipo de coisa que separa usar IA de construir com IA: quem só consome API nunca precisou saber de onde vem um dataset de treino, e quem treina modelo esbarra em licença, termos de uso e detecção logo na primeira semana. É nessa segunda turma que a gente trabalha no Clã Beer and Code, e é pago, é assinatura, sem rodeio.

Como a OpenAI sabia: o relatório publicado dois dias antes

A pergunta do PewDiePie tem resposta. E ela saiu em 30 de setembro, quando a OpenAI publicou Disrupting a coordinated model-distillation campaign.

Os números do relatório, resumidos pelo The Hacker News:

Dado Valor
Início da atividade 1º de julho de 2026
Pico 24 e 25 de julho: 16 mil requisições de mais de 4 mil usuários
Contas mapeadas no padrão mais de 15 mil
Campanha encerrada 28 de julho
Atribuição "núcleo" ligado a pessoas associadas à Moonshot AI, criadora do Kimi

A técnica é a parte que interessa. Ninguém quebrou criptografia nem invadiu banco de dados. Os operadores pegavam o raciocínio criptografado de uma conversa, injetavam em outra e pediam para o modelo decodificar e repetir. O que deveria ficar escondido saía legível.

A OpenAI diz que fechou esse caminho de replay e adicionou checagens para detectar o padrão no output em streaming.

Agora junte as duas histórias. A OpenAI passou o trimestre construindo detector de extração de raciocínio por causa de uma campanha em escala industrial. O detector não pergunta quantos inscritos você tem. Um pipeline individual que repete o mesmo padrão de prompt cai na mesma rede.

Não é só a OpenAI. Em setembro, a Anthropic acusou a mesma Moonshot de repassar requisições do Claude e reter as trocas para treinar modelo próprio. A gente já tinha coberto o lado geopolítico disso quando os EUA ameaçaram sancionar a IA chinesa open source.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

O Ajax por dentro: Qwen 3.5 9B, GRPO e 11 GB de VRAM

O que se sabe do modelo, segundo a Popular AI e a página oficial:

Item Detalhe
Base Qwen 3.5 9B
Treino fine-tuning supervisionado + reforço com GRPO em tarefas do Odysseus
Dataset traces bem-sucedidos do Odysseus: documentos, e-mail, notas, calendário, pesquisa, arquivos
VRAM cerca de 22 GB em BF16, 11 GB em FP8; quantizado deve pedir menos
Contexto 262 mil tokens (herdado do Qwen 3.5 9B)
Função agente sempre ligado: busca, navegação, e-mail e agenda, rodando local
Licença não definida

Sobre desempenho, o único número é dele: uma versão inicial completava a tarefa "cerca de nove em cada dez vezes". Não é benchmark reproduzível. Não tem avaliação independente.

A arquitetura da ideia é boa, e vale separar isso do drama. Um modelo pequeno, especializado num conjunto fechado de ferramentas, treinado em traces reais do próprio ambiente. É o caso raro em que fine-tuning faz sentido, como a gente discutiu em fine-tuning, RAG ou prompt. O problema não foi treinar. Foi de onde veio parte do dado.

O que o Heretic faz

O Ajax vem com a recusa "ablated". A ferramenta usada foi o Heretic, open source.

Ele não é jailbreak de prompt. É cirurgia nos pesos. O Heretic identifica, nas ativações internas, a direção associada ao comportamento de recusa e altera os pesos para neutralizá-la. O diferencial é automatizar o ajuste: um otimizador busca os parâmetros que minimizam ao mesmo tempo o número de recusas e a divergência em relação ao modelo original.

Na prática: o modelo para de dizer "não posso ajudar com isso" e continua se comportando quase igual no resto.

O que isso muda no seu pipeline

Você provavelmente não vai treinar um modelo de 9B esta semana. Mas é bem provável que você já gere dado sintético com API de terceiro: dataset de eval, exemplos few-shot, dados para treinar um classificador.

Onde fica a linha:

Atividade Risco
Gerar casos de teste para o seu eval baixo
Gerar exemplos para classificador de intenção interno baixo a médio; leia os termos do seu plano
Gerar em massa pares pergunta/resposta para fine-tuning de LLM próprio alto
Tentar extrair raciocínio escondido do modelo é o que deu ban
Fazer qualquer um dos acima pela conta de consumidor, com automação pior ainda: os termos de consumidor são os mais restritos

Três regras práticas:

  1. Separe a conta. Pipeline de geração de dados não roda na mesma conta, nem na mesma chave, do seu produto em produção. Ban em uma não pode derrubar a outra.
  2. Use professor de pesos abertos quando o destino é treino. Um Qwen, DeepSeek ou Kimi rodando local não tem termo de uso que proíba destilar. A licença do modelo é o que vale. Se você nunca subiu um, comece pelo passo a passo de LLM local.
  3. Guarde a origem de cada exemplo. Se um dia você publicar ou vender o modelo, alguém vai perguntar de onde veio o dataset.

Limitações e pontos de atenção

A história tem uma fonte só. O relato dos bans é do PewDiePie. A OpenAI não confirmou nem o motivo nem o método.

Não tem modelo para testar. Enquanto os pesos não saem, qualquer afirmação sobre a qualidade do Ajax é propaganda. Uma das fontes fala em publicação na noite de 2 de outubro, horário de Brasília. A página oficial não promete data.

Agente sem recusa com acesso ao seu e-mail é superfície de ataque. Um modelo que não recusa nada, lendo página da web e mexendo em calendário, é o cenário de manual para prompt injection. A recusa do modelo nunca foi defesa suficiente, mas tirar essa camada exige compensar com permissão e sandbox. É a mesma tensão que apareceu quando o Kimi K3 corrigiu bugs que Codex e Fable recusaram.

Sem licença, sem uso comercial. Fine-tuning herda a licença da base e ainda depende da licença que o autor colocar por cima. Hoje não tem nenhuma.

FAQ rápido

O que é o Ajax do PewDiePie? É um fine-tuning do Qwen 3.5 9B feito para operar o Odysseus, o workspace de IA self-hosted dele. A proposta é um agente sempre ligado que cuida de busca, e-mail e agenda rodando na sua máquina, sem mandar dado para a nuvem.

Por que a OpenAI baniu o PewDiePie? Segundo ele, por destilação: usar a saída de um modelo da OpenAI para treinar outro modelo. Os termos de uso proíbem extração automatizada de output e uso desse output para desenvolver modelos concorrentes. A OpenAI não comentou o caso.

Destilação é ilegal? Não é crime por si só. É violação de contrato quando os termos do provedor proíbem, e a consequência prática é ban de conta. Destilar um modelo de pesos abertos, respeitando a licença dele, é permitido.

Dá para rodar o Ajax numa placa de 12 GB? Pelos números divulgados, a versão FP8 pede cerca de 11 GB de VRAM, então fica no limite. Versões quantizadas devem caber com folga, mas ainda não foram publicadas.

Conclusão

O caso é divertido de contar: um youtuber treinando modelo em casa e levando ban de um lab de trilhões. Mas a parte útil é outra. Os labs fecharam o cerco contra extração de raciocínio em 2026, e a mesma detecção que pegou uma campanha de 15 mil contas pega um script rodando numa conta só.

O próximo passo dessa briga é previsível: mais raciocínio escondido, mais detecção de padrão, e mais gente migrando o papel de professor para modelos de pesos abertos.

Se a ideia de treinar um modelo próprio te animou, leia antes o guia de fine tuning e de quando não usar. Na maioria dos casos, você não precisa.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando