~/beer-and-code
~ / noticias / codex-contexto-reduzido $
Notícias

Codex com contexto reduzido: OpenAI cortou de 372k pra 272k sem avisar

LS Lucas Souza · · 9 min de leitura
Codex com contexto reduzido: OpenAI cortou de 372k pra 272k sem avisar

Seu Codex ficou mais esquecido de repente? Não é impressão: o Codex está com o contexto reduzido de verdade. Numa atualização de 19 de julho, a OpenAI baixou o contexto efetivo do modelo do Codex de 372k para 272k tokens — 100 mil tokens a menos, sem release note, sem aviso de depreciação, sem uma linha de changelog dedicada.

A mudança entrou escondida no metadado de um modelo, dentro de um PR de release normal. Quem percebeu foi a comunidade: o thread no Hacker News bateu 355 pontos com gente relatando que sessões longas começaram a "cortar" mais cedo, o agente esquecendo o começo da tarefa no meio do caminho.

Esse post é curto e factual. O que foi cortado, por que dói em sessão longa e monorepo, como confirmar que você foi afetado e os workarounds que existem hoje. Nada de teoria da conspiração — é engenharia de contexto e conta de token.

TL;DR

  • O que é: o contexto efetivo do modelo bundled do Codex (GPT-5.6) caiu de 372k para 272k tokens de input, mais 128k reservados pra output. Janela total continua 400k.
  • Quando: update do Codex de 19 de julho de 2026, via metadado no PR do repositório openai/codex.
  • Custo/Acesso: o corte não é só de tamanho. Acima de 272k o request passa a ser cobrado 2x no input e 1.5x no output — na chamada inteira, não só no excedente.
  • Link útil: discussão original no Hacker News e a issue de regressão #32806.

Codex com contexto reduzido: o que exatamente mudou

O número seco: o contexto de input que o Codex expõe pro GPT-5.6 foi de 372.000 para 272.000 tokens. Somando os 128k reservados pra saída, a janela total do harness continua em 400k. Ou seja: você não perdeu a janela inteira, perdeu 100k de espaço útil pra colocar código, histórico da conversa e resultado de ferramenta.

Duas coisas importam aqui.

Primeiro: o GPT-5.6 em si não mudou. O spec do modelo continua anunciando 1.050.000 de contexto com 128k de output máximo. O que a OpenAI mexeu foi no catálogo bundled do Codex — a fatia do modelo que o harness entrega no seu plano. Traduzindo: o modelo aguenta mais, o Codex é que passou a te dar menos.

Segundo: não teve anúncio. Nada de blog post, nada de nota de depreciação, nada de guia de migração. A mudança apareceu no metadado de modelo que veio junto de um PR de release comum no openai/codex. Quem foi atrás confirmou olhando o próprio catálogo do CLI. Não é boato — está no metadado que o binário lê.

Vale registrar que isso não é a primeira vez. A issue #32806 documenta um corte parecido no GPT-5.6 Sol, de 353k pra 258k efetivos, apesar do modelo anunciar 1.05M. O padrão se repete: spec grande no papel, catálogo apertado na prática.

O pulo do gato não é o tamanho — é o preço

Aqui está a parte que a maioria não viu. O corte de 372k pra 272k não é só "cabe menos código". É uma linha de preço.

A explicação de um engenheiro da OpenAI (o Tibo) que circulou no thread deixa claro: requests que passam de 272k tokens são cobrados a 2x no input e 1.5x no output — e o multiplicador vale pra chamada inteira, não só pro que passou do limite. Então o 272k não é um teto rígido, é o ponto onde a tarifa dobra. Muitos harnesses de terceiros ainda estão configurados com 372k como janela e vão te empurrar pra faixa cara sem avisar, queimando sua quota mais rápido do que deveriam.

E é aqui que preciso ser explícito pra não confundir dois assuntos que a galera mistura: isso não é limite de uso, é limite de contexto. Limite de uso é quantas horas/mensagens você pode mandar antes de bater a parede da assinatura — a OpenAI mexeu nisso semanas atrás, e eu destrinchei a conta em Codex: OpenAI remove o limite de uso de 5 horas. Contexto é quanta informação cabe dentro de uma única chamada. São eixos diferentes. Um corta a duração da sua sessão; o outro corta a memória do agente dentro dela. Este post é só sobre o segundo.

Onde dói: sessão longa e monorepo

Se você usa Codex pra tarefinha curta — corrige um bug, escreve um teste, refatora uma função — provavelmente nem sente. Raramente uma tarefa dessas passa de 100k tokens.

O corte machuca em dois cenários:

Sessão longa. Aquela conversa de duas horas com o agente, onde ele foi acumulando contexto: o arquivo que você abriu no começo, a decisão de arquitetura que vocês tomaram na metade, os cinco resultados de grep que ele rodou. Com 372k dava pra segurar boa parte disso na memória. Com 272k, o teto chega 100k antes.

E aí entra o vilão silencioso: a auto-compaction. Quando sobra 10-20% de contexto, o Codex dispara uma compactação automática — resume a conversa pra liberar espaço. O problema, como relataram vários no HN, é que não dá pra desabilitar e não dá pra voltar pro estado anterior à compactação. O agente "esquece" detalhes e você não tem botão de undo. Com o teto mais baixo, essa compactação dispara mais cedo e com mais frequência. É literalmente o "ficou mais esquecido" que você sentiu.

Monorepo. Codebase grande, muitos arquivos relevantes pra uma mesma tarefa. Se seu fluxo despeja meia dúzia de arquivos longos + histórico no contexto, 100k a menos é a diferença entre o agente enxergar o repositório inteiro relevante ou trabalhar cego pela metade — ou te jogar direto na faixa de preço 2x.

Como confirmar que você foi afetado

Não fica no achismo. O próprio CLI te diz qual janela ele está usando. Roda:

codex debug models

Isso lista os modelos do catálogo com os limites que o binário está aplicando agora. Procura o context_window (ou max_context) do modelo bundled do seu plano. Se aparecer 272000 onde antes você via 372000, é isso — você está no catálogo novo.

Pra quem gosta de filtrar direto:

codex debug models | jq '.[] | {model: .id, context: .context_window}'

Se o número bater em 272k, qualquer sessão que passar disso vai compactar mais cedo e, se cruzar o limite numa mesma chamada, entra na tarifa dobrada.

Workarounds que existem hoje

Não tem botão mágico pra devolver os 100k. Mas dá pra reduzir o estrago:

  • Controle a compactação. No config.toml você consegue ajustar o model_auto_compact_token_limit pra decidir quando a compactação dispara, em vez de aceitar o default. Não devolve espaço, mas te dá previsibilidade.
  • Quebre a tarefa em subagentes. Em vez de uma sessão gigante que acumula tudo, divida em tarefas modulares menores, cada uma com contexto próprio e enxuto. É a prática que mais segura o problema na raiz — e que já era boa engenharia de contexto antes desse corte.
  • Vigie a barra de contexto. Fique de olho no consumo e feche/reinicie a sessão antes de chegar na zona de compactação automática. Sessão limpa toda hora perde continuidade, mas evita o "esquecimento" no meio de algo crítico.
  • Cuidado com harness de terceiro. Se você usa Codex por dentro de outra ferramenta, confirme qual janela ela assume. Muitas ainda estão em 372k e vão te empurrar pra faixa de preço 2x sem piscar.

Nenhum desses é solução definitiva. O Tibo classificou a compactação atual como medida temporária, o que sugere que a experiência ainda vai mudar. Até lá, engenharia de contexto deixou de ser luxo e virou sobrevivência.

FAQ rápido

Meu GPT-5.6 na API também caiu pra 272k? Não. O spec do modelo continua 1.05M de contexto com 128k de output. O corte é no catálogo bundled do Codex, não no modelo cru que você chama pela API.

Por que minha conta de token subiu sem eu usar mais? Provavelmente você cruzou os 272k numa chamada. Acima disso o input é cobrado 2x e o output 1.5x — na chamada inteira. Antes, com o teto em 372k, o mesmo request ficava na faixa normal.

Dá pra voltar pro contexto de 372k? Não pelo caminho oficial. O catálogo é o que o binário aplica. Dá pra mitigar controlando a compactação e quebrando tarefas, mas não pra "reativar" os 372k.

Isso é a mesma coisa que o limite de uso que a OpenAI mexeu antes? Não, e é comum confundir. Limite de uso é duração da assinatura; contexto é memória dentro da chamada. A história do limite de uso está em Codex: OpenAI remove o limite de uso de 5 horas.

Conclusão

O resumo é seco: a OpenAI cortou 100k tokens de contexto do modelo bundled do Codex — de 372k pra 272k — sem release note, e transformou o antigo teto numa linha onde o preço dobra. Se você trabalha em sessão longa ou monorepo, roda codex debug models, confirma o número e ajusta seu fluxo pra não ser pego pela compactação nem pela tarifa 2x.

O que essa história ensina vale além do Codex: quem entende engenharia de contexto não fica refém do teto do fornecedor. Saber quando compactar, o que manter na janela, como quebrar em subagentes — isso é o que separa o dev que só reclama do corte do dev que continua produzindo com 272k. É exatamente esse tipo de discussão prática — com a conta na mão, sem hype — que rola toda semana no Clã Beer and Code, a maior comunidade de engenharia de IA do Brasil, entre mentorias ao vivo, labs e gente construindo agente em produção de verdade.

E se você ainda está decidindo qual assinatura de coding agent compensa depois de todas essas mexidas, vale cruzar isto com a análise de limite de uso do Codex — porque tamanho de contexto e limite de uso, juntos, é que fecham a conta real de quanto você vai pagar.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

tocando