#Codex
A Meta lançou o Muse Code em beta, agente de terminal rodando o Muse Spark 1.2. O gráfico diz 82,9% no Terminal-Bench e vitória sobre o Codex. Fui ler o gráfico: a Meta bateu o GPT-5.6 Terra, não o GPT-5.6 Sol que o Codex realmente usa, e perdeu pro Claude Opus 5 nos três benchmarks do próprio anúncio. O que sobra de real, a arquitetura de worktrees e event log que vale copiar, e o preço de US$ 0,30 por milhão que você paga com o seu código.
Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.
Varremos a documentação oficial nova do Codex (learn.chatgpt.com) e condensamos as 10 boas práticas que a própria OpenAI recomenda: prompting por resultado, AGENTS.md vivo, permissões restritas, escolha de modelo, skills, cloud e automação.
A OpenAI baixou o contexto efetivo do modelo do Codex de 372k para 272k tokens numa atualização silenciosa e transformou o antigo teto numa linha onde o preço dobra. O que foi cortado, por que dói em sessão longa e monorepo, como confirmar que você foi afetado e os workarounds que existem hoje.
A OpenAI lançou seu primeiro hardware: o Codex Micro, um macropad de US$ 230 pra controlar agentes do Codex — e ele esgotou em horas. Specs, o uso real na supervisão de múltiplos agentes e a conta honesta de se vale a pena comprar.
O GPT-5.6 está no Codex desde 9 de julho, nos três tiers. O modo Ultra coordena quatro subagents que cooperam durante a tarefa e rende 3 pontos no Terminal-Bench (88,8% para 91,9%), a um custo de tokens bem maior. E o teste independente da CodeRabbit derruba o reflexo de escolher o tier barato: o Terra gastou 2,6x mais tokens que o Sol para passar 40,7% das tarefas contra 63,7%. Preço por token não é preço por tarefa.
A OpenAI removeu o limite de 5 horas do Codex sem aviso e a Anthropic respondeu em horas, estendendo o aumento de 50% no limite semanal do Claude Code até 19 de julho. O que exatamente mudou, o que continua travado e como decidir qual assinatura compensa agora — com a conta na mão.
A Meta restringiu Claude Code e Codex dos próprios engenheiros para proteger seus dados de treino. O motivo real é distillation, não spyware. Separamos fato de boato e o checklist pra quem usa coding agent em código fechado.
O Codex tem um sink de log em SQLite que roda em TRACE global e grava ~640 TB/ano, o suficiente pra queimar a vida útil de um SSD de 1 TB em menos de um ano. E ele ignora o RUST_LOG. Entenda a causa, diagnostique e pare o sangramento com uma linha.
Claude Code ou Codex? A resposta tem número: o Codex abre 13 pontos no Terminal-Bench (82,7% contra 69,4%) e o Claude Code abre 10 no SWE-bench Pro (69,2% contra 58,6%), que é o benchmark do problema multi-arquivo de verdade. No SWE-bench Verified empatam. Aqui está o veredito por cenário, o custo real por dev e o critério que importa mais que qualidade: quanto controle você quer durante a tarefa.
O recurso /goal do Codex CLI faz o agente da OpenAI perseguir um objetivo sozinho. Aprenda a escrever um goal como contrato — com escopo, verificação e condição de parada — em vez de um prompt com esperança embutida.