GPT-5.6 no Codex: o modo Ultra rende 3 pontos, e o Terra gasta 2,6x mais tokens pra entregar pior
Atualizado em 15/08/2026. A tabela de preços foi corrigida: em 30/07/2026 a OpenAI cortou o Luna em 80% e o Terra em 20%. Os valores abaixo são os vigentes. A conta refeita está em preço do GPT-5.6 Luna caiu 80%.
Há dez dias, o story #1 do Hacker News não foi um paper nem um funding round. Foi uma frase: GPT-5.6 Sol Ultra will be in Codex. 372 pontos, e a discussão pegou fogo entre "isso muda o coding agêntico" e "isso é só um alias de prompt".
Agora virou produto. Desde 9 de julho, o GPT-5.6 está no ar — ChatGPT, API e Codex — nos três tiers: Sol, Terra e Luna. E com o lançamento vieram duas coisas que não existiam na semana do hype: tabela de preço oficial e os primeiros testes independentes. Eles contam uma história menos bonita que o marketing, e a mais útil está logo abaixo.
TL;DR
- Status: lançado em 09/07/2026, disponibilidade geral no ChatGPT, na API e no Codex. O modo Ultra coordena subagents por padrão no tier de topo.
- Preço por 1M de tokens (tabela de 30/07/2026): Sol $5 input / $30 output; Terra $2 / $12; Luna $0,20 / $1,20. O mapa de quando usar cada tier está no comparativo Sol, Terra e Luna.
- O número da OpenAI: 91,9% no Terminal-Bench 2.1 pro Sol Ultra contra 88,8% do Sol base. Três pontos.
- O número independente que muda a decisão: nos testes da CodeRabbit, o Sol passou 63,7% das tarefas de código; o Terra, só 40,7% — gastando 2,6x mais tokens que o Sol. Preço por token não é preço por tarefa.
- A diferença técnica do Ultra: subagents treinados pra cooperar e trocar mensagem durante a tarefa, em vez de rodar em paralelo isolados como no modo Pro.
O que é o Sol Ultra (e por que é "acima" do Sol)
Presta atenção nisso, porque a nomenclatura confunde de propósito.
O Sol é o modelo mais forte do GPT-5.6, com duas alavancas: max reasoning effort (pensa mais fundo antes de responder) e o modo ultra — que, na descrição oficial do lançamento, coordena quatro subagents em paralelo por padrão, capazes de escrever e executar pequenos programas pra orquestrar ferramentas sem script manual.
O "Sol Ultra" que roda no Codex é esse comportamento ultra embalado como experiência de produto. Segundo a OpenAI, a diferença pro modo Pro (que roda agentes em paralelo, cada um por conta própria) é que aqui os subagents são treinados pra cooperar e se comunicar durante a tarefa. Em vez de N tentativas independentes e um juiz escolhendo a melhor, você tem um time que divide o trabalho e conversa enquanto executa.
Thibault Sottiaux, que toca o Codex na OpenAI, resumiu o pitch com um "guarda seus prompts mais difíceis em algum lugar". Traduzindo: aguentar tarefa longa e difícil sem desmontar no meio.
O que o GPT-5.6 no Codex muda na prática
Aqui é onde importa pra quem escreve código, não pra quem lê changelog.
Codex é o agente de terminal e repositório da OpenAI. Com o Sol Ultra dentro do Codex, a orquestração de subagents deixou de ser algo que você monta na mão e virou um botão dentro da ferramenta. Três coisas mudam no dia a dia:
- Tarefa de horizonte longo sem babá. Refactor que cruza dez arquivos, migração de dependência, subir cobertura de teste de um módulo inteiro — trabalho que um agente solo perde o fio no meio. O time de subagents divide e mantém contexto por mais tempo.
- Menos "cola" de sua parte. Quem já montou pipeline com subagents na unha sabe: metade do trabalho é escrever o orquestrador. Vindo embutido, sobra tempo pra revisar o resultado em vez de costurar a plumbing.
- Automação de terminal que não pode falhar. É exatamente o eixo do Terminal-Bench, e é onde o número de 91,9% tenta te vender confiança.
O porém honesto continua o mesmo: nada disso é mágica de modelo. É orquestração. E orquestração você já conseguia fazer antes com o Sol base e um pouco de engenharia. O Ultra empacota — não inventa. Saber montar esse harness na mão é o que separa quem liga um botão de quem desenha o sistema, e é o tipo de coisa que se aprende construindo junto com quem já quebrou a cara: é o que a gente faz toda semana, ao vivo, no Clã Beer and Code.
Os primeiros testes independentes (e a pegadinha do Terra)
Essa é a parte que muda decisão, e ela contraria o reflexo da maioria.
A CodeRabbit rodou Sol e Terra na própria suíte de tarefas de código e revisão. O resultado:
- Tarefas de código: Sol passou 63,7%, gastando em média 20.968 tokens de output por tarefa. Terra passou 40,7% — gastando 55.594 tokens por tarefa.
- Revisão de código: Sol acertou 69,7% dos apontamentos acionáveis (+7,4 pontos sobre a baseline deles). Terra ficou abaixo da baseline (-8,6 pontos).
Lê de novo o primeiro bullet, porque ele é contraintuitivo: o Terra custa menos por token, mas gasta 2,6x mais tokens pra entregar um resultado pior. Preço por token não é preço por tarefa. O tier "econômico" pode sair mais caro e errado no coding agêntico — ele existe pra outro perfil de carga (volume alto, tarefa curta), não pra substituir o Sol no trabalho pesado.
É um teste, de um fornecedor, na suíte dele — não é veredito. Mas é exatamente o tipo de verificação independente que os 91,9% da OpenAI ainda não têm.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãSol Ultra vs Sol "normal": vale a conta?
Essa é a pergunta que separa dev que pensa em arquitetura de dev que só quer o "top".
O GPT-5.6 Sol custa $5 de input e $30 de output por 1M de tokens. O modo Ultra não muda a tabela — muda o consumo. Vários subagents cooperando significam mais chamadas, mais contexto trafegando, mais tokens queimados por tarefa. O ganho declarado no Terminal-Bench é de ~3 pontos percentuais (88,8% para 91,9%) por um custo que pode ser várias vezes maior.
Dois amortecedores na conta, confirmados no lançamento: o GPT-5.6 trouxe breakpoints explícitos de cache e vida mínima de 30 minutos no prompt cache — o que barateia justamente o padrão de subagents relendo o mesmo contexto. Ajuda, mas não inverte a lógica.
Faz a conta de engenheiro. Três pontos de acurácia num refactor crítico onde errar custa um incidente em produção? Vale. Três pontos numa tarefa de rotina que o Sol base já resolve? Você está pagando flagship pra fazer trabalho de médio porte. Um comentário no Hacker News capturou a ironia corporativa: a gestão primeiro elogiou quem gastava mais tokens, e semanas depois pediu pra cortar custo. O modo Ultra é lindo até a fatura chegar. Roteamento por esforço — Ultra só onde acerto vale mais que a conta — continua sendo o jeito adulto de usar isso.
Sol Ultra vs Claude Code: subagents determinísticos ou não
Como o Codex bate de frente com o Claude Code no coding agêntico, vale a comparação técnica — e ela é mais interessante do que "quem tem o benchmark maior". Se você está decidindo entre as duas ferramentas, o comparativo completo está em Claude Code ou Codex.
A diferença que apareceu na discussão do HN: o Claude Code, no modo mais pesado, gera código pra orquestrar os subagents de forma determinística — monta um workflow que você pode inspecionar e reproduzir. O modo Ultra da OpenAI deixa o modelo lançar subagents de forma não determinística, decidindo na hora.
Isso não é detalhe acadêmico. É a diferença entre um agente cujo plano você consegue auditar e um agente que decide sozinho o caminho a cada execução. Pra quem coloca isso em produção, workflow determinístico é mais fácil de testar, versionar e confiar. Não determinístico é mais flexível, mas você depende mais da sorte de o modelo escolher bem. Nenhum dos dois é "o certo" — são trade-offs diferentes, e você deveria saber qual tá comprando.
O ceticismo saudável: "ultra" é modelo novo ou prompt novo?
O balde de água fria que salvou o thread do hype segue de pé mesmo depois do lançamento.
O comentário mais votado no Hacker News argumentou que "ultra" pode não ser arquitetura nova nenhuma: seria um alias pro esforço máximo mais uma instrução pro modelo usar subagents proativamente. A documentação de lançamento descreve o comportamento (quatro agents coordenados por padrão), mas a OpenAI segue sem publicar metodologia de avaliação detalhada do modo — então a dúvida continua legítima.
Se for isso, o Sol Ultra é menos "modelo de topo" e mais "modo de operação". O que não é ruim. Só muda como você lê o marketing: você não está comprando um cérebro melhor, está comprando um comportamento de orquestração ligado por padrão. E tem uma implicação boa pra você: se é prompting + esforço + subagents, dá pra reproduzir boa parte do ganho com o Sol base e engenharia sua. O Ultra vende conveniência, não um segredo que você não conseguiria construir.
O que fazer agora
O acesso abriu — então o movimento certo deixou de ser "esperar" e virou medir. Antes de trocar o seu daily driver:
- Roda o Sol (sem Ultra) no seu repo real numa tarefa que o seu agente atual já faz. Compara resultado e custo por tarefa, não benchmark.
- Liga o Ultra só na tarefa que justifica: refactor longo, migração, dívida técnica de módulo inteiro. E olha a fatura depois.
- Ignora o reflexo de "Terra porque é mais barato" pra coding agêntico — o teste da CodeRabbit mostra por quê. Se o objetivo é cortar custo em volume alto, o tier certo é o Luna, e mesmo assim depois de eval.
O Sol Ultra no Codex é uma notícia boa pra quem programa. Mas é ferramenta, não milagre. Quem trata orquestração de agentes como decisão de arquitetura — e não como botão de "modo turbo" — vai extrair muito mais dela do que quem só liga o tier mais caro e reza.
FAQ
O que é o GPT-5.6 Sol Ultra?
É o tier de topo do GPT-5.6 no modo ultra: o Sol (modelo mais forte da OpenAI) coordenando subagents treinados pra cooperar e trocar mensagem durante a tarefa, empacotado pra rodar dentro do Codex.
Já dá pra usar o GPT-5.6 no Codex? Sim. Desde 09/07/2026 o GPT-5.6 está em disponibilidade geral no ChatGPT, na API e no Codex, com o modo Ultra no tier de topo.
Quanto custa o GPT-5.6? Por 1M de tokens, na tabela vigente desde 30/07/2026: Sol $5 input / $30 output; Terra $2 / $12; Luna $0,20 / $1,20. O modo Ultra não muda o preço unitário, mas aumenta o consumo porque roda vários subagents por tarefa.
Qual a diferença do Sol Ultra pro Sol normal?
O Sol base já raciocina fundo com max effort. O Ultra adiciona a orquestração de subagents cooperando. Ganho declarado de 88,8% pra 91,9% no Terminal-Bench 2.1, a um custo de tokens bem maior.
Vale usar o Terra pra economizar no Codex? Pelos dados da CodeRabbit, não. O Terra passou 40,7% das tarefas contra 63,7% do Sol e gastou 2,6x mais tokens no processo. Em coding agêntico, o tier intermediário sai caro e erra mais.
Sol Ultra é melhor que o Claude Code? Depende do que você valoriza. O Claude Code orquestra subagents de forma determinística (workflow auditável); o Sol Ultra deixa o modelo decidir na hora (não determinístico). Um é mais fácil de testar, o outro mais flexível.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã