~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / noticias / gpt-5-6-luna-preco-corte-80 $
Notícias

Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje

LS Lucas Souza · · 8 min de leitura
Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje

A OpenAI acabou de derrubar o preço do GPT-5.6 Luna em 80%. Três semanas depois de lançar o modelo.

Não é promoção. É preço de tabela novo, valendo agora.

E isso significa que toda tabela de custo de LLM publicada em português nas últimas semanas — inclusive a nossa — envelheceu numa tarde. Se você tem um agente rodando em produção com a conta fechada em cima do preço antigo, sua planilha está errada desde hoje de manhã. Vamos refazer a conta.

TL;DR

  • O que mudou: GPT-5.6 Luna caiu 80% e Terra caiu 20%. Sol continua no mesmo preço.
  • Luna agora: US$ 0,20 por milhão de tokens de entrada, US$ 1,20 na saída (era US$ 1 e US$ 6).
  • Terra agora: US$ 2 na entrada, US$ 12 na saída (era US$ 2,50 e US$ 15).
  • Sol: inalterado, US$ 5 na entrada e US$ 30 na saída.
  • Quando: anunciado em 30 de julho de 2026, confirmado pela CNBC e pelo Axios.
  • Por quê: ganho de eficiência na própria infraestrutura da OpenAI, incluindo código de produção reescrito pelo modelo.

O contexto: por que a OpenAI cortou preço agora

O GPT-5.6 saiu do preview em 9 de julho, em três tamanhos — Sol, Terra e Luna. A gente já destrinchou o que muda entre eles e quando usar cada um. Na época, a lógica era simples: Sol para raciocínio pesado, Terra para o meio de campo, Luna para volume.

Três semanas depois, o meio de campo encolheu.

Com Luna a US$ 0,20 de entrada, a distância entre "modelo barato" e "modelo bom" virou um abismo de preço, não de qualidade. A OpenAI está posicionando o Luna como o padrão de alto volume — e a justificativa oficial é ganho de eficiência interna, não margem sacrificada. Segundo o anúncio, a eficiência de geração de token subiu mais de 15% e a otimização de kernel derrubou em 20% o custo de servir o modelo. Parte desse trabalho foi feita pelo próprio modelo reescrevendo código de produção da OpenAI.

Guarda essa parte, porque ela é mais interessante que o desconto: a empresa está usando o modelo para baratear o modelo. Esse loop é o que torna corte de preço agressivo sustentável — e é também o motivo de você não poder mais assumir que preço de LLM é estável por trimestre. Não é. É estável por semanas.

A conta refeita: o preço do GPT-5.6 Luna e o que você paga agora

Preço por milhão de tokens, em dólar:

Modelo Entrada (antes) Entrada (agora) Saída (antes) Saída (agora)
GPT-5.6 Sol 5,00 5,00 30,00 30,00
GPT-5.6 Terra 2,50 2,00 15,00 12,00
GPT-5.6 Luna 1,00 0,20 6,00 1,20

Tabela isolada não decide nada. O que decide é a conta do seu caso de uso.

Pega um cenário comum: um agente de atendimento que processa 50 milhões de tokens de entrada e gera 10 milhões de saída por mês. Nada exótico — é uma operação de médio porte, com RAG jogando contexto no prompt.

Luna (antes):   50 × 1,00  + 10 × 6,00  = US$ 110,00/mês
Luna (agora):   50 × 0,20  + 10 × 1,20  = US$  22,00/mês
Terra (agora):  50 × 2,00  + 10 × 12,00 = US$ 220,00/mês
Sol:            50 × 5,00  + 10 × 30,00 = US$ 550,00/mês

Vinte e dois dólares. Contra cento e dez, ontem.

A diferença entre Luna e Sol nesse cenário agora é de 25 vezes. Não 5, não 8. Vinte e cinco. Isso muda a natureza da decisão de arquitetura: antes você escolhia modelo por qualidade e engolia o custo. Agora, escolher Sol para uma tarefa que Luna resolve é uma decisão que precisa ser defendida na revisão de arquitetura, com número.

E tem mais uma camada. O OpenRouter já lista o Luna com desconto promocional em cima do preço novo, saindo a US$ 0,10 de entrada e US$ 0,60 de saída no momento em que escrevo. Somando prompt caching, o piso desce mais. Se o seu prompt tem um bloco fixo grande — system prompt, few-shot, esquema de ferramentas — o cache pega a maior parte da entrada.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

O que fazer com isso na sua stack

Corte de preço não é motivo para trocar de modelo. É motivo para revisar a decisão que você tomou quando o preço era outro.

1. Reveja o roteamento, não o modelo. Se você tem um roteador mandando tarefa simples pro Terra porque Luna era "barato demais pra ter qualidade", refaz o teste. A qualidade do Luna não mudou hoje. Só o preço. Se você reprovou o Luna há três semanas por qualidade, o veredito continua valendo — não migre por preço se o eval reprovou.

2. Refaz o eval antes de migrar. Tenha um conjunto de 30 a 50 casos reais do seu domínio, com resposta esperada, e rode nos dois modelos. Sem isso, você está trocando de modelo por manchete. É o mesmo raciocínio que aplicamos quando o Opus 5 chegou custando metade do Fable 5: preço melhor só importa se o eval passar.

3. Cuidado com o fallback silencioso. Se sua aplicação tem retry apontando para um modelo mais caro quando o principal falha, o corte de preço aumenta a distância entre o caminho feliz e o caminho de exceção. Um retry que antes custava 5x agora custa 25x. Monitore taxa de fallback como métrica de custo, não só de erro.

4. Atualize a projeção, não o orçamento. Se você orçou o próximo trimestre com o preço antigo, o dinheiro que sobrou não é economia — é margem para aumentar volume ou rodar mais avaliação. A tentação de gastar o excedente com contexto maior é real, e contexto maior nem sempre melhora resposta.

Limitações e pontos de atenção

O corte vale para Luna e Terra. Sol não mudou. Se sua carga pesada roda no Sol, sua conta é exatamente a mesma de ontem.

Preço em dólar, cobrado em cartão internacional, com IOF e spread do banco. A conta que você vê na fatura não é a da tabela. Para operação brasileira, multiplique por câmbio mais uns 6% a 7% de atrito e planeje com esse número.

E o ponto mais importante: preço baixo não torna um modelo adequado. Luna continua sendo o tier de menor capacidade da família. Para tarefa que exige raciocínio longo, cadeia de ferramentas complexa ou código não trivial, o barato sai caro em retrabalho — e retrabalho de agente é caro em token, não só em tempo. O critério continua sendo eval no seu domínio.

Vale lembrar também que a OpenAI mexeu no preço três semanas depois do lançamento. Isso corta nos dois sentidos: o que desceu hoje pode subir depois. Se sua margem depende de US$ 0,20 por milhão de tokens, sua margem depende de uma decisão comercial de terceiro. A conta de IA pode ficar mais cara — e isso não deixou de ser verdade hoje.

FAQ rápido

Os novos preços já valem? Sim. Anunciados em 30 de julho de 2026 e já refletidos na API e nos agregadores. Não é desconto temporário, é preço de tabela.

Vale migrar do Terra pro Luna agora? Só depois do eval. A diferença de preço ficou grande o suficiente para justificar o teste, mas Luna continua sendo um modelo menor. Rode seus casos reais nos dois e compare taxa de acerto, não custo.

Por que o Sol não baixou? A OpenAI atribuiu o corte a ganhos de eficiência no serving dos tiers menores. O Sol é o modelo de fronteira da família e continua em US$ 5 de entrada e US$ 30 de saída.

Isso muda a comparação com Claude e modelos abertos? Muda a conta, não o critério. Luna agora entra na faixa de preço onde brigam os modelos open source hospedados. A decisão passa a ser sobre latência, limite de contexto e qualidade no seu domínio — não sobre quem é mais barato.

Conclusão

O preço de inferência está caindo mais rápido do que a maioria das arquiteturas consegue acompanhar. Em três semanas, o tier barato da OpenAI ficou cinco vezes mais barato — e a justificativa é a própria empresa usando o modelo para otimizar a infraestrutura que serve o modelo.

Isso tem uma consequência prática chata: qualquer decisão de arquitetura que você tomou com base em custo tem prazo de validade curto. A defesa não é acompanhar manchete. É ter um eval no seu domínio e um roteador que você consegue trocar em uma linha de configuração.

Quem construiu abstração de provider sofre menos. Quem chumbou o nome do modelo em quinze lugares do código vai passar a tarde refatorando de novo.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando