#Tokens
Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.
Fundamento operacional de LLM sem analogia de papagaio: o que o modelo faz a cada token, por que ele é stateless, como a janela de contexto degrada muito antes do limite e por que temperatura 0 não é determinística. Cada conceito fecha com a consequência de arquitetura que ele te obriga a construir, com a doc oficial da Anthropic e da OpenAI, o paper Lost in the Middle e o estudo de context rot da Chroma na mão.
Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.
A OpenAI cortou 80% do preço do GPT-5.6 Luna e 20% do Terra, três semanas depois do lançamento. Refazemos a conta por milhão de tokens com um cenário real de agente em produção, comparamos os três tiers e mostramos o que revisar na sua arquitetura antes de sair migrando de modelo por causa de manchete.
A OpenAI baixou o contexto efetivo do modelo do Codex de 372k para 272k tokens numa atualização silenciosa e transformou o antigo teto numa linha onde o preço dobra. O que foi cortado, por que dói em sessão longa e monorepo, como confirmar que você foi afetado e os workarounds que existem hoje.
O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.
Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.
A IA não esquece por burrice. É a janela de contexto. Entenda pela dor o limite de tokens e as quatro saídas: resumo, RAG, chunking e memória.
Fable 5 ou Opus 4.8, qual usar? Veredito direto por tipo de tarefa, com as 10 situações concretas em que o Fable resolve e o Opus 4.8 fazia mal ou não fazia: migração em escala, código a partir de print, agente de longa duração e raciocínio sobre documento. Mais o custo de cada um e os casos em que o Opus 4.8 continua sendo a escolha certa.
Agente nosso queimava US$ 2.300/mês rodando Claude Opus em loop. Trocamos por Plan-and-Execute: uma chamada cara que planeja, N chamadas baratas que executam. Conta nova: US$ 220/mês com a mesma qualidade. Planilha de tokens, código Laravel (PlanJob + ExecuteStep) e o tipo de fluxo onde esse pattern quebra.
A calculadora da OpenAI mente. Pricing de token é só um item de linha; a fatura real de um agente em produção tem seis baldes: inferência, eval em runtime, observability, infra, pessoas, outros. Este post abre o balancete de 6 meses, mês a mês, com números e fontes. No fim, build vs buy: quando vale construir e quando você está pagando para reinventar o Cursor.
Mesma tarefa de refatoração, três montagens de contexto: inflado (25k tokens), enxuto (2k) e vazio (150). Enxuto passou 8/8 testes com 4x menos custo; inflado aplicou regra descartada; vazio inventou faixas. Os números e o playbook Write, Select, Compress, Isolate em PHP/Laravel pra cortar ruído sem amputar sinal.