#Custos
A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.
A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.
A Anthropic deu US$ 100 (R$ 540) em créditos grátis do Fable 5 para os planos Pro e Team, mas o resgate exige cartão e deixa o extra usage habilitado: quando o crédito acaba, a conta passa a ser cobrada por uso, sem aviso separado. Passo a passo pra verificar se a cobrança está ligada na sua conta e como desativar — ou usar os US$ 100 com teto de gasto e auto-reload desligado.
O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.
A Anthropic agendou reuniões com investidores mirando IPO já em outubro de 2026, avaliada em US$ 965 bilhões. O que a pressão por receita pode mudar no preço do Claude Code, nos limites de uso e no foco enterprise, e por que Kimi K3 e GLM 5.2 espremem essa avaliação. Post vivo: atualizado quando sair o anúncio formal.
O GPT-5.6 está no Codex desde 9 de julho, nos três tiers. O modo Ultra coordena quatro subagents que cooperam durante a tarefa e rende 3 pontos no Terminal-Bench (88,8% para 91,9%), a um custo de tokens bem maior. E o teste independente da CodeRabbit derruba o reflexo de escolher o tier barato: o Terra gastou 2,6x mais tokens que o Sol para passar 40,7% das tarefas contra 63,7%. Preço por token não é preço por tarefa.
O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.
O Fable 5 voltou com taxímetro, o HN diz que o Claude Code ficou 5x mais caro e o Reddit tá em chamas. Separamos fato de anedota: a tabela real de preços 2026 (Pro, Max, Team e API), a conta assinatura vs API e como cortar custo sem perder qualidade.
A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. Como o peak/valley funciona, a pegadinha de fuso que joga a favor de quem coda em Brasília e o que conferir no cron. A tabela oficial atual do V4 Pro e do Flash está no post do 0813.
Qual a diferença entre GPT-5.6 Sol, Terra e Luna? Mesma geração, três tiers: Sol é o topo agêntico ($5/$30 por 1M de tokens), Terra o meio-termo ($2/$12) e Luna o barato e rápido ($0,20/$1,20). Com a tabela vigente desde o corte de 30/07, quando cada um vale a pena e quando o Sol é só desperdício de orçamento.
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.
Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.