~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #custos $ grep

#Custos

36 posts
25 #ia · #google
Cactus Hybrid: o modelo local que sabe quando está errado e chama a nuvem sozinho

A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.

25 Jul · 8 min ›
26 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min ›
27 #claude · #anthropic
Créditos grátis do Fable 5: resgatar liga a cobrança por uso na sua conta sem avisar

A Anthropic deu US$ 100 (R$ 540) em créditos grátis do Fable 5 para os planos Pro e Team, mas o resgate exige cartão e deixa o extra usage habilitado: quando o crédito acaba, a conta passa a ser cobrada por uso, sem aviso separado. Passo a passo pra verificar se a cobrança está ligada na sua conta e como desativar — ou usar os US$ 100 com teto de gasto e auto-reload desligado.

23 Jul · 8 min ›
28 #openai · #ia
IA vai ficar mais cara? A conta real da OpenAI e da Anthropic

O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.

18 Jul · 16 min ›
29 #ia · #claude
IPO da Anthropic em outubro: o que muda pra quem usa Claude (preços, limites e o risco Kimi K3)

A Anthropic agendou reuniões com investidores mirando IPO já em outubro de 2026, avaliada em US$ 965 bilhões. O que a pressão por receita pode mudar no preço do Claude Code, nos limites de uso e no foco enterprise, e por que Kimi K3 e GLM 5.2 espremem essa avaliação. Post vivo: atualizado quando sair o anúncio formal.

17 Jul · 11 min ›
30 #openai · #multi-agent
GPT-5.6 no Codex: o modo Ultra rende 3 pontos, e o Terra gasta 2,6x mais tokens pra entregar pior

O GPT-5.6 está no Codex desde 9 de julho, nos três tiers. O modo Ultra coordena quatro subagents que cooperam durante a tarefa e rende 3 pontos no Terminal-Bench (88,8% para 91,9%), a um custo de tokens bem maior. E o teste independente da CodeRabbit derruba o reflexo de escolher o tier barato: o Terra gastou 2,6x mais tokens que o Sol para passar 40,7% das tarefas contra 63,7%. Preço por token não é preço por tarefa.

15 Jul · 11 min ›
31 #ia · #llm
DeepSeek V4 Flash com 1M de contexto no seu RTX 5090: dá pra rodar local — mas tem um porém

O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.

03 Jul · 9 min ›
32 #produtividade · #claude
Claude Code ficou 5x mais caro? O preço real em 2026 (Pro, Max e API na ponta do lápis)

O Fable 5 voltou com taxímetro, o HN diz que o Claude Code ficou 5x mais caro e o Reddit tá em chamas. Separamos fato de anedota: a tabela real de preços 2026 (Pro, Max, Team e API), a conta assinatura vs API e como cortar custo sem perder qualidade.

02 Jul · 10 min ›
33 #ia · #llm
DeepSeek V4 peak/valley: o preço por horário de pico e a pegadinha de fuso que favorece o dev BR

A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. Como o peak/valley funciona, a pegadinha de fuso que joga a favor de quem coda em Brasília e o que conferir no cron. A tabela oficial atual do V4 Pro e do Flash está no post do 0813.

02 Jul · 8 min ›
34 #openai · #ia
Diferença entre GPT-5.6 Sol, Terra e Luna: preço por tier e qual usar

Qual a diferença entre GPT-5.6 Sol, Terra e Luna? Mesma geração, três tiers: Sol é o topo agêntico ($5/$30 por 1M de tokens), Terra o meio-termo ($2/$12) e Luna o barato e rápido ($0,20/$1,20). Com a tabela vigente desde o corte de 30/07, quando cada um vale a pena e quando o Sol é só desperdício de orçamento.

26 Jun · 11 min ›
35 #ia · #llm
GLM 5.2: o melhor modelo de código open source é chinês, MIT e 6x mais barato

A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.

22 Jun · 8 min ›
36 #openai · #cache
Reduzir custo de API de IA: os vazamentos de token mais comuns

Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.

14 Jun · 10 min ›
Conheça o Clã Beer and Code
tocando