~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #custos $ grep

#Custos

11 posts
01 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min
02 #ia · #google
Cactus Hybrid: o modelo local que sabe quando está errado e chama a nuvem sozinho

A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.

25 Jul · 8 min
03 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min
04 #claude · #anthropic
Créditos grátis do Fable 5: resgatar liga a cobrança por uso na sua conta sem avisar

A Anthropic deu US$ 100 (R$ 540) em créditos grátis do Fable 5 para os planos Pro e Team, mas o resgate exige cartão e deixa o extra usage habilitado: quando o crédito acaba, a conta passa a ser cobrada por uso, sem aviso separado. Passo a passo pra verificar se a cobrança está ligada na sua conta e como desativar — ou usar os US$ 100 com teto de gasto e auto-reload desligado.

23 Jul · 8 min
05 #openai · #ia
IA vai ficar mais cara? A conta real da OpenAI e da Anthropic

O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.

18 Jul · 16 min
06 #ia · #claude
IPO da Anthropic em outubro: o que muda pra quem usa Claude (preços, limites e o risco Kimi K3)

A Anthropic agendou reuniões com investidores mirando IPO já em outubro de 2026, avaliada em US$ 965 bilhões. O que a pressão por receita pode mudar no preço do Claude Code, nos limites de uso e no foco enterprise, e por que Kimi K3 e GLM 5.2 espremem essa avaliação. Post vivo: atualizado quando sair o anúncio formal.

17 Jul · 11 min
07 #ia · #llm
DeepSeek V4 Flash com 1M de contexto no seu RTX 5090: dá pra rodar local — mas tem um porém

O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.

03 Jul · 9 min
08 #produtividade · #claude
Claude Code ficou 5x mais caro? O preço real em 2026 (Pro, Max e API na ponta do lápis)

O Fable 5 voltou com taxímetro, o HN diz que o Claude Code ficou 5x mais caro e o Reddit tá em chamas. Separamos fato de anedota: a tabela real de preços 2026 (Pro, Max, Team e API), a conta assinatura vs API e como cortar custo sem perder qualidade.

02 Jul · 10 min
09 #ia · #llm
DeepSeek V4 vai custar por horário de pico: o preço peak/valley que muda a conta do open source

A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. O que é o peak/valley, quanto cai fora do pico e a conta vs Claude Opus 4.8 pra dev brasileiro, com a pegadinha de fuso que joga a seu favor.

02 Jul · 7 min
10 #ia · #llm
GLM 5.2: o melhor modelo de código open source é chinês, MIT e 6x mais barato

A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.

22 Jun · 8 min
11 #openai · #cache
Reduzir custo de API de IA: os vazamentos de token mais comuns

Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.

14 Jun · 10 min
Conheça o Clã Beer and Code
tocando