~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #custos $ grep

#Custos

27 posts
13 #llm · #custos
DeepSeek V4 Flash 0731: pesos novos, 82,7 no Terminal Bench e a conta que dói na OpenAI

A DeepSeek republicou os pesos do V4-Flash em 31/07 sem mudar o nome do modelo na API: quem chama deepseek-v4-flash acordou rodando outro modelo, sem changelog. Os números reais do 0731 (82,7 no Terminal Bench, mas 79% na medição independente), onde ele ganha do GPT-5.6 Luna e onde perde, os 169 GB pra rodar local e o que fazer se seu agente aponta pra um nome de modelo que virou alvo móvel.

31 Jul · 12 min
14 #openai · #tokens
Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje

A OpenAI cortou 80% do preço do GPT-5.6 Luna e 20% do Terra, três semanas depois do lançamento. Refazemos a conta por milhão de tokens com um cenário real de agente em produção, comparamos os três tiers e mostramos o que revisar na sua arquitetura antes de sair migrando de modelo por causa de manchete.

30 Jul · 8 min
15 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min
16 #ia · #google
Cactus Hybrid: o modelo local que sabe quando está errado e chama a nuvem sozinho

A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.

25 Jul · 8 min
17 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min
18 #claude · #anthropic
Créditos grátis do Fable 5: resgatar liga a cobrança por uso na sua conta sem avisar

A Anthropic deu US$ 100 (R$ 540) em créditos grátis do Fable 5 para os planos Pro e Team, mas o resgate exige cartão e deixa o extra usage habilitado: quando o crédito acaba, a conta passa a ser cobrada por uso, sem aviso separado. Passo a passo pra verificar se a cobrança está ligada na sua conta e como desativar — ou usar os US$ 100 com teto de gasto e auto-reload desligado.

23 Jul · 8 min
19 #openai · #ia
IA vai ficar mais cara? A conta real da OpenAI e da Anthropic

O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.

18 Jul · 16 min
20 #ia · #claude
IPO da Anthropic em outubro: o que muda pra quem usa Claude (preços, limites e o risco Kimi K3)

A Anthropic agendou reuniões com investidores mirando IPO já em outubro de 2026, avaliada em US$ 965 bilhões. O que a pressão por receita pode mudar no preço do Claude Code, nos limites de uso e no foco enterprise, e por que Kimi K3 e GLM 5.2 espremem essa avaliação. Post vivo: atualizado quando sair o anúncio formal.

17 Jul · 11 min
21 #openai · #multi-agent
GPT-5.6 no Codex: o modo Ultra rende 3 pontos, e o Terra gasta 2,6x mais tokens pra entregar pior

O GPT-5.6 está no Codex desde 9 de julho, nos três tiers. O modo Ultra coordena quatro subagents que cooperam durante a tarefa e rende 3 pontos no Terminal-Bench (88,8% para 91,9%), a um custo de tokens bem maior. E o teste independente da CodeRabbit derruba o reflexo de escolher o tier barato: o Terra gastou 2,6x mais tokens que o Sol para passar 40,7% das tarefas contra 63,7%. Preço por token não é preço por tarefa.

15 Jul · 10 min
22 #ia · #llm
DeepSeek V4 Flash com 1M de contexto no seu RTX 5090: dá pra rodar local — mas tem um porém

O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.

03 Jul · 9 min
23 #produtividade · #claude
Claude Code ficou 5x mais caro? O preço real em 2026 (Pro, Max e API na ponta do lápis)

O Fable 5 voltou com taxímetro, o HN diz que o Claude Code ficou 5x mais caro e o Reddit tá em chamas. Separamos fato de anedota: a tabela real de preços 2026 (Pro, Max, Team e API), a conta assinatura vs API e como cortar custo sem perder qualidade.

02 Jul · 10 min
24 #ia · #llm
DeepSeek V4 vai custar por horário de pico: o preço peak/valley que muda a conta do open source

A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. O que é o peak/valley, quanto cai fora do pico e a conta vs Claude Opus 4.8 pra dev brasileiro, com a pegadinha de fuso que joga a seu favor.

02 Jul · 7 min
Conheça o Clã Beer and Code
tocando