~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #custos $ grep

#Custos

27 posts
01 #harness · #llm
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek lançou o V4.1 Flash e a timeline recortou a linha boa do benchmark. Comparamos o modelo com Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3 e GPT-6 Astra em preço e performance, mostramos onde ele realmente lidera, onde cai 20 pontos, e o dado escondido no model card: o scaffold muda o resultado quarenta vezes mais que a troca de modelo.

10 Set · 11 min
02 #openai · #harness
GPT-6 Astra vs Claude Fable 5.1 vs GPT-5.6 Sol: os números, o preço e o 99,9% que depende do harness

A OpenAI lançou o GPT-6 Astra em 03/09/2026 pelo mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, o índice independente onde o Fable ainda lidera, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% dependendo só do harness. Mais o que muda na sua API com o primeiro modelo "Critical" em cyber.

03 Set · 18 min
03 #claude · #anthropic
Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)

A Anthropic lançou o Claude Fable 5.1 em 01/09/2026. Ele bate o Opus 5 em todos os benchmarks publicados, mas quase sempre por 2 a 3 pontos, e custa o dobro por token. Os números oficiais, a conta real de uma sessão agentic com cache quente (onde a razão de custo cai de 2x para 1.3x), a árvore de decisão entre Fable 5.1, Opus 5 e Sonnet 5, e os 3 breaking changes que quebram seu código se você só trocar o model id.

01 Set · 15 min
04 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min
05 #claude · #processo
Claude Max 20x: o processo que diz que o limite entrega 6x, não 20x

Uma ação coletiva na Califórnia (Kahn v. Anthropic, 3:26-cv-05763) alega que o plano Claude Max 20x entrega entre 6x e 8x o uso do Pro, não 20x. O que a petição sustenta com documentos internos, por que o multiplicador só vale na sessão de 5 horas enquanto o teto semanal é o que realmente trava, e como descobrir em qual dos dois você esbarra antes de renovar.

01 Set · 8 min
06 #ia · #rag
Fine-tuning, RAG ou prompt: qual dos três o seu problema pede

A decisão que mais gente erra pra cima. Critério objetivo pra escolher entre prompt, RAG e fine tuning, quanto custa cada caminho com números reais, os três casos raros em que treinar um modelo ganha, e o teste de cinco minutos que separa problema de conhecimento de problema de recuperação. Com a notícia que muda a conta: a OpenAI está encerrando a plataforma de fine-tuning.

31 Ago · 14 min
07 #performance · #openai
GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5

Não é modelo novo. É o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato: 750 tokens/s, 44 GB de SRAM on-chip e zero preço publicado. A OpenAI anuncia 14x contra o próprio Sol Standard; a Cerebras anuncia 11x contra o Fable 5 (sem teste pareado). Aqui separamos o que é verificável do que é marketing de fornecedor, explicamos por que Sol, Ultra e Ultrafast são três coisas diferentes, e mostramos a conta que decide se latência vira dinheiro no seu agente.

15 Ago · 10 min
08 #google · #ai-agents
Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo

O Google repetiu a jogada e soltou o Flash antes do Pro. Só que o US$ 0,75/M que tomou a timeline não é preço baixo: a tabela oficial mostra que é o preço do 3.6 Flash com 50% de desconto até 31/12/2026, e a fatura dobra em 1º de janeiro. Aqui estão os dois valores, os benchmarks reais (FrontierCode 43,6%, AutomationBench 30,4%), o que quebra na migração vindo do 3.6, e o dado que o release não conta: a alucinação subiu de 55,6% para 64,5%.

15 Ago · 11 min
09 #ai-agents · #noticias
Qwen 3.8 27B tem a mesma arquitetura do 3.6, linha por linha: 100% do ganho veio do treino

A Alibaba lançou o Qwen 3.8 27B e alguém abriu o diff contra o 3.6: 59 de 59 nós do grafo mapeiam um pra um, e o único campo diferente é metadado. Mesma arquitetura, DeepSWE triplicando de 13,3 para 42,2. Aqui vão os benchmarks reais (e o que a tabela do vendor omite), a conta de VRAM que a imprensa simplificou, o KV cache de 64KB por token, o bug do template Jinja que derruba tool call no dia 1, e a diferença entre o 27B denso e o 3.8 Max de 2,4T. Com o contraponto que ninguém fez.

15 Ago · 11 min
10 #ai-agents · #produtividade
Cursor SpaceX: o que a aquisição muda no seu editor (e o que ninguém confirmou)

A Cursor confirmou em 14/08/2026 que foi adquirida pela SpaceX. O comunicado tem treze frases: fala de GPU, de modelo mais barato e de horizonte, e não fala uma palavra sobre o seu código. Separamos o que está em fonte primária do que é só imprensa (inclusive os US$ 60 bilhões), mostramos o que de fato muda dentro do editor (Grok 4.6 no pool da casa, Claude hidden by default, o Router escolhendo por você) e fechamos com o checklist pra quem depende do Cursor em produção.

15 Ago · 11 min
11 #llm · #custos
DeepSeek V4 Pro 0813: 87,9 no Terminal Bench passa o Opus 4.8 e a conta vai subir

A DeepSeek publicou o DeepSeek-V4-Pro-0813 na página oficial de preços e o release oficial do V4 Pro finalmente saiu do rótulo de preview. Os números reportados, o que é fato e o que ainda não tem documento público, a comparação com o Flash 0731 e o Opus 4.8, e o aviso na própria página de preços de que a DeepSeek vai aumentar os valores em breve.

12 Ago · 11 min
12 #cache · #contexto
Como economizar tokens em Claude Code, Codex e Cursor: pare de quebrar o cache

Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.

06 Ago · 16 min
Conheça o Clã Beer and Code
tocando