~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #cache $ grep

#Cache

6 posts
01 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min
02 #cache · #contexto
Como economizar tokens em Claude Code, Codex e Cursor: pare de quebrar o cache

Você manda uma pergunta de uma linha e o /usage acusa consumo do dia inteiro. Economizar tokens em assistente de código não tem a ver com o tamanho do prompt: tem a ver com cache de prefixo. Como ele funciona no Claude Code, Codex e Cursor, as sete ações que invalidam ele sem você perceber, como medir com cache_read vs cache_creation, e oito alavancas para estender a sessão.

06 Ago · 16 min
03 #openai · #cache
Reduzir custo de API de IA: os vazamentos de token mais comuns

Sua conta de API de IA veio 4x maior do que o previsto? Antes de cortar feature, vamos achar os cinco vazamentos de token mais comuns em produção e o conserto de cada um.

14 Jun · 10 min
04 #ai-agents · #observabilidade
Quanto custa um agente em produção em 2026: planilha real depois de 6 meses

A calculadora da OpenAI mente. Pricing de token é só um item de linha; a fatura real de um agente em produção tem seis baldes: inferência, eval em runtime, observability, infra, pessoas, outros. Este post abre o balancete de 6 meses, mês a mês, com números e fontes. No fim, build vs buy: quando vale construir e quando você está pagando para reinventar o Cursor.

14 Mai · 15 min
05 #performance · #openai
Cortando custo em 80%: prompt caching, batch e quando NÃO usar reranker

A maioria dos agentes em produção sangra dinheiro em chamada repetida pra LLM. Três alavancas que cortam custo: prompt caching no system prompt do harness, Batch API pra workloads assíncronos e a decisão fria de quando o reranker é só caro e lento.

01 Mai · 10 min
06 #laravel · #performance
Otimize sua aplicação Laravel com o novo Memoized Cache Driver (Laravel 12.9)

O Laravel 12.9 trouxe uma novidade poderosa: o Memoized Cache Driver. Essa feature otimiza o desempenho das aplicações ao armazenar em memória os valores obtidos do cache durante o tempo de execução da requisição, evitando múltiplos acessos ao cache.

16 Abr · 3 min
Conheça o Clã Beer and Code
tocando