~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #arquitetura $ grep

#Arquitetura

13 posts
01 #ia · #alucinacao
O que é o Jev IA: o modelo que não escreve nada (e por isso custa 100x menos)

A TypeSafe lançou o Jev, o primeiro System One model: ele não completa texto, recebe o estado do seu programa e devolve decisão tipada numa passagem paralela. Sem parser, sem retry, sem JSON quebrado. Neste post: o que o Jev é de fato, por que ele não consegue alucinar (e por que isso não significa que não erra), a conta real de US$ 0,042 por milhão de tokens com output de graça, os três primitivos com código Python rodando, e as 5 armadilhas que a própria doc admite.

21 Set · 15 min ›
02 #ia · #ai-agents
Quando usar agente de IA: o teste dos 3 minutos

Metade dos "projetos de IA" que revisei em 2026 se resolviam com um if e um SELECT. A outra metade virou agente porque o time queria dizer que tinha IA. Aqui está o teste dos 3 minutos: 4 perguntas que decidem se o seu problema pede um if, uma query, um prompt, um fluxo determinístico ou um agente de verdade. Com 5 casos reais, o veredito de cada um (spoiler: 1 em 5 era agente) e o custo invisível de errar pra cima.

02 Set · 18 min ›
03 #ai-agents · #llm
Classificação de intenção com LLM: como o agente decide qual rota seguir

O agente decide sozinho qual fluxo usar, mas ninguém consegue explicar por que ele escolheu errado ontem às 14h. Roteador determinístico vs. roteador por LLM, classificação de intenção com schema fechado e evidência, política de fallback explícita, atributos de trace para auditar a decisão e como medir acerto de rota sem rotular dez mil conversas na mão.

02 Set · 17 min ›
04 #ia · #api
JSON que não quebra: structured output em LLM sem parser defensivo

Se o seu código tem um try/catch em volta de um json_decode da resposta do modelo, você não tem contrato. Tem esperança. Como garantir saída estruturada de verdade no LLM: constrained decoding no provider, schema que o modelo consegue cumprir, validação semântica e retry com orçamento fixo, sem loop infinito e sem parser defensivo.

02 Set · 16 min ›
05 #ai-agents · #cache
Quanto custa um agente de IA em produção: a conta real de tokens

Seu protótipo custou R$ 12 no primeiro dia. Em produção, com 200 usuários, ele custa quase R$ 4.000 por mês. Abrimos a conta de token de um agente real camada por camada (system prompt, definições de tool, chunks de RAG, histórico, tool results) e mostramos onde some quase 80% do dinheiro. No fim, compressão de prompt, pruning de histórico e seleção de contexto derrubam a fatura em 73%, com a planilha antes e depois.

01 Set · 13 min ›
06 #ia · #rag
Grounding de LLM: as 4 camadas que prendem a resposta da IA no seu dado (e validam antes de entregar)

Grounding não é RAG, é a propriedade que você quer: a resposta presa no dado que é seu. As técnicas que amarram o LLM, structured output com schema estrito, a verificação de faithfulness que roda antes de entregar pro cliente pagante, e o que ainda vai escapar depois de tudo isso.

01 Set · 13 min ›
07 #ai-agents · #llm
LangGraph, Mem0, LangChain, MCP: do que você realmente precisa

Mapa honesto do ecossistema de orquestração e memória de agentes. O que LangGraph, Mem0, LangChain e MCP realmente fazem, o ponto em que cada um deixa de ser overhead, e a árvore de decisão de 5 perguntas antes de instalar qualquer coisa.

01 Set · 15 min ›
08 #ia · #rag
Fine-tuning, RAG ou prompt: qual dos três o seu problema pede

A decisão que mais gente erra pra cima. Critério objetivo pra escolher entre prompt, RAG e fine tuning, quanto custa cada caminho com números reais, os três casos raros em que treinar um modelo ganha, e o teste de cinco minutos que separa problema de conhecimento de problema de recuperação. Com a notícia que muda a conta: a OpenAI está encerrando a plataforma de fine-tuning.

31 Ago · 14 min ›
09 #ia · #llm
O que é um LLM: a explicação para quem vai construir, não para quem vai postar

Fundamento operacional de LLM sem analogia de papagaio: o que o modelo faz a cada token, por que ele é stateless, como a janela de contexto degrada muito antes do limite e por que temperatura 0 não é determinística. Cada conceito fecha com a consequência de arquitetura que ele te obriga a construir, com a doc oficial da Anthropic e da OpenAI, o paper Lost in the Middle e o estudo de context rot da Chroma na mão.

31 Ago · 5 min ›
10 #ia · #ai-agents
Sistema multiagente: quando vale dividir e quando é overhead

O que são sistemas multiagentes, quando vale dividir o trabalho em vários agentes e como orquestrar de forma assíncrona com asyncio. Arquitetura orquestrador-worker, o padrão de produção da Anthropic e quando NÃO dividir.

16 Jun · 15 min ›
11 #ia · #agentes
Arquitetura de agentes de IA: o blueprint em 6 camadas

A semana inteira em um diagrama só — as seis camadas de uma arquitetura de agentes de IA (modelo, contexto, tools/MCP, RAG, guardrails, observabilidade), como se encaixam e um checklist de produção pra defender o agente numa code review.

07 Jun · 23 min ›
12 #ia · #ai-agents
Progressive disclosure: como não afogar seu agente em 50 ferramentas

Colocar 50 ferramentas no contexto do agente degrada a escolha e estoura tokens. Progressive disclosure carrega tools sob demanda: o agente descobre o que precisa quando precisa. Padrão central de arquitetura de agentes que escalam.

03 Jun · 10 min ›
Conheça o Clã Beer and Code
tocando