#Llm
O agente tinha a ferramenta certa na mão e escolheu a errada. O problema quase sempre está na descrição, no schema e no nome que você definiu, não no modelo. Veja como consertar com código e os números da Anthropic.
Fable 5 ou Opus 4.8, qual usar? Veredito direto por tipo de tarefa, com as 10 situações concretas em que o Fable resolve e o Opus 4.8 fazia mal ou não fazia: migração em escala, código a partir de print, agente de longa duração e raciocínio sobre documento. Mais o custo de cada um e os casos em que o Opus 4.8 continua sendo a escolha certa.
Saber que a IA alucina não resolve nada. Veja por que o LLM inventa e como reduzir alucinação de IA no seu produto com grounding, RAG, citações e guardrails.
Vibe coding — construir software conversando com a IA sem revisar o código — é o termo do momento. Veja o que é de verdade, onde acelera e onde vira dívida técnica silenciosa.
A semana inteira em um diagrama só — as seis camadas de uma arquitetura de agentes de IA (modelo, contexto, tools/MCP, RAG, guardrails, observabilidade), como se encaixam e um checklist de produção pra defender o agente numa code review.
RAG não é memória, e confundir os dois quebra seu agente. O que é RAG, como funciona por dentro, e onde ele termina e a memória (e o fine-tuning) começam.
Medir só a resposta final esconde onde o agente erra. Como quebrar a avaliação em três etapas (retrieval, decisão de tool, resposta), escolher entre pass@1, pass@k e pass^k, e usar LLM como juiz sem inflar o número.
As cercas que separam um agente que roda em produção de um que vive preso no "demo na minha máquina": validar a entrada, restringir o que as tools fazem e checar a saída antes de devolver pro usuário.
Funcionava na demo, virou conta de US$ 3 mil e loop infinito em produção. Os 5 anti-patterns de arquitetura que mais quebram agentes de IA em produção — context stuffing, tools sem timeout, retry burro, zero observabilidade e ausência de guardrails — cada um com o sintoma e a correção.
Recorte prático: registre o retriever como tool, adicione um nó de grading e um de rewrite, e coloque teto de iterações. O padrão de 4 nós do LangGraph explicado passo a passo.
A busca vetorial traz 20 candidatos "parecidos" — mas parecido não é relevante. O reranker reordena por relevância real antes de mandar pro modelo. Este post mostra cross-encoder vs busca híbrida e quando cada um vale, com código rodando.
RAG não é mágica: é quebrar texto, virar vetor e buscar bem. O passo a passo de um RAG do zero — chunking recursive com overlap, embeddings com text-embedding-3-small e busca por similaridade no Postgres com pgvector e índice HNSW. Errar o chunking é onde 80% dos RAGs nascem ruins.