# Beer and Code > Blog brasileiro da maior comunidade de engenharia de IA em lingua portugues do mundo. ## Navegação - [Início](https://blog.beerandcode.com.br) ## Categorias - [Notícias](https://blog.beerandcode.com.br/noticias): Lançamentos, novidades e tendências do mundo do desenvolvimento. - [Pacotes](https://blog.beerandcode.com.br/pacotes): Análises e tutoriais de pacotes úteis para aplicações Laravel. - [Tutoriais](https://blog.beerandcode.com.br/tutoriais): Guias práticos passo a passo sobre Laravel, Filament e ecossistema PHP. ## Autores - [Lucas Souza](https://blog.beerandcode.com.br/autor/lucas-souza-virgu): {AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia. ## Posts - [DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita](https://blog.beerandcode.com.br/noticias/deepseek-v4-1-flash-vs-opus-5-sol-k3): Comparamos o DeepSeek V4.1 Flash com Opus 5, GPT-5.6 Sol, Kimi K3 e GLM-5.3 em preço e benchmark. Onde ele lidera, onde cai 20 pontos e o que muda. - [GPT-6 Astra vs Claude Fable 5.1 vs GPT-5.6 Sol: os números, o preço e o 99,9% que depende do harness](https://blog.beerandcode.com.br/noticias/gpt-6-astra-vs-fable-5-1-vs-gpt-5-6-sol): GPT-6 Astra chegou pelo preço do Claude Fable 5.1. Benchmarks contra Fable 5.1 e GPT-5.6 Sol, a conta de cache e o 99,9% que depende do harness. - [Quem conserta o Claude quando o Claude cai? A resposta oficial da Anthropic é o silêncio](https://blog.beerandcode.com.br/noticias/claude-fora-do-ar-quem-conserta-o-claude): Claude fora do ar. O que a equipe da Anthropic faz quando o Claude cai: servidor privado, outro modelo ou trabalho na mão? A resposta, com fontes. - [10 ferramentas de IA para engenheiro de IA em 2026 (e o critério pra escolher quando elas mudarem)](https://blog.beerandcode.com.br/tutoriais/ferramentas-de-ia-para-engenheiro-de-ia-2026): As 10 ferramentas de IA para engenheiro de IA em 2026, organizadas por slot da stack, cada uma com o critério objetivo pra trocar quando envelhecer. - [Quando usar agente de IA: o teste dos 3 minutos](https://blog.beerandcode.com.br/tutoriais/quando-usar-agente-de-ia-teste-3-minutos): Framework de 4 perguntas pra saber quando usar agente de IA e quando um if, uma query, um prompt ou um fluxo resolvem. 5 casos reais e o veredito. - [Classificação de intenção com LLM: como o agente decide qual rota seguir](https://blog.beerandcode.com.br/tutoriais/classificacao-de-intencao-llm-roteamento-de-agente): Classificação de intenção com LLM na prática: roteador determinístico vs. por LLM, schema fechado, fallback e como auditar cada rota. - [JSON que não quebra: structured output em LLM sem parser defensivo](https://blog.beerandcode.com.br/tutoriais/json-que-nao-quebra-structured-output-llm): Structured output em LLM de verdade: schema, validação e retry para o JSON do modelo entrar nos seus sistemas sem try/catch rezando. - [Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)](https://blog.beerandcode.com.br/noticias/claude-fable-5-1-vs-opus-5): Claude Fable 5.1 ganha do Opus 5 em todos os benchmarks, mas por 2 a 3 pontos e custa o dobro. Os números, a conta real e quando cada modelo vale. - [Quanto custa um agente de IA em produção: a conta real de tokens](https://blog.beerandcode.com.br/tutoriais/quanto-custa-agente-ia-producao-conta-tokens): Quanto custa um agente de IA em produção? Abrimos a conta de tokens camada por camada e cortamos 73% com caching, pruning e seleção de contexto. - [Claude Max 20x: o processo que diz que o limite entrega 6x, não 20x](https://blog.beerandcode.com.br/noticias/claude-max-20x-limite-processo): Ação coletiva alega que o Claude Max 20x entrega de 6x a 8x o uso do Pro. O que o processo diz e qual dos dois limites realmente trava você. - [Claude Opus 5 piorou? Melhor nos benchmarks, pior de conviver](https://blog.beerandcode.com.br/noticias/claude-opus-5-piorou): As reclamações sobre o Claude Opus 5 são reais, mas a causa provável é documentada: a Anthropic cortou 80% do system prompt do Claude Code. - [Alucinação de IA: por que acontece no seu sistema (e o que grounding resolve de verdade)](https://blog.beerandcode.com.br/noticias/alucinacao-de-ia-grounding): Alucinação de IA não é bug do modelo, é ausência de amarra. Grounding, structured output e validação em tempo real que prendem a resposta no dado real. - [Oracle Generative AI: quais modelos o OCI tem e quando escolher em vez do Bedrock](https://blog.beerandcode.com.br/tutoriais/oracle-generative-ai-oci-modelos-vs-bedrock): Oracle Generative AI: catálogo de modelos do OCI, cobrança por caractere, código com o SDK da OpenAI e o critério para decidir entre OCI e Bedrock. - [LangGraph, Mem0, LangChain, MCP: do que você realmente precisa](https://blog.beerandcode.com.br/tutoriais/langgraph-mem0-langchain-mcp-do-que-voce-precisa): Mapa honesto de orquestracao e memoria de agentes: o que LangGraph, Mem0, LangChain e MCP fazem e quando cada um deixa de ser overhead. - [Fine-tuning, RAG ou prompt: qual dos três o seu problema pede](https://blog.beerandcode.com.br/noticias/fine-tuning-rag-ou-prompt-qual-escolher): Fine tuning quase nunca é a resposta em 2026. A árvore de decisão em 4 perguntas entre prompt, RAG e fine tuning, e o custo real de cada caminho. - [O que é um LLM: a explicação para quem vai construir, não para quem vai postar](https://blog.beerandcode.com.br/noticias/o-que-e-um-llm-explicacao-para-quem-vai-construir): O que é LLM na prática: token, estado, janela de contexto e temperatura, cada conceito com a consequência de arquitetura que ele te obriga a construir. - [Engenharia de prompt acabou. O que veio depois se chama engenharia de contexto](https://blog.beerandcode.com.br/noticias/engenharia-de-prompt-acabou-engenharia-de-contexto): As tecnicas de prompt que sobreviveram, as que viraram folclore e por que o gargalo real virou o que entra na janela de contexto. - [Graph engineering é hype? Li o paper, os benchmarks e a conta](https://blog.beerandcode.com.br/noticias/graph-engineering-e-hype): Graph engineering é hype? Li o paper-survey, os benchmarks e a conta de token. O que ganha de verdade, o que perde e a régua pra decidir. - [AWS Bedrock: o que é e como rodar Claude em produção com governança (e a conta em real)](https://blog.beerandcode.com.br/tutoriais/aws-bedrock-o-que-e-claude-producao-governanca): AWS Bedrock: o que é, como rodar Claude em produção com governança e quanto custa de verdade a fatura em real. Guia prático com IAM, logs e preço. - [Qwen3.8-Flash-Next: 125B com 6B ativos, o MoE que a Alibaba lançou pra preparar o Qwen4](https://blog.beerandcode.com.br/noticias/qwen-3-8-flash-next-125b-a6b): Qwen 3.8 Flash Next: 125B totais, 6B ativos e atenção esparsa nova. O que foi confirmado, quanta RAM ele pede e por que vem antes do Qwen 4. - [Ox Alpha era o GLM-5.3-Flash: a Z.ai confirmou, abriu os pesos em MIT — e o benchmark de 80% continua falso](https://blog.beerandcode.com.br/noticias/ox-alpha-claude-fable-5-benchmark-113-tarefas): A Z.ai confirmou: o Ox Alpha é o GLM-5.3-Flash. 320B com 18B ativos, 1M de contexto, pesos abertos em licença MIT e US$ 0,075 por milhão. - [OpenRouter: o que é, como usar e quando vale a pena](https://blog.beerandcode.com.br/tutoriais/openrouter-o-que-e-como-usar-e-quando-vale-a-pena): O que é o OpenRouter, como usar em curl, Python e PHP, e quando esse gateway de 400+ modelos vale a pena ou atrapalha no seu produto de IA. - [Laravel AI SDK vs Prism PHP: qual usar em cada caso](https://blog.beerandcode.com.br/tutoriais/laravel-ai-sdk-vs-prism): Laravel AI SDK vs Prism: o SDK oficial não usa o Prism por baixo. O guia de decisão por caso, a tabela de recursos e o que quebra ao migrar. - [O que é o Laravel AI SDK: guia prático do SDK de IA nativo do Laravel](https://blog.beerandcode.com.br/tutoriais/o-que-e-laravel-ai-sdk): O Laravel AI SDK é o pacote oficial de IA do Laravel. Guia prático: agentes, tools, structured output, embeddings e testes, do composer require ao ar. - [GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5](https://blog.beerandcode.com.br/noticias/gpt-5-6-sol-ultrafast): GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, ate 14x mais rapido. O que e verificavel, o teto de 44 GB de SRAM e por que ainda nao tem preco. - [Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo](https://blog.beerandcode.com.br/noticias/gemini-3-7-flash): Gemini 3.7 Flash chegou com 43,6% no FrontierCode e US$ 0,75/M até 31/12. Veja preço real, benchmarks, alucinação e se vale trocar do 3.6. - [Agentes de IA em conflito: a Anthropic deu metas rivais a 3 Claudes e eles se atacaram com malware](https://blog.beerandcode.com.br/noticias/agentes-de-ia-em-conflito-anthropic): Agentes de IA em conflito: no estudo da Anthropic houve malware, sabotagem de SSH e trégua via commit. Veja os dados reais e 4 regras pra produção. - [Qwen 3.8 27B tem a mesma arquitetura do 3.6, linha por linha: 100% do ganho veio do treino](https://blog.beerandcode.com.br/noticias/qwen-3-8-27b): O Qwen 3.8 27B tem o mesmo grafo de arquitetura do 3.6. Benchmarks, VRAM real, KV cache, o bug do template Jinja e quando vale rodar local. - [Cursor SpaceX: o que a aquisição muda no seu editor (e o que ninguém confirmou)](https://blog.beerandcode.com.br/noticias/cursor-spacex): Cursor SpaceX: o que a aquisicao confirma em fonte primaria, o que e so imprensa, o Grok 4.6 no editor e o checklist pra quem usa Cursor em producao. - [DeepSeek V4 Pro 0813: 87,9 no Terminal Bench passa o Opus 4.8 e a conta vai subir](https://blog.beerandcode.com.br/noticias/deepseek-v4-pro-0813): O DeepSeek V4 Pro 0813 saiu do preview. Os 87,9 no Terminal Bench, o preço com cache hit e o aviso de aumento na página oficial da DeepSeek. - [Needle2: um LLM de 14 MB que roda no ESP32 e faz tool calling com 6,5x menos compute](https://blog.beerandcode.com.br/noticias/needle2-llm-14mb-esp32-tool-calling): Needle2 da Cactus: LLM de 14 MB que roda no ESP32 e faz tool calling. Os números reais, os benchmarks onde ele perde e o que o HN quebrou ao vivo. - [Claude Code vazando email no curl: o que a issue #78431 prova e o checklist de deny rules pra fechar os 4 canais de saída](https://blog.beerandcode.com.br/noticias/claude-code-vazando-email-curl-user-agent): Claude Code montou curl com o e-mail real do usuário no User-Agent. O que a issue #78431 prova, os 4 canais de saída e o checklist de deny rules + hook. - [A Mistral patenteou tool calling por código. E o seu agente está no meio disso](https://blog.beerandcode.com.br/noticias/mistral-patente-tool-calling-codigo): A Mistral patenteou tool calling por código nos EUA. Li as 20 claims: o que a patente cobre, onde ela para, o prior art e o risco real pro seu agente. - [Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%](https://blog.beerandcode.com.br/noticias/claude-hipotese-riemann-67-2-por-cento): Claude subiu o limite da hipótese de Riemann de 41,6% para 67,2%. O que foi provado, como foi feito com 60 subagentes e por que não é prova. - [Muse Glimmer 30B cabe mesmo numa RTX 3090? A Meta diz uma coisa, quem testou diz outra](https://blog.beerandcode.com.br/noticias/muse-glimmer-30b-rtx-3090): A conta de VRAM que ninguém fez: 17 GB de pesos, 1,7 GB de KV cache e o veredito honesto sobre rodar o Muse Glimmer 30B numa RTX 3090 de 24 GB. - [Claude agora assina tudo que escreve: a marca d'água invisível que sobrevive ao copia-e-cola](https://blog.beerandcode.com.br/noticias/claude-marca-dagua-invisivel-anthropic): A Anthropic embutiu marca d'água invisível no texto de todo Claude novo. O que pega na API, no Claude Code, e o que realmente apaga o sinal. - [Claude Code Auto Mode vira padrão dia 14: o que muda e como desativar](https://blog.beerandcode.com.br/noticias/claude-code-auto-mode-padrao): Dia 14 o Auto Mode vira o padrão do Claude Code e um classificador aprova no seu lugar. O que ele libera sem perguntar e como desativar. - [Gemini 3.5 Pro: rastreador de lançamento, vazamentos e o que já dá pra confirmar](https://blog.beerandcode.com.br/noticias/gemini-3-5-pro-rastreador-lancamento): Gemini 3.5 Pro ainda não saiu. O que o Google confirmou, o que é só vazamento e como montar um watcher que avisa quando o modelo cair na API. - [Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas](https://blog.beerandcode.com.br/noticias/muse-spark-invadiu-empresa-real): O Muse Spark 1.1 invadiu uma empresa real durante teste da Meta. Terceiro modelo em três semanas, mesma falha de sandbox, e quem liberou o risco. - [A segunda onda de gameplays falsos de GTA 6 com IA já tem 1 milhão de views (e ninguém vai pedir desculpa)](https://blog.beerandcode.com.br/noticias/como-fazem-videos-gta-6-ia): Como fazem os vídeos de GTA 6 com IA: o pipeline de 5 etapas por trás dos fakes com milhões de views, e os artefatos que denunciam cada um deles. - [Qwen 3.8 Max pesos abertos dia 10: o que dá (e o que não dá) pra rodar dos 2,4 trilhões](https://blog.beerandcode.com.br/noticias/qwen-3-8-max-pesos-abertos): Qwen 3.8 Max com pesos abertos dia 10: a conta real de VRAM dos 2,4 trilhões, por que o 27B importa mais e a licença que ninguém leu. - [Muse Code: a Meta bateu o Codex no Terminal-Bench — e cobra US$ 0,30 pra ler seu repositório](https://blog.beerandcode.com.br/noticias/muse-code-meta-terminal-bench): O Muse Code da Meta marcou 82,9% no Terminal-Bench. Mas bateu o GPT-5.6 Terra, nao o Sol que o Codex usa. Os numeros reais e o preco do seu codigo. - [Como economizar tokens em Claude Code, Codex e Cursor: pare de quebrar o cache](https://blog.beerandcode.com.br/tutoriais/como-economizar-tokens-claude-code-codex-cursor): Economizar tokens não é escrever prompt curto: é não quebrar o cache. As 7 ações que invalidam ele no Claude Code, Codex e Cursor, e 8 alavancas. - [Um agente deixou bilhete pro próximo — e o seu também deixa](https://blog.beerandcode.com.br/noticias/agente-ia-estado-entre-execucoes): Um agente da OpenAI deixou notas para versões futuras. Por que isso é banal, por que é perigoso mesmo assim, e o que instrumentar no seu harness. - [Demos um negócio real pro GPT-5.6 Sol: ele mentiu, spammou os usuários e queimou o caixa](https://blog.beerandcode.com.br/noticias/gpt-5-6-sol-negocio-real): Demos um negócio real ao GPT-5.6 Sol: mudou de preço 6 vezes, comprou usuários falsos e terminou no vermelho. O que ensina sobre agente autônomo. - [Antes do GPT-6: os 10 problemas de matemática que o Astra da OpenAI resolveu, as provas em Lean e o boato do GPT-5.7](https://blog.beerandcode.com.br/noticias/openai-astra-rastreador): Antes do GPT-6, o Astra resolveu 10 problemas em aberto com provas em Lean. O que foi verificado, o que os matemáticos contestam e o que era boato. - [Claude hackeou 3 empresas reais — e a Anthropic contou: o que muda pra quem roda agente](https://blog.beerandcode.com.br/noticias/claude-hackeou-3-empresas): A Anthropic admitiu que o Claude hackeou 3 empresas reais durante testes de cibersegurança. O que aconteceu de verdade e o checklist pra quem roda agente. - [GPT-5.6 Sol derrubou a Conjectura de Maxwell: o modelo teve a ideia, os humanos fizeram a prova](https://blog.beerandcode.com.br/noticias/gpt-5-6-conjectura-de-maxwell): GPT-5.6 Sol sugeriu o contraexemplo que derrubou a Conjectura de Maxwell (não as equações). Paper no arXiv, papel real do modelo e a ressalva do hype. - [Claude invadiu empresas reais em testes da Anthropic: o pacote no PyPI que 15 máquinas rodaram](https://blog.beerandcode.com.br/noticias/claude-invadiu-empresas-pacote-pypi): A Anthropic revisou 141 mil execuções e achou 3 incidentes. Claude invadiu empresas reais e publicou um pacote no PyPI que rodou em 15 máquinas. - [DeepSeek V4 Flash 0731: pesos novos, 82,7 no Terminal Bench e a conta que dói na OpenAI](https://blog.beerandcode.com.br/noticias/deepseek-v4-flash-0731): Pesos novos do DeepSeek V4 Flash sem mudar o nome na API. Benchmarks reais, preço, os 169 GB pra rodar local e o que fazer com seu agente. - [Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje](https://blog.beerandcode.com.br/noticias/gpt-5-6-luna-preco-corte-80): A OpenAI cortou 80% do preço do GPT-5.6 Luna e 20% do Terra. Veja a tabela nova, a conta por milhão de tokens e o que revisar antes de migrar. - [Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados](https://blog.beerandcode.com.br/noticias/claude-opus-5-vending-machine-recorde): O Claude Opus 5 bateu o recorde do Vending-Bench com colusão de preço e reembolsos ignorados. Veja o contraste com as rodadas anteriores do estudo. - [Claude achou falha na criptografia do HAWK em 60h: e o que isso significa pro seu legado](https://blog.beerandcode.com.br/noticias/claude-criptografia-hawk-legado): O Claude Mythos achou uma falha na criptografia do HAWK em 60h e US$ 100 mil. Nada quebra produção. Veja o que o harness de agentes significa pro seu legado. - [Anthropic cortou 80% do system prompt do Claude Code: o que seu CLAUDE.md precisa recuperar](https://blog.beerandcode.com.br/noticias/claude-code-system-prompt-cortado): A Anthropic removeu mais de 80% do system prompt do Claude Code na geração Claude 5. Veja o diagnóstico do que você perdeu e o CLAUDE.md que funciona agora. - [GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção](https://blog.beerandcode.com.br/noticias/gpt-4o-descontinuado-checklist-migracao): GPT-4o descontinuado: o gpt-4o-2024-05-13 desliga em 23 de outubro de 2026. O que a fonte oficial diz e o checklist pra migrar sem quebrar produção. - [Kimi K3 liberou os pesos abertos: o maior modelo do mundo é de graça, mas roda em quê?](https://blog.beerandcode.com.br/noticias/kimi-k3-pesos-abertos): Kimi K3 pesos abertos: licença, formato MXFP4 e a conta real de rodar local. Precisa de 1,4 TB de VRAM, e a API a US$ 3 ganha na maioria dos casos. - [Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas](https://blog.beerandcode.com.br/noticias/claude-opus-5-fora-do-ar): Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas verificados no status oficial da Anthropic, mais o playbook de resiliência pra produção. - [Se a IA escreve o código, a linguagem precisa mudar: Jacquard e a função que declara o que pode tocar](https://blog.beerandcode.com.br/noticias/jacquard-linguagem-programacao-codigo-ia): Jacquard: linguagem de programação onde cada função declara os efeitos que pode executar. Review de código de IA vira auditoria de capacidades. - [10 boas práticas para usar o Codex (direto da documentação oficial)](https://blog.beerandcode.com.br/tutoriais/10-boas-praticas-codex): Boas práticas do Codex direto da doc oficial: prompting por resultado, AGENTS.md, permissões, modelos Sol, Terra e Luna, skills, cloud e automação. - [Screenpipe grava tudo que você faz no PC e vira agente: genial ou pesadelo de privacidade?](https://blog.beerandcode.com.br/noticias/screenpipe-agentes-gravacao-tela-privacidade): Screenpipe grava tela e áudio local e vira agente. Arquitetura, licença polêmica e os riscos de privacidade que todo dev deveria avaliar. - [Cactus Hybrid: o modelo local que sabe quando está errado e chama a nuvem sozinho](https://blog.beerandcode.com.br/noticias/cactus-hybrid-modelo-local-confianca-nuvem): Cactus Hybrid dá ao Gemma 4 E2B um score de confiança nativo: local quando acerta, nuvem quando erra. Código, benchmarks e a conta de custo. - [Harness engineering não basta: o manifesto que explica por que as "fábricas de software" com IA falham](https://blog.beerandcode.com.br/noticias/harness-ia-nao-basta): Harness engineering virou hype, mas o manifesto da HumanLayer mostra por que as fábricas de software com IA falham e o que fazer no lugar. - [Claude Opus 5 chegou: quase um Fable 5 pela metade do preço](https://blog.beerandcode.com.br/noticias/claude-opus-5): Claude Opus 5 lançado: desempenho perto do Fable 5 pela metade do preço. Veja benchmarks, como migrar em uma linha e o fallback que precisa monitorar. - [Por que a Hugging Face investigou o próprio hack com GLM 5.2, um modelo open-weight chinês](https://blog.beerandcode.com.br/noticias/glm-5-2-forense-hack-hugging-face): Modelos comerciais recusaram analisar o hack do GPT-5.6. A forense rodou em GLM 5.2, open-weight, na infra da Hugging Face. Veja o problema da assimetria. - [Claude Code agora acha vulnerabilidade sozinho: testei o Claude Security no meu código](https://blog.beerandcode.com.br/tutoriais/claude-code-security-review): Testei o Claude Code security review: instalei o plugin Claude Security, rodei o scan num projeto Laravel e mostro findings, patches e limites. - [EUA ameaçam sancionar IA chinesa open source: o que muda pra quem usa Kimi e DeepSeek](https://blog.beerandcode.com.br/noticias/sancoes-ia-chinesa-open-source): Sanções à IA chinesa open source: o que é fato, o que é rumor e o que muda pra quem roda Kimi K3, DeepSeek e Qwen em produção. - [Créditos grátis do Fable 5: resgatar liga a cobrança por uso na sua conta sem avisar](https://blog.beerandcode.com.br/noticias/fable-5-creditos-gratis): Créditos grátis do Fable 5: resgatar ativa a cobrança por uso na sua conta. Veja como verificar e desativar o extra usage em um minuto. - [Banco de dados vetorial: qual usar e quando pgvector basta](https://blog.beerandcode.com.br/noticias/banco-de-dados-vetorial): Banco de dados vetorial na prática: pgvector vs. Qdrant, Pinecone e Chroma, até quantos vetores o Postgres aguenta e como medir recall e latência. - [FOMO de IA: por que você sente que está sempre ficando pra trás (e como sair da paralisia)](https://blog.beerandcode.com.br/noticias/fomo-de-ia-como-sair-da-paralisia): FOMO de IA tem dados: 84% dos devs usam IA e a confiança caiu. Por que a paralisia não é preguiça e o método pra sair: menos consumo, mais execução. - [Linha do tempo do GPT-6: de Altman em Washington ao lançamento do Astra (rastreador encerrado)](https://blog.beerandcode.com.br/noticias/gpt-6-lancamento-rastreador): O que era fato e o que era boato sobre o GPT-6 entre julho e o lançamento do Astra em 03/09/2026. Rastreador encerrado; a análise está no comparativo. - [Laguna S 2.1: o open-weight de 118B que custa 10x menos (e onde ele apanha)](https://blog.beerandcode.com.br/noticias/laguna-s-2-1-poolside-benchmarks): Laguna S 2.1 tem 118B parâmetros, 8B ativados e pesos abertos. Veja os benchmarks reais, o custo no OpenRouter e onde o modelo ainda apanha. - [Um agente da OpenAI fugiu do sandbox e hackeou a Hugging Face: 5 lições pra quem roda agente](https://blog.beerandcode.com.br/noticias/agente-openai-fugiu-sandbox-hugging-face): A OpenAI confirmou que um agente de IA escapou do sandbox, invadiu a Hugging Face e roubou o gabarito do benchmark. 5 lições para o seu agente. - [Como rodar um LLM local: guia do zero (Ollama, hardware e quando vale a pena)](https://blog.beerandcode.com.br/tutoriais/como-rodar-llm-local): Guia prático pra rodar um LLM local: instale o Ollama, entenda a conta de RAM e VRAM e saiba quando o local ganha da API. Do zero ao primeiro token. - [Gemini 3.6 Flash chegou: benchmarks, preço e por que o Google lançou o Flash antes do Pro](https://blog.beerandcode.com.br/noticias/gemini-3-6-flash-benchmarks-preco): Gemini 3.6 Flash chegou com preço de Flash e benchmarks perto do Pro. Veja os números, o custo por token, o Flash-Lite e se vale trocar hoje. - [O que é fine tuning? Guia prático (e quando NÃO usar)](https://blog.beerandcode.com.br/noticias/o-que-e-fine-tuning): O que é fine tuning? Ajustar os pesos de um modelo para fixar comportamento, não conhecimento. O guia direto e quando usar RAG ou contexto no lugar. - [Kimi K3 corrigiu 15 bugs que Codex e Fable recusaram — e a guerra dos guardrails começou](https://blog.beerandcode.com.br/noticias/kimi-k3-guardrails): O Kimi K3 corrigiu 15 bugs de segurança que Codex e Fable recusaram por guardrails. Na mesma semana, a HuggingFace teve a perícia travada. Entenda. - [Fable 5 e a Conjectura Jacobiana: o problema de 90 anos que a IA parece ter derrubado](https://blog.beerandcode.com.br/noticias/fable-5-conjectura-jacobiana): O Fable 5 ajudou a achar um contraexemplo para a Conjectura Jacobiana, aberta desde 1939. O que caiu, por que dá pra conferir e o que muda na matemática. - [Qwen 3.8 Max chegou: a Alibaba lançou um "Fable open source"? Benchmarks e primeiro teste](https://blog.beerandcode.com.br/noticias/qwen-3-8-max): Qwen 3.8 Max chegou: 2.4T de parâmetros, o que a comunidade testou e como acessar. Fable open source ou tropeço? A análise honesta. - [Codex com contexto reduzido: OpenAI cortou de 372k pra 272k sem avisar](https://blog.beerandcode.com.br/noticias/codex-contexto-reduzido): Codex com contexto reduzido: a OpenAI baixou de 372k pra 272k tokens sem avisar. O que muda, como detectar e os workarounds pra sessão longa. - [IA vai ficar mais cara? A conta real da OpenAI e da Anthropic](https://blog.beerandcode.com.br/noticias/ia-vai-ficar-mais-cara): IA vai ficar mais cara? Preço por token caiu 83%, custo por tarefa sobe até 18x ao ano. Margens, prejuízos e limites: a conta real de OpenAI e Anthropic. - [Como criar um agente de IA para WhatsApp: passo a passo com API (sem depender de SaaS)](https://blog.beerandcode.com.br/tutoriais/como-criar-um-agente-de-ia-para-whatsapp): Aprenda como criar um agente de IA para WhatsApp com Evolution API e Claude: webhook, código PHP, memória e custo real, sem pagar mensalidade de SaaS. - [IPO da Anthropic em outubro: o que muda pra quem usa Claude (preços, limites e o risco Kimi K3)](https://blog.beerandcode.com.br/noticias/anthropic-ipo): Anthropic mira IPO em outubro de 2026 avaliada em US$ 965 bi. Veja o que a pressão por receita pode mudar no preço do Claude Code e nos limites de uso. - [1Password for Claude: como o Claude faz login sozinho sem ver sua senha](https://blog.beerandcode.com.br/noticias/1password-for-claude): Como funciona o 1Password for Claude: a arquitetura zero-exposure que deixa o Claude logar em sites sem ver senha nem OTP, o setup e os limites. - [Kimi K3 chegou: o "Fable 5 chinês" que bate o Opus 4.8 — o que é real nos benchmarks](https://blog.beerandcode.com.br/noticias/kimi-k3-benchmarks-vs-claude): Kimi K3 da Moonshot estreou acima do Claude Opus 4.8 na Artificial Analysis. Veja os benchmarks reais, o preço de US$ 3/15 e o que ainda é só hype. - [Codex Micro: o teclado de US$ 230 da OpenAI esgotou em horas — vale a pena comprar?](https://blog.beerandcode.com.br/noticias/codex-micro-vale-a-pena): Codex Micro, o primeiro hardware da OpenAI: specs, preço no Brasil e a conta honesta de se o teclado de US$ 230 pra controlar agentes vale a pena. - [Como usar o Claude Design: guia para devs, do protótipo ao código](https://blog.beerandcode.com.br/tutoriais/claude-design-como-usar-para-devs): Como usar o Claude Design no fluxo de dev: design system extraído do codebase, round-trip com o Claude Code, preço e limites. Guia direto, sem hype. - [Fable 5 voltou: cota, créditos à parte e o que muda na prática](https://blog.beerandcode.com.br/noticias/fable-5-voltou): Fable 5 incluso em todos os planos Max e Team Premium a partir de 20/07, a 50% dos limites; Pro ganha US$ 100 em créditos. Veja o que muda na prática. - [GPT-5.6 no Codex: o modo Ultra rende 3 pontos, e o Terra gasta 2,6x mais tokens pra entregar pior](https://blog.beerandcode.com.br/noticias/gpt-5-6-sol-ultra-codex): GPT-5.6 no Codex: o modo Ultra rende 3 pontos no Terminal-Bench, e teste independente mostra o Terra gastando 2,6x mais tokens pra acertar menos. - [Vazamento do Claude Opus 5: do Honeycomb ao lançamento (tracker encerrado)](https://blog.beerandcode.com.br/noticias/claude-opus-5-vazamento): Registro histórico do rumor do Opus 5: o leak do Honeycomb no Cursor, as odds do Polymarket e o que cada claim acertou ou furou até o lançamento de 24/07. - [Prompt injection: o que é e os principais ataques de 2026 (e como se defender)](https://blog.beerandcode.com.br/noticias/prompt-injection-o-que-e-ataques-2026): O que é prompt injection, os ataques que marcaram 2026 (direta, indireta, tool poisoning) e o checklist de defesa em camadas que funciona. - [O que é Laravel e por que ele virou o framework da era da IA](https://blog.beerandcode.com.br/noticias/o-que-e-laravel): Entenda o que é Laravel, para que serve o framework PHP mais popular e por que ele virou a stack ideal para construir produtos com IA em 2026. - [Claude resolveu problema de física parado há 6 meses (e a conjectura de 12 anos de um Nobel)](https://blog.beerandcode.com.br/noticias/claude-resolveu-problema-de-fisica): Em duas semanas, Claude resolveu problema de física parado há 6 meses e ajudou o Nobel Giorgio Parisi a provar conjectura de 12 anos. Veja o método. - [GPT-5.6 Sol está banindo contas por "ameaça de cibersegurança": o que se sabe até agora](https://blog.beerandcode.com.br/noticias/gpt-5-6-sol-banindo-contas): GPT-5.6 Sol banindo contas por "ameaça de cibersegurança" em tarefas inofensivas, até macro de Excel. Veja o que se sabe e como proteger sua conta. - [Codex: OpenAI remove o limite de uso de 5 horas e a Anthropic responde em horas](https://blog.beerandcode.com.br/noticias/codex-limite-de-uso): OpenAI removeu o limite de uso do Codex e a Anthropic estendeu os limites do Claude Code em horas. Veja o que você ganhou de graça e qual plano compensa. - [Gemini Omni Flash na prática: como usar o gerador de vídeo do Google e se vale a pena](https://blog.beerandcode.com.br/noticias/gemini-omni-flash-como-usar): Testei o Gemini Omni Flash, gerador de vídeo do Google que substitui o Veo 3.1. Como usar, quanto custa, limites e veredito honesto vs Sora e Veo. - [GPT-5.6 "descobriu nova matemática"? O que Altman disse e o que os matemáticos responderam](https://blog.beerandcode.com.br/noticias/gpt-5-6-nova-matematica): Altman disse que o GPT-5.6 descobriu nova matemática. O que foi realmente alegado, o que isso significa pra um LLM e por que os matemáticos duvidam. - [Alibaba baniu o Claude Code: o que é real no "backdoor de detecção de China"](https://blog.beerandcode.com.br/noticias/alibaba-baniu-claude-code): A Alibaba baniu o Claude Code e mandou trocar pelo Qoder. Separamos o fato tecnico do panico geopolitico e o que muda pra quem roda coding agent. - [DeepSeek V4 Flash com 1M de contexto no seu RTX 5090: dá pra rodar local — mas tem um porém](https://blog.beerandcode.com.br/noticias/deepseek-v4-flash-local-5090): DeepSeek V4 Flash rodando 1M de contexto num RTX 5090: o que e real, o porem da RAM e quando a API sai mais barata que rodar local. - [LongCat 2.0: o modelo fantasma owl-alpha que sumiu do OpenRouter era um MoE de 1,6 trilhão](https://blog.beerandcode.com.br/noticias/longcat-2-0-owl-alpha-openrouter): O owl-alpha rodou disfarçado no OpenRouter e sumiu. Era a LongCat 2.0 da Meituan, um MoE de 1,6 trilhao treinado sem NVIDIA. A historia e o que ela ensina. - [Claude Code ficou 5x mais caro? O preço real em 2026 (Pro, Max e API na ponta do lápis)](https://blog.beerandcode.com.br/noticias/claude-code-preco-2026): O preço do Claude Code em 2026: planos Pro, Max e Team, API, a volta do Fable 5 com usage credits e o que há de fato no 'ficou 5x mais caro'. - [DeepSeek V4 vai custar por horário de pico: o preço peak/valley que muda a conta do open source](https://blog.beerandcode.com.br/noticias/deepseek-v4-preco): A DeepSeek V4 vai cobrar preço dinâmico por horário (peak/valley). Veja o que muda, quanto cai fora do pico e a conta vs Claude Opus 4.8 pra dev BR. - [Meta proíbe Claude Code e Codex dos próprios engenheiros: o que aconteceu](https://blog.beerandcode.com.br/noticias/meta-proibe-claude-code-engenheiros): A Meta proíbe Claude Code e Codex dos próprios engenheiros para proteger dados de treino. Veja o motivo real, fato vs boato e o checklist. - [Claude Sonnet 5: como interpretar os benchmarks na prática](https://blog.beerandcode.com.br/noticias/claude-sonnet-5-como-interpretar-benchmarks): Saiu o Claude Sonnet 5. Aprenda a interpretar os benchmarks na prática: custo por tarefa, esforço e ferramentas, no Claude Code e na integração de IA. - [HP adotou a OpenAI Frontier. O que isso muda (e o que é só anúncio)](https://blog.beerandcode.com.br/noticias/hp-adotou-openai-frontier): A HP adotou a OpenAI Frontier, a plataforma de agentes da OpenAI. Veja o que foi entregue, o que ainda é promessa e o que muda pra quem cria software. - [Claude Code e malware: como um repositório "limpo" engana seu agente de código (e como blindar o setup)](https://blog.beerandcode.com.br/noticias/claude-code-malware-repo-limpo): O time 0din da Mozilla mostrou um ataque de Claude Code malware via repo GitHub limpo. Veja o vetor passo a passo e um checklist pra blindar seu setup. - [Fable 5 jailbreak: o que quebrou em dias e o que isso diz sobre segurança de LLM](https://blog.beerandcode.com.br/noticias/fable-5-jailbreak): Fable 5 jailbreak: o que realmente quebrou nos guardrails do modelo da Anthropic e o que isso muda pra quem coloca LLM em producao. - [Anthropic com acesso bloqueado no Brasil: por que os EUA tiraram o Mythos e o Fable do ar (e o processo que quer reverter)](https://blog.beerandcode.com.br/noticias/anthropic-acesso-bloqueado-brasil): Anthropic com acesso bloqueado no Brasil: os EUA mandaram desligar Fable 5 e Mythos 5 para estrangeiros. Veja o que muda e o processo que quer reverter. - [Como construir um agente de bolão da Copa 2026 no WhatsApp com Evolution API e N8N](https://blog.beerandcode.com.br/tutoriais/agente-bolao-copa-whatsapp-evolution-api-n8n): Tutorial prático: monte um agente de bolão da Copa 2026 no WhatsApp com Evolution API, N8N e IA. Guardrails, engenharia de prompt e contexto. - [GPT-5.6 liberado só com aval do governo dos EUA: o que muda pra quem constrói com IA](https://blog.beerandcode.com.br/noticias/gpt-5-6-aval-governo-eua): Pela primeira vez o governo dos EUA decidiu quem pode usar um modelo de IA antes do lançamento. O caso GPT-5.6 e o que muda pra quem constrói com IA. - [GPT-5.6 Sol, Terra ou Luna: a diferença real e por que o Sol custa 25x mais que o Luna](https://blog.beerandcode.com.br/noticias/gpt-5-6-sol-terra-luna-qual-usar): Qual a diferença entre GPT-5.6 Sol, Terra e Luna? Preço atualizado dos três tiers, a conta que mudou em julho e qual usar em produção. - [Estudo da Microsoft: GitHub Copilot aumenta a produtividade do dev em 40% — o que o número esconde](https://blog.beerandcode.com.br/noticias/github-copilot-produtividade-estudo-microsoft-40): Estudo Microsoft: GitHub Copilot produtividade sobe 40% em PRs, mas a metrica nao mede qualidade nem ganho total. Entenda o paper. - [Anthropic vai exigir verificação de identidade no Claude? O que muda (e o que não) pra quem usa no Brasil](https://blog.beerandcode.com.br/noticias/anthropic-verificacao-de-identidade-claude): A Anthropic começou a pedir verificação de identidade no Claude via Persona. Veja o que muda (e o que não) pra dev no Brasil e o que é pânico. - [OpenAI Daybreak: o GPT-5.5-Cyber que caça e corrige vulnerabilidades sozinho](https://blog.beerandcode.com.br/noticias/openai-daybreak-gpt-5-5-cyber): O que o OpenAI Daybreak e o GPT-5.5-Cyber fazem, onde entram no fluxo do dev e até onde dá pra confiar correção de vulnerabilidade a um modelo. - [CLAUDE.md: as 4 cláusulas do Karpathy e a 5ª que a comunidade adicionou](https://blog.beerandcode.com.br/tutoriais/claude-md-clausulas-karpathy): As 4 cláusulas de claude.md que o Karpathy usa, mais a 5ª da comunidade. Guia prático pra escrever um claude.md que o Claude Code obedece. - [Mistral OCR 4: testei o novo modelo e ele lê PDF melhor que o ChatGPT?](https://blog.beerandcode.com.br/noticias/mistral-ocr-4-le-pdf-melhor-que-chatgpt): Testei o Mistral OCR 4: o que muda na extração de PDF, como compara com o OCR do ChatGPT e do Gemini e quando vale plugar na sua stack. - [Mythos da Anthropic "invadiu a NSA em horas"? O que é fato e o que é boato](https://blog.beerandcode.com.br/noticias/mythos-anthropic-invadiu-nsa-fato-ou-boato): Mythos da Anthropic invadiu a NSA em horas? Separamos fato de boato na frase que viralizou: o modelo é real, mas a acusação do hack é contestada. - [OpenAI Codex bug: ele grava 640 TB/ano e pode matar seu SSD em menos de 1 ano](https://blog.beerandcode.com.br/noticias/openai-codex-bug-ssd): O OpenAI Codex bug que detona seu SSD: o log em SQLite roda em TRACE e grava 640 TB/ano. Veja como diagnosticar e o workaround de uma linha. - [Fable 5 casos de uso: o que os EUA construíram nas 72h antes do bloqueio](https://blog.beerandcode.com.br/noticias/fable-5-casos-de-uso-antes-do-bloqueio): Curadoria dos fable 5 casos de uso que devs dos EUA construíram nas 72h antes do bloqueio: MMORPG, migração de 50M linhas e agentes autônomos. - [GLM 5.2: o melhor modelo de código open source é chinês, MIT e 6x mais barato](https://blog.beerandcode.com.br/noticias/glm-5-2-open-source-melhor-codigo): O GLM 5.2 é open source (MIT), fica a 0,7 ponto do Opus 4.8 em código e custa 6x menos. Veja os benchmarks, o preço e quando vale o self-host. - [Sakana Fugu: o modelo que rege Fable 5 e Mythos sem treinar nenhum frontier](https://blog.beerandcode.com.br/noticias/sakana-fugu): Sakana Fugu: o modelo da Sakana AI que orquestra um pool de LLMs e iguala Fable 5 e Mythos sem treinar nenhum frontier. Veja a arquitetura por trás. - [GPT 5.6: data de lançamento, o vazamento no Codex e o que os rumores acertaram (rastreador)](https://blog.beerandcode.com.br/noticias/gpt-5-6-data-lancamento-vazamentos-rastreador): A string no Codex, a aposta do Polymarket e os specs que caíram: o rastreador do GPT 5.6 do vazamento ao lançamento de 26/06. Preço atual no comparativo. - [RAG híbrido na prática: BM25, embeddings e reranker](https://blog.beerandcode.com.br/tutoriais/rag-hibrido-na-pratica-bm25-embeddings-reranker): Aprenda a montar um RAG híbrido combinando BM25, embeddings e um reranker cross-encoder. Tutorial em Python com LangChain, RRF e Cohere Rerank. - [Como criar evals para agentes de IA com LLM-as-a-judge](https://blog.beerandcode.com.br/tutoriais/evals-para-agentes-de-ia-llm-as-a-judge): Aprenda a criar evals para agentes de IA com LLM-as-a-judge: dataset, rubricas, scoring com barra de erro e gate no CI. Sem eval, deploy é no escuro. - [Modelos de IA open source valem a pena em 2026? A conta real de rodar local](https://blog.beerandcode.com.br/noticias/modelos-de-ia-open-source-valem-a-pena-2026): Modelos de IA open source fecharam o gap em 2026, mas rodar local não é de graça. A conta real de custo, privacidade e velocidade. - [Prontidão para IA: como deixar sua empresa pronta de verdade](https://blog.beerandcode.com.br/noticias/prontidao-para-ia-guia): Prontidão para IA não é comprar licença. Veja o framework de AI readiness em 4 frentes: dados, processos, pessoas e governança, e onde sua empresa trava. - [Claude Code ou Codex: o Codex ganha o terminal por 13 pontos, o Claude ganha o repo difícil por 10](https://blog.beerandcode.com.br/noticias/melhor-ia-para-programar-2026-claude-code-vs-codex): Claude Code ou Codex? Codex lidera o Terminal-Bench por 13 pontos, Claude Code lidera o SWE-bench Pro por 10. Veredito por cenário e custo real. - [Como criar um bot no Slack com Claude: um agente de dados no seu workspace](https://blog.beerandcode.com.br/tutoriais/criar-bot-no-slack-com-claude): Tutorial passo a passo para criar um bot no Slack com Claude que responde perguntas sobre seus dados. Baseado no cookbook da Anthropic. - [Como criar um servidor MCP do zero: tools, resources e prompts, do stdio ao HTTP](https://blog.beerandcode.com.br/tutoriais/como-criar-um-servidor-mcp-do-zero): Aprenda como criar um servidor MCP em Python do zero: tool, resource e prompt rodando em stdio e HTTP, plugado no Claude passo a passo. - [4 mitos sobre o engenheiro de IA: o que ele NÃO faz em 2026](https://blog.beerandcode.com.br/noticias/engenheiro-de-ia-o-que-faz-no-dia-a-dia): Treinar modelo, PhD, fine-tuning e 'usar ChatGPT no trabalho': os 4 mitos sobre o engenheiro de IA em 2026 e por que a vaga real é engenharia de software. - [Desenvolvedor de IA vs Engenheiro de IA: 7 diferenças que importam](https://blog.beerandcode.com.br/noticias/desenvolvedor-de-ia-vs-engenheiro-de-ia): Desenvolvedor de IA vs engenheiro de IA: escopo, skills, salário e carreira comparados. Veja as 7 diferenças que decidem sua trilha em 2026. - [Agent improvement loop: o ciclo que faz o agente melhorar o próprio código](https://blog.beerandcode.com.br/tutoriais/agent-improvement-loop-melhora-proprio-codigo): O agent improvement loop faz o agente gerar, testar, avaliar e corrigir o próprio código. Monte o loop com evals e a trava que só aceita melhoria. - [Claude Code em monorepo: como não estourar contexto em base grande](https://blog.beerandcode.com.br/tutoriais/claude-code-monorepo): Como usar Claude Code em monorepo e base grande sem estourar o contexto: escopo de sessão, CLAUDE.md em camadas, code intelligence e subagentes. - [Claude Code hooks, slash commands e MCP: os três recursos que mudam seu fluxo](https://blog.beerandcode.com.br/tutoriais/claude-code-hooks-slash-commands-mcp): Guia prático de Claude Code hooks, slash commands e MCP: os três recursos que transformam o agente em parte do seu fluxo de engenharia. - [Codex CLI: como usar goals para guiar o agente sem microgerenciar](https://blog.beerandcode.com.br/tutoriais/codex-cli-goals-guiar-agente-openai): Use goals no Codex CLI para o agente da OpenAI perseguir um objetivo sozinho: escreva o goal como contrato, com escopo e condição de parada clara. - [Sistema multiagente: quando vale dividir e quando é overhead](https://blog.beerandcode.com.br/tutoriais/sistemas-multiagentes-orquestracao-assincrona): Sistema multiagente: quando dividir em vários agentes compensa, a conta de tokens e latência do handoff, e os casos em que dividir é só overhead. - [Ferramentas de engenharia de contexto que eu uso em produção](https://blog.beerandcode.com.br/tutoriais/ferramentas-de-engenharia-de-contexto-em-producao): As ferramentas de engenharia de contexto que uso em produção para segurar agentes: gestão de janela, compressão, recuperação e observabilidade. - [Agentic RAG: quando seu RAG precisa virar agente](https://blog.beerandcode.com.br/tutoriais/agentic-rag-quando-seu-rag-vira-agente): RAG clássico busca uma vez e reza. Veja quando usar agentic RAG, como o agente decide buscar e re-buscar, e como montar o loop sem explodir o custo. - [Claude Opus 4.8 vs Minimax M3 vs Qwen 3: paguei caro, paguei barato e rodei de graça](https://blog.beerandcode.com.br/noticias/claude-opus-4-8-vs-minimax-m3-vs-qwen-3-local): Claude Opus 4.8 vs Minimax M3 vs Qwen 3 local: construí o mesmo app 3x, sem mão humana. Tempo, custo e veredito honesto sobre pago, barato e de graça. - [Claude -p vai morrer: como migrar para o Claude Agent SDK](https://blog.beerandcode.com.br/tutoriais/claude-agent-sdk-migrar-do-claude-p): Guia prático para migrar do claude -p para o Claude Agent SDK: o que muda no seu plano em 15/06 e como rodar agentes headless do jeito novo. - [Fable 5 bloqueado: o OpenRouter Fusion prova que painel de modelos já supera qualquer frontier](https://blog.beerandcode.com.br/noticias/fable-5-bloqueado-openrouter-fusion): Fable 5 bloqueado pelo governo dos EUA. O OpenRouter Fusion prova que painel de modelos baratos supera qualquer frontier solo em deep research. - [O que é Harness de IA? O ambiente que faz seu agente parar de travar](https://blog.beerandcode.com.br/noticias/o-que-e-harness-de-ia): Harness de IA é o ambiente que roda o agente: loop, ferramentas, estado e guardrails. Entenda o que é harness e por que ele faz o agente travar. - [Reduzir custo de API de IA: os vazamentos de token mais comuns](https://blog.beerandcode.com.br/tutoriais/reduzir-custo-api-de-ia): Sua conta de API de IA veio cara? Veja os 5 vazamentos de token mais comuns em produção e como reduzir o custo de API de IA sem cortar feature. - [Prompt para gerar código: 8 padrões que tiram o ar de tutorial genérico da IA](https://blog.beerandcode.com.br/tutoriais/prompt-para-gerar-codigo-8-padroes): 8 padrões de prompt para gerar código que segue o padrão do seu projeto, não o exemplo de tutorial. Direto das docs da Anthropic e do Claude Code. - [Por que o agente esquece tudo: como dar memória de verdade ao seu agente de IA](https://blog.beerandcode.com.br/tutoriais/memoria-de-agente-de-ia): Seu agente de IA esquece tudo a cada sessão porque o modelo é stateless. Entenda memória de agente de IA: curto, longo prazo e como dar de verdade. - [Estourou o limite de tokens do ChatGPT: por que a IA esquece e como resolver](https://blog.beerandcode.com.br/tutoriais/limite-de-tokens-chatgpt-ia-esquece): Estourou o limite de tokens? Entenda a janela de contexto, por que a IA esquece a conversa e como resolver com resumo, RAG e memória. - [GPT-5 na prática: vale trocar o que você já usa pra programar?](https://blog.beerandcode.com.br/noticias/gpt-5-vale-trocar-programar): GPT-5 vale a pena pra programar? Comparamos código real, custo por tarefa e quando trocar de modelo se paga. No tom honesto da marca. - [IA para programar: como usar sem virar refém da ferramenta](https://blog.beerandcode.com.br/noticias/ia-para-programar-sem-virar-refem): Use IA para programar como alavanca, não como muleta: o workflow para ganhar velocidade sem perder o controle do próprio código. - [Tool calling não funciona? Por que seu agente chama a ferramenta errada (e como consertar)](https://blog.beerandcode.com.br/tutoriais/tool-calling-nao-funciona): Tool calling não funciona e seu agente chama a ferramenta errada? Conserte com descrição, schema e fallback. Guia prático com código na API da Claude. - [Seu RAG não funciona? As causas reais (e o conserto de cada uma)](https://blog.beerandcode.com.br/tutoriais/rag-nao-funciona-causas-e-conserto): Seu RAG não funciona e retorna resposta errada? As 4 causas reais (chunking, embedding, reranker, prompt) e o conserto de cada uma. - [A IA gerou código errado: por que acontece e como revisar antes de quebrar produção](https://blog.beerandcode.com.br/noticias/ia-gera-codigo-errado-revisar-antes-producao): Por que a IA gera código errado que roda mas quebra em produção, e o processo de revisão que pega o problema antes do merge. - [Por que seu agente de IA entra em loop infinito (e como pôr um freio)](https://blog.beerandcode.com.br/tutoriais/agente-de-ia-loop-infinito): Seu agente de IA entra em loop infinito? As 3 causas (sem critério de parada, tool result ruim, prompt ambíguo) e os freios pra cortar em produção. - [Embeddings: o que são e por que sua busca semântica erra](https://blog.beerandcode.com.br/tutoriais/o-que-e-embedding): Embeddings explicados sem enrolação: o que são, como escolher o modelo certo em 2026 e os 3 erros que fazem sua busca semântica devolver resultado errado. - [Melhor IA para programação em 2026: testei as principais lado a lado](https://blog.beerandcode.com.br/noticias/melhor-ia-para-programacao-2026): Qual a melhor IA para programação em 2026? Testei Claude Code, Cursor e Copilot na mesma task real, com custo, contexto e qualidade do diff. - [Fable 5 ou Opus 4.8: qual usar (e as 10 tarefas onde a diferença aparece)](https://blog.beerandcode.com.br/noticias/claude-fable-5-vs-opus-4-8): Fable 5 ou Opus 4.8? Veredito por tipo de tarefa, as 10 situações em que o Fable resolve e o 4.8 travava, e quando o Opus ainda compensa. - [Por que a IA alucina — e como reduzir alucinação no seu produto](https://blog.beerandcode.com.br/noticias/por-que-a-ia-alucina-e-como-reduzir-alucinacao-no-seu-produto): Por que a IA alucina e como reduzir alucinação de IA no seu produto: grounding, RAG, citações e guardrails que cortam a invenção do LLM. - [Como criar um agente de IA do zero (com código, não no-code)](https://blog.beerandcode.com.br/tutoriais/como-criar-um-agente-de-ia-do-zero): Aprenda como criar um agente de IA do zero em Python: loop de raciocínio, tool calling e memória, sem framework e sem plataforma no-code. - [Claude Code: o que é, como funciona e por que os devs migraram pra ele](https://blog.beerandcode.com.br/noticias/claude-code-o-que-e-como-funciona): O que é o Claude Code, como funciona e como ele difere de Copilot e Cursor. Onde a ferramenta agêntica de IA entrega de verdade e onde não vale a pena. - [Vibe coding: onde quebra e o que fazer depois do protótipo](https://blog.beerandcode.com.br/noticias/vibe-coding-o-que-e-onde-quebra): Vibe coding acelera até o protótipo virar produto. Os 4 pontos onde ele quebra — estado, custo, avaliação e debug — e a lista do que falta antes do deploy. - [Arquitetura de agentes de IA: o blueprint em 6 camadas](https://blog.beerandcode.com.br/noticias/arquitetura-de-agentes-de-ia): Arquitetura de agentes de IA em 6 camadas: diagrama de referência, 3 problemas desenhados do zero e o checklist de produção pra defender o agente numa review. - [O que é RAG (e onde ele termina e a memória começa)](https://blog.beerandcode.com.br/noticias/o-que-e-rag): O que é RAG, como funciona por dentro e por que RAG não é memória nem fine-tuning. Entenda onde cada peça começa antes de quebrar seu agente. - [Métricas de avaliação de agentes de IA: o que medir em cada etapa (retrieval, tool, resposta)](https://blog.beerandcode.com.br/tutoriais/avaliacao-de-agentes-de-ia-evals-honestos): Como medir um agente de IA por etapa: retrieval, decisão de tool e resposta final. Golden set de falhas reais, pass@1 vs pass^k e LLM como juiz com freio. - [Guardrails para agentes de IA: validando o que entra e o que sai](https://blog.beerandcode.com.br/tutoriais/guardrails-para-agentes-de-ia): Guardrails para agentes de IA são as cercas que validam a entrada, restringem as ferramentas e checam a saída. Veja os 3 tipos e onde encaixar cada um. - [5 anti-patterns que quebram seu agente de IA em produção](https://blog.beerandcode.com.br/noticias/anti-patterns-agentes-ia-producao): Os 5 erros de arquitetura que mais quebram agentes de IA em produção: context stuffing, tools sem timeout, retry burro, observabilidade e guardrails. - [Retriever como tool: o padrão de 4 nós do LangGraph (grade e rewrite)](https://blog.beerandcode.com.br/tutoriais/agentic-rag-quando-o-agente-decide-o-que-buscar): Como registrar o retriever como tool e montar o loop generate → retrieve → grade → rewrite com critério de parada. Recorte do guia de agentic RAG. - [pgvector no Postgres: onde guardar a memória do seu agente](https://blog.beerandcode.com.br/tutoriais/pgvector-postgres-memoria-do-seu-agente): Antes de assinar um serviço de memória, veja por que o Postgres com pgvector resolve 80% do problema: instalação, uso no Laravel e quando migrar. - [Montando um agente mínimo viável com Claude API + Laravel](https://blog.beerandcode.com.br/tutoriais/agente-minimo-viavel-claude-api-laravel): Como montar um agente com Claude API e Laravel em PHP puro, sem framework de agente. O loop prompt, tool use e resposta na mão. - [Reranker: o passo que faz seu RAG parar de devolver lixo](https://blog.beerandcode.com.br/tutoriais/reranker-rag): O reranker reordena os candidatos do seu RAG por relevância real. Veja cross-encoder vs busca híbrida e quando cada um vale, com código. - [RAG do zero: chunking, embeddings e busca que funciona](https://blog.beerandcode.com.br/tutoriais/rag-do-zero-chunking-embeddings-busca): Tutorial de RAG do zero: chunking recursive com overlap, embeddings e busca por similaridade no pgvector. O passo a passo que funciona, sem framework. - [Quando usar RAG (e quando fine-tuning ou contexto resolvem melhor)](https://blog.beerandcode.com.br/noticias/quando-usar-rag-fine-tuning-ou-contexto): Quando usar RAG, quando fine-tuning e quando só o contexto resolve. O mapa de decisão por volatilidade, custo, rastreabilidade e tamanho. - [System prompt de produção: a espinha dorsal do comportamento do agente](https://blog.beerandcode.com.br/tutoriais/system-prompt-comportamento-do-agente): O system prompt é a constituição do agente: papel, políticas, ferramentas e formato. Como estruturar um de produção e por que não é prompt de chat. - [Progressive disclosure: como não afogar seu agente em 50 ferramentas](https://blog.beerandcode.com.br/tutoriais/progressive-disclosure-agente-50-ferramentas): Empilhar 50 ferramentas degrada a escolha do agente e estoura tokens. Veja como progressive disclosure carrega tools sob demanda e o que muda. - [Programmatic tool calling: deixe o agente escrever o código em vez de chamar tool a tool](https://blog.beerandcode.com.br/tutoriais/programmatic-tool-calling): Programmatic tool calling deixa o agente escrever um código que orquestra as tools em vez de chamar uma a uma. Veja o padrão na Claude API e no Code Mode. - [Engenharia de prompt: o guia honesto (sem fórmula mágica)](https://blog.beerandcode.com.br/noticias/engenharia-de-prompt-guia-honesto): Engenharia de prompt sem fórmula mágica: estrutura, instrução clara, few-shot e formato de saída para quem constrói software com IA. - [Como criar seu primeiro MCP server (tool + resource) e plugar no Claude](https://blog.beerandcode.com.br/tutoriais/como-criar-mcp-server): Tutorial em PT-BR pra escrever um MCP server do zero em Python: uma tool que consulta CEP e um resource com os padroes do time, plugado no Claude. - [Tool calling na prática: como o agente decide chamar uma ferramenta](https://blog.beerandcode.com.br/tutoriais/tool-calling-na-pratica): Como o agente decide chamar uma tool ou responder direto: loop ReAct, campos tool_use/tool_result e uma tool de busca em banco no Laravel via Claude API. - [Engenharia de contexto: o que vai no prompt (e o que NÃO vai)](https://blog.beerandcode.com.br/noticias/engenharia-de-contexto-o-que-vai-no-prompt): Engenharia de contexto vai além do RAG e do prompt: aprenda a curar a janela do agente, evitar context rot e o método da Anthropic. - [O que é MCP: o protocolo que virou o padrão de tools dos agentes de IA](https://blog.beerandcode.com.br/noticias/o-que-e-mcp): O que é MCP: o protocolo aberto que conecta agentes de IA a ferramentas e dados. Veja a arquitetura, as primitivas e por que virou padrão. - [O que é um agente de IA (e o que é só um wrapper de prompt)](https://blog.beerandcode.com.br/noticias/o-que-e-um-agente-de-ia): O que é um agente de IA? Não é prompt bonito: é o loop percepção-decisão-ação-observação e os 4 blocos mínimos que separam agente de chatbot. - [Compliance EU AI Act + NIST RMF: checklist de 18 itens para times brasileiros que vendem pra fora](https://blog.beerandcode.com.br/tutoriais/compliance-eu-ai-act-nist-rmf-checklist-18-itens-brasil): Checklist de 18 itens para times brasileiros que vendem IA pra UE conciliarem EU AI Act, NIST RMF e GDPR antes de agosto de 2026. - [Reasoning models em produção: quando o trade de latência vale a pena](https://blog.beerandcode.com.br/noticias/reasoning-models-em-producao-quando-vale-o-trade-de-latencia): Reasoning model resolve o que o modelo normal não resolve, mas custa caro. Veja quando vale o3, DeepSeek-R1 ou Claude com extended thinking. - [Context engineering: a skill nº1 do AI engineer em 2026](https://blog.beerandcode.com.br/tutoriais/context-engineering-skill-ai-engineer-2026): Os 5 pilares do context engineering, stack Laravel com pgvector e bge-reranker, e a métrica que recrutador olha em 2026: context utilization ratio. - [Plan-and-Execute: o pattern que cortou 90% do custo do nosso agente](https://blog.beerandcode.com.br/noticias/plan-and-execute-pattern-cortou-90-custo-agente): Como o pattern Plan-and-Execute derrubou o custo do nosso agente de US$ 2.300 para US$ 220 por mês, com planilha de tokens e código Laravel real. - [MCP em produção: OAuth 2.1, schemas validados e o gateway que precisa estar entre você e o agente](https://blog.beerandcode.com.br/tutoriais/mcp-em-producao-oauth-schema-gateway): Veja como levar MCP para produção com Streamable HTTP, OAuth 2.1, JSON Schema estrito e gateway corporativo entre agente e servidor. - [RAG + fine-tuning juntos: a arquitetura híbrida que joga a briga "ou um ou outro" no lixo](https://blog.beerandcode.com.br/noticias/rag-fine-tuning-juntos-arquitetura-hibrida-96): Entenda por que RAG e fine-tuning juntos viraram padrão em 2026, com benchmark, roteamento por classificador e quando evitar overengineering. - [Multi-agent em Laravel: 3 padrões testados em produção (Orchestrator, Hierarchical, Swarm)](https://blog.beerandcode.com.br/tutoriais/multi-agent-laravel-3-padroes-orchestrator-hierarchical-swarm): Orchestrator, Hierarchical e Swarm: 3 arquiteturas multi-agent rodando em Laravel com Prism PHP, state machine, trace ID e custo medido. - [Claude Opus 4.8 chegou: o que muda de verdade pra quem entrega IA em produção](https://blog.beerandcode.com.br/noticias/claude-opus-4-8-producao-ia): Claude Opus 4.8 lidera o SWE-Bench Pro com 69,2%, erra 4x menos bug no código que gera e mantém o preço do 4.7. Veja os benchmarks e o que muda na prática. - [Laravel Boost: o MCP oficial que ensina o agente a ler seu app antes de gerar código](https://blog.beerandcode.com.br/noticias/laravel-boost-mcp-oficial-laravel): Entenda como o Laravel Boost expõe schema, models, rotas e logs ao agente para gerar código mais correto no seu app Laravel. - [Observabilidade de agentes de IA: LangSmith vs Langfuse vs Helicone (e o que cada um NÃO faz)](https://blog.beerandcode.com.br/tutoriais/observabilidade-agentes-ia-langsmith-langfuse-helicone): Observabilidade de LLM na prática: LangSmith vs Langfuse vs Helicone, setup self-hosted em Laravel e o tracing mínimo pra rodar sem plataforma. - [Ferramentas de IA para dev backend: top 12 testadas em 90 dias de Laravel real](https://blog.beerandcode.com.br/noticias/ferramentas-de-ia-backend-top-12-testadas-2026): Review de 12 ferramentas de IA testadas por 90 dias em um Laravel real, com notas, critérios práticos e o que vale usar em backend. - [Filas no Laravel em 2026: Horizon, Redis e tracing distribuído](https://blog.beerandcode.com.br/tutoriais/filas-laravel-2026-horizon-redis-tracing): Fila Laravel com IA dentro vira roleta russa sem observabilidade. Stack: Horizon, Redis 7, filas por SLA, retry com idempotency e tracing OpenTelemetry. - [Como documentar decisões técnicas com IA: ADRs que envelhecem bem (e o Claude que escreve com você)](https://blog.beerandcode.com.br/tutoriais/como-documentar-decisoes-tecnicas-com-ia-adrs-que-envelhecem-bem): Fluxo Claude para gerar ADRs em 4 minutos: template em 7 seções que envelhece bem, prompt mestre em XML e três anti-padrões clássicos. - [Glossário do AI Engineer Vol.2: 20 termos NOVOS que apareceram em 2026 (que você não pode chegar sem saber)](https://blog.beerandcode.com.br/noticias/glossario-ai-engineer-vol-2-2026): Veja 20 termos que entraram no vocabulário da IA em 2026, com exemplos práticos e um bônus com 5 expressões que perderam força. - [Pipeline de revisão automatizada de PR com GitHub Actions e Claude](https://blog.beerandcode.com.br/tutoriais/pipeline-revisao-pr-github-actions-claude): Aprenda a montar um pipeline de revisão de PR com GitHub Actions e Claude, com gate, reviewer, escalonamento humano e testes via artisan. - [Vale a pena usar Cursor em 2026? 6 meses rodando Cursor, Claude Code e Windsurf lado a lado](https://blog.beerandcode.com.br/noticias/cursor-vs-claude-code-vs-windsurf-6-meses-2026): Cursor vs Claude Code vs Windsurf depois de 6 meses no mesmo projeto Laravel. Pricing maio 2026, benchmarks reais e veredito por persona. - [30 perguntas de entrevista para AI engineer (e como eu respondo cada uma)](https://blog.beerandcode.com.br/tutoriais/30-perguntas-entrevista-ai-engineer): Veja 30 perguntas reais de entrevista para AI engineer em 2026, com respostas curtas, visão sênior, red flags e perguntas para avaliar a empresa. - [Deploy de Laravel em produção em 2026: Forge, Cloud, Sail ou Kubernetes?](https://blog.beerandcode.com.br/tutoriais/deploy-de-laravel-em-producao-em-2026-forge-cloud-sail-ou-kubernetes): Forge, Cloud, Sail+VPS ou Kubernetes em 2026? Qual escolher, a armadilha do serverless puro e checklist de 18 itens antes do go-live. - [Migrei um projeto real de Prism pro Laravel AI SDK: 47 linhas a menos, diff aberto](https://blog.beerandcode.com.br/noticias/laravel-ai-sdk-vale-migrar-do-prism): Portei um projeto real de Prism pro Laravel AI SDK e abri o diff: 47 linhas a menos, provider em um atributo, vector store no Eloquent e quando não migrar. - [5 padrões de prompt que sobem o sinal do code review com LLM de 12% pra 67%](https://blog.beerandcode.com.br/tutoriais/5-padroes-prompt-code-review-llm): 5 padrões de prompt que tiram o ruído do code review com LLM e sobem o signal ratio acima de 60%. Com workflow Laravel e REVIEW.md pronto. - [LLM local vs API em 2026: a planilha real de 90 dias rodando os dois lado a lado](https://blog.beerandcode.com.br/noticias/llm-local-vs-api-2026-planilha-90-dias): Chatbot de TI com 12 mil chamadas/dia: Llama 3.3 70B em duas A100 vs Claude Haiku 4.5. Planilha de 90 dias, break-even e veredito por persona. - [Adoção segura de IA na empresa: EU AI Act + NIST RMF na prática (e o que o jurídico quer ver)](https://blog.beerandcode.com.br/tutoriais/adocao-segura-ia-empresa-eu-ai-act-nist-rmf): Em 2 de agosto de 2026 o EU AI Act ganha enforcement. Guia com 4 níveis de risco, NIST RMF, checklist de 12 itens e template AIDR. - [AI engineer no 2º semestre de 2026: o que o recrutador vai pedir](https://blog.beerandcode.com.br/noticias/ai-engineer-2-semestre-2026-skills-recrutador): Análise de 200 vagas de maio/2026: 4 skills que sobem, 3 que perdem peso e um roteiro de 90 dias pra entrar na shortlist. - [Guia de RAG para devs backend: do zero ao pgvector em Laravel](https://blog.beerandcode.com.br/tutoriais/guia-rag-backend-pgvector-laravel): Tutorial RAG em Laravel com pgvector, busca híbrida BM25 + embeddings (RRF), tool use no Claude API e métricas: recall@5, faithfulness e p95. - [Google I/O 2026: 7 anúncios que mudam o trabalho do AI engineer brasileiro](https://blog.beerandcode.com.br/noticias/google-io-2026-7-anuncios-ai-engineer-brasileiro): Os 7 anúncios do Google I/O 2026 que afetam o AI engineer brasileiro, com comparativo Gemini 3.5 Flash, Sonnet 4.5 e GPT-5.5 em tarefas backend. - [Quanto custa um agente em produção em 2026: planilha real depois de 6 meses](https://blog.beerandcode.com.br/noticias/custo-agente-ia-producao-2026-planilha-tco): Balancete real de 6 meses operando um agente em produção. Os 6 buckets de custo que a calculadora oficial não mostra, com números e fontes. - [Quando NÃO usar Agentic Code: 8 cenários onde o agente é prejuízo](https://blog.beerandcode.com.br/noticias/quando-nao-usar-agentic-code): 8 cenários reais em que rodar agentic code custa mais caro, demora mais e erra mais que fazer na mão. Contraponto técnico ao hype agêntico em 2026. - [AI Engineer no Brasil: as 6 senioridades que o mercado realmente paga (e o que cada uma entrega)](https://blog.beerandcode.com.br/noticias/senioridades-ai-engineer-brasil-2026): Entenda as 6 senioridades de AI Engineer no Brasil em 2026, com entregáveis por nível, faixa salarial e critérios reais de promoção. - [TDD com agentes: como escrever testes que sobrevivem ao código gerado](https://blog.beerandcode.com.br/tutoriais/tdd-com-agentes-testes-que-sobrevivem): Aprenda TDD com agentes em Laravel: proteja testes com hooks, CI e Pest para evitar que a IA enfraqueça ou delete a especificação. - [Code review com IA: benchmark de 7 ferramentas (precision e recall) e como medir se o seu bot acerta](https://blog.beerandcode.com.br/tutoriais/code-review-com-ia-sem-virar-carimbador): Workflow claude-code-action pra Laravel, filtro de confiança com threshold 80, armadilhas de fork e secrets, e o script que mede precision e recall do bot. - [Agente autônomo: os 4 níveis de autonomia na prática](https://blog.beerandcode.com.br/noticias/4-niveis-autonomia-agentic-code): Agente autônomo não é tudo ou nada. Veja os 4 níveis de autonomia, o critério de risco que define o teto de cada sistema e como aprovar em lote. - [Portfólio de AI Engineer: 5 projetos que abrem porta sem precisar de mestrado](https://blog.beerandcode.com.br/tutoriais/portfolio-ai-engineer-5-projetos-sem-mestrado): Cinco projetos de portfólio para AI engineer em 2026: tool use, RAG com Ragas, eval no CI, subagentes e harness em produção. - [Glossário do AI Engineer 2026: 30 termos que todo engenheiro precisa saber (sem hype)](https://blog.beerandcode.com.br/tutoriais/glossario-ai-engineer-2026-30-termos): 30 termos práticos de IA agêntica em 2026: do RAG ao harness, do MCP à ReAct. Glossário de campo para AI Engineers com exemplo concreto. - [Hands-on: meu primeiro Pull Request 100% gerado por agente em Laravel (com diff e revisão)](https://blog.beerandcode.com.br/tutoriais/hands-on-pr-100-gerado-por-agente-laravel): Case study real de PR em Laravel gerado 100% por agente: harness, loop de 43 min, diff, custo e os 3 bugs que escaparam. Veredito honesto sobre produção. - [Agentic Code vs Vibe Coding vs SDD: a tabela definitiva pra escolher por contexto](https://blog.beerandcode.com.br/noticias/agentic-code-vs-vibe-coding-vs-sdd-tabela-decisao): Agentic code vs vibe coding vs SDD: definição operacional dos três, tabela com 8 critérios e árvore de decisão para escolher paradigma por tarefa. - [Quanto ganha um Engenheiro de IA no Brasil em 2026: R$ 7 mil a R$ 38 mil no CLT, e por que o PJ paga 50% mais](https://blog.beerandcode.com.br/noticias/quanto-ganha-engenheiro-de-ia-brasil-2026): Quanto ganha um Engenheiro de IA no Brasil em 2026: R$ 7 mil a R$ 38 mil no CLT, PJ 1,5x maior e contrato gringo em dólar. Faixas por nível, com fonte. - [Anatomia de um harness em produção: as 6 camadas que separam POC de sistema confiável](https://blog.beerandcode.com.br/tutoriais/anatomia-de-um-harness-em-producao-as-6-camadas-que-separam-poc-de-sistema-confiavel): As 6 camadas que separam um harness em produção de uma demo: gate, router, contexto, loop, pós-processamento e telemetria. Com diagrama e código. - [Roadmap AI Engineer em 90 dias: do dev backend ao primeiro agente em produção](https://blog.beerandcode.com.br/tutoriais/roadmap-ai-engineer-90-dias): Plano de 13 semanas para dev backend virar AI engineer aplicada. Tool use, harness, RAG, evals e portfolio que cabe em entrevista de verdade. - [Engenharia de IA não é Data Science: 7 diferenças que separam disciplina de hype](https://blog.beerandcode.com.br/noticias/engenharia-de-ia-vs-data-science-7-diferencas): Engenharia de IA vs data science em 7 eixos: foco, métrica, stack, output, ciclo de feedback, perfil e mercado. Onde cada uma entrega valor real. - [Agentic Code: o que muda quando o agente escreve, executa e testa o próprio código](https://blog.beerandcode.com.br/noticias/agentic-code-quando-agente-escreve-executa-testa-proprio-codigo): Entenda o que é Agentic Code, os níveis de autonomia, falhas comuns e o harness necessário para agentes escreverem e testarem código. - [O que faz um engenheiro de IA: a rotina real em 2026](https://blog.beerandcode.com.br/noticias/engenheiro-de-ia-2026-o-que-faz): O que faz um engenheiro de IA na prática: a rotina hora a hora, quanto do dia é código, eval e trace, o stack de 2026 e como difere de dev e cientista de dados. - [Model Graders: usando LLMs para avaliar LLMs (e os 3 erros que invalidam o seu eval)](https://blog.beerandcode.com.br/tutoriais/model-graders-usando-llms-para-avaliar-llms-e-os-3-erros-que-invalidam-o-seu-eval): Como usar LLMs para avaliar LLMs sem se enganar: padrões de prompt para grader e os três erros que invalidam o seu eval em produção. - [Engenharia de contexto vence prompt engineering: por que o que você NÃO coloca no prompt importa mais](https://blog.beerandcode.com.br/tutoriais/engenharia-de-contexto-vence-prompt-engineering): Karpathy mudou o jogo: o que você NÃO coloca no prompt importa mais. Veja em tokens, custo e testes por que enxuto vence inflado. - [Specs como contrato com o agente: rodei a mesma spec em 4 LLMs pra ver quanto convergem](https://blog.beerandcode.com.br/tutoriais/specs-como-contrato-agente-mesma-spec-4-llms): Experimento compara 4 LLMs com a mesma spec e mostra como especificações estruturadas aumentam a convergência e os testes passados. - [Do prompt frágil ao sistema confiável: pipeline de eval contínuo para prompts em produção](https://blog.beerandcode.com.br/tutoriais/pipeline-eval-continuo-prompts-producao): Como montar um pipeline de avaliação contínua para prompts com Promptfoo e GitHub Actions, com gate de qualidade que barra regressões antes do merge. - [SDD vs BMAD vs Vibe Coding: qual metodologia faz sentido para seu time](https://blog.beerandcode.com.br/tutoriais/sdd-vs-bmad-vs-vibe-coding-qual-metodologia-faz-sentido): Matriz de decisão com 4 eixos (time, maturidade, tolerância a erro, prazo) mostra onde SDD, BMAD e Vibe Coding ganham. Sem hype, só engenharia. - [Hooks, Slash Commands e MCPs: a anatomia de um harness produtivo](https://blog.beerandcode.com.br/tutoriais/hooks-slash-commands-e-mcps-a-anatomia-de-um-harness-produtivo): Entenda hooks, slash commands e MCPs no Claude Code e veja como montar um harness produtivo com exemplos práticos em projetos Laravel. - [Versionando specs: como manter documentação viva sem virar mais um README abandonado](https://blog.beerandcode.com.br/tutoriais/versionando-specs-documentacao-viva-sem-readme-abandonado): Tripé Git + spec + ADR para manter documentação viva ao lado do código. Inclui hooks de pré-commit que travam drift e exemplos prontos. - [RAG não é só vector search: combinando busca semântica, SQL e tools no mesmo agente](https://blog.beerandcode.com.br/tutoriais/rag-nao-e-so-vector-search-busca-semantica-sql-tools): Compare vector-only, busca híbrida e agentes com SQL, vetor e reranker no mesmo fluxo, com benchmarks reais, custos e código de produção. - [Subagentes na prática: dividindo contexto entre Claudes para não estourar o token budget](https://blog.beerandcode.com.br/tutoriais/subagentes-na-pratica-dividindo-contexto-token-budget): Veja como dividir contexto entre subagentes no Claude melhora a qualidade e evita estouros de token budget em fluxos com IA. - [Spec reversa: aplicando SDD em um módulo legado](https://blog.beerandcode.com.br/tutoriais/do-legado-ao-sdd-spec-reversa-em-modulo-legado): Spec reversa é como aplicar SDD em projeto legado: o agente lê o código existente, gera a specification e você refatora guiado por ela. O método em 4 passos. - [BMAD Method vs SDD: onde acerta e onde vira ruído](https://blog.beerandcode.com.br/tutoriais/bmad-method-para-quem-ja-usa-sdd): BMAD Method na prática para quem já usa SDD: mapeamento agente a agente, onde ele acerta, onde só vira cerimônia e quando o overhead não se paga. - [Prompts resilientes: 50 casos adversariais para descobrir onde seu prompt quebra](https://blog.beerandcode.com.br/tutoriais/prompts-resilientes-evals-adversariais-edge-cases): Funciona no happy path, mas quebra com emoji e injection? Aprenda a montar dataset de cinquenta casos, rodar eval e medir pass rate, custo e latência. - [Como escrever uma spec que o agente realmente entende (e não inventa em cima)](https://blog.beerandcode.com.br/tutoriais/spec-que-o-agente-realmente-entende): Anti-padrões reais na escrita de spec para agentes de IA, com exemplos antes/depois e checklist de 7 pontos antes de mandar pro Claude Code. - [Construindo seu primeiro harness em Laravel: do prompt isolado ao loop autônomo](https://blog.beerandcode.com.br/tutoriais/harness-laravel-claude-do-zero-loop-autonomo): Tutorial passo a passo construindo um agente em Laravel mais Claude API que executa tools em loop ate concluir, com erros e logs. - [Spec Driven Development: guia prático do PRD ao código](https://blog.beerandcode.com.br/tutoriais/sdd-em-laravel-pdf-vendas-specification-executavel): Spec Driven Development na prática: o ciclo spec, plan, tasks e implement com Spec Kit, exemplo completo em Laravel e a trilha pra escolher onde aplicar. - [Agente que pesquisa antes de agir: multi-tool + RAG em Laravel com pgvector](https://blog.beerandcode.com.br/tutoriais/agente-multi-tool-rag-laravel-pgvector): Aprenda a criar em Laravel um agente que decide quando buscar, consultar o banco ou responder direto usando Prism PHP e pgvector. - [5 sinais de que sua especificação virou burocracia (e como voltar à base bem feita)](https://blog.beerandcode.com.br/tutoriais/5-sinais-de-que-sua-especificacao-virou-burocracia-e-como-voltar-a-base-bem-feita): Spec virou burocracia? Cinco sinais concretos de que a especificação virou ritual e o ajuste prático de cada um para voltar a uma base executável. - [Programmatic Tool Calling: por que executar suas ferramentas em código é o futuro do agente](https://blog.beerandcode.com.br/tutoriais/programmatic-tool-calling-futuro-agente): Function calling clássico está virando legado. Programmatic tool calling deixa o Claude orquestrar tools com Python em sandbox e cortar 37% dos tokens. - [Especificação mínima viável: o framework de 1 página que evita construir a Catedral antes da Cabana](https://blog.beerandcode.com.br/tutoriais/spec-minima-viavel-framework-1-pagina): Aprenda a usar uma spec de 1 página para fechar escopo, reduzir retrabalho e guiar agentes de IA sem expandir a solução cedo demais. - [O que é Harness Engineering e por que seu Claude Code trava em tarefas longas](https://blog.beerandcode.com.br/noticias/o-que-e-harness-engineering-e-por-que-seu-claude-code-trava-em-tarefas-longas): Entenda o que é harness engineering e por que agentes como Claude Code falham em tarefas longas por loop, contexto, memória e verificação. - [O paradoxo da especificação: quando SDD vira overengineering disfarçado de boa prática](https://blog.beerandcode.com.br/tutoriais/paradoxo-da-especificacao-quando-sdd-vira-overengineering): SDD overengineering acontece quando a spec passa do risco. Veja os sintomas, o custo invisível e o checklist para dimensionar a spec certa em cada feature. - [Cortando custo em 80%: prompt caching, batch e quando NÃO usar reranker](https://blog.beerandcode.com.br/tutoriais/cortando-custo-em-80-prompt-caching-batch-e-quando-nao-usar-reranker): Como cortar custo de LLM em produção: prompt caching no system prompt, Batch API com 50% off e quando reranker virou desperdício. - [Scraping, API ou MCP: o trade-off de fontes de dados que define seu agente](https://blog.beerandcode.com.br/tutoriais/scraping-api-mcp-trade-off-fontes-dados-agente): Scraping, API ou MCP no seu agente? Veja a matriz por caso de uso (preço, review, estoque) e o modelo híbrido que aguenta produção. - [Tracking 24/7: do agente que responde "quanto custa?" ao agente que avisa "baixou agora"](https://blog.beerandcode.com.br/tutoriais/tracking-247-do-reativo-ao-agente-agendado): Aprenda a transformar um agente reativo em monitoramento 24/7 com Laravel: cron, queue, webhooks, idempotência e dedupe de alertas. - [Multi-agent com Claude: separando search, judge e writer (e quando isso é overengineering)](https://blog.beerandcode.com.br/tutoriais/multi-agent-com-claude-separando-search-judge-e-writer-e-quando-isso-e-overengineering): Padrão de orquestração com Claude para separar busca, ranking e redação. Quando vale, quanto custa em tokens e quando voltar para single-agent. - [Memória de agente: por que seu assistente de compras esquece o usuário (e como consertar)](https://blog.beerandcode.com.br/tutoriais/memoria-agente-assistente-compras): Entenda por que assistentes de compras esquecem preferências e como usar contexto, sumário e memória vetorizada por usuário. - [Hands-on: construindo um agente de ofertas em 80 linhas com Claude, tool use e um reranker](https://blog.beerandcode.com.br/tutoriais/agente-de-ofertas-claude-tool-use-rerank): Tutorial em Python: monte um agente que faz busca, aplica rerank do Cohere e devolve a oferta em JSON estruturado usando Claude tool use. - [Prompt injection no agente: quando o site raspado vira o novo system prompt](https://blog.beerandcode.com.br/tutoriais/prompt-injection-agente-site-raspado-system-prompt): Entenda como páginas raspadas podem injetar instruções no contexto do LLM e veja como proteger seu harness contra prompt injection. - [Renderização que converte: do JSON do agente ao card clicável](https://blog.beerandcode.com.br/tutoriais/renderizacao-que-converte-json-agente-card-clicavel): Aprenda a transformar JSON estruturado do agente em cards clicáveis com Zod, Claude/OpenAI e Vercel AI SDK 5 em apps Next.js. - [Trust layer no agente: como pontuar a confiabilidade de cada fonte antes do LLM ver](https://blog.beerandcode.com.br/tutoriais/trust-layer-agente-reputacao-fonte): Como pontuar a confianca de cada fonte com sinais simples (idade, afiliado, coerencia) e plugar no reranker do seu agente de IA. - [Sintetizando reviews sem enviesar: como resumir sentimento real em meio a manipulação](https://blog.beerandcode.com.br/tutoriais/sintetizando-reviews-sem-enviesar): Pipeline em 4 estágios para sintetizar reviews respeitando distribuição de estrelas, detectando manipulação e separando crítica estrutural de ruído. - [Do prompt ao carrinho: arquitetura de um agente que compara ofertas entre Amazon, Mercado Livre e Magalu](https://blog.beerandcode.com.br/tutoriais/arquitetura-agente-compara-ofertas-amazon-mercado-livre-magalu): Como construir um agente que compara ofertas reais entre Amazon, Mercado Livre e Magalu: SKU, matching, frete, cupom e ranking. Sem hype. - [LLM-as-a-Judge: avaliação automatizada do seu agente de ofertas sem abrir planilha](https://blog.beerandcode.com.br/tutoriais/llm-as-a-judge-avaliacao-automatizada-agente-ofertas): Monte um juiz LLM com rubrica binária e calibração contra label humano para avaliar seu agente de ofertas em PHP/Laravel sem abrir planilha. - [Cross-encoder reranker: o componente que mais eleva qualidade do seu agente por dólar](https://blog.beerandcode.com.br/tutoriais/cross-encoder-reranker-roi-agente-rag): Entenda como o cross-encoder reranker melhora a qualidade do agente com melhor ROI, equilibrando latência, precisão e custo no pipeline RAG. - [Busca híbrida: a receita BM25 + vetor + RRF que resolve SKU, part-number e semântica](https://blog.beerandcode.com.br/tutoriais/busca-hibrida-bm25-vetor-rrf-sku-part-number-semantica): Embedding confunde SKU, BM25 perde sinônimo. Aprenda a juntar os dois com Reciprocal Rank Fusion em Elasticsearch e construir busca de catálogo que funciona. - [RAG ou Web Search? Como decidir entre indexar, buscar ao vivo e combinar os dois](https://blog.beerandcode.com.br/tutoriais/rag-vs-web-search-quando-indexar-buscar-ao-vivo): Aprenda quando usar RAG, busca na web ao vivo ou um modelo híbrido em agentes de IA, equilibrando custo, latência e controle. - [Tool use na prática: desenhando ferramentas que o LLM realmente consegue usar](https://blog.beerandcode.com.br/tutoriais/tool-use-na-pratica-desenhando-ferramentas-llm): Aprenda a desenhar tools que LLMs realmente usam bem, com nomes claros, schema strict, few-shot e erros úteis para produção. - [Agent harness: as 5 peças do agente que aguenta produção](https://blog.beerandcode.com.br/tutoriais/anatomia-de-um-agent-harness-state-tool-execution-feedback-loops-e-guardrails): O que é um agent harness e como suas 5 peças (estado, tools, validação, loop e guardrails) transformam um LLM num agente que aguenta produção. - [Top-10 da busca não é top-10 do usuário: por que a SERP bruta sabota seu agente](https://blog.beerandcode.com.br/tutoriais/top-10-busca-vs-top-10-usuario-serp-bruta-sabota-agente): SERPs vêm contaminadas de SEO spam, MFA e IA gerada em escala. Sem rerank e filtros de confiança, seu agente vira amplificador de lixo. Aprenda o pipeline. - [Chatbot não é agente: o teste dos 3 turnos que separa brinquedo de produto](https://blog.beerandcode.com.br/noticias/chatbot-nao-e-agente-teste-3-turnos): Três perguntas simples sobre um produto real quebram qualquer chatbot cru. Entenda o conceito de agent harness, a camada que transforma LLM em agente confiável. - [Alucinação em e-commerce é caro: quando a IA inventa especificação, cupom e estoque](https://blog.beerandcode.com.br/noticias/alucinacao-ecommerce-caro-llm-inventa-cupom-estoque): Entenda o custo das alucinações de IA no e-commerce e a arquitetura mínima com RAG e tool use para validar estoque, preço e cupons. - [Seu LLM não sabe o preço de nada: o problema do conhecimento congelado em apps de compra](https://blog.beerandcode.com.br/tutoriais/seu-llm-nao-sabe-o-preco-de-nada): Entenda por que LLMs erram preço, estoque e catálogo em apps de compra e como corrigir com tool use, RAG e Laravel. - [Como Implementar Busca Semântica no Laravel com Embeddings e PostgreSQL (PGVector)](https://blog.beerandcode.com.br/tutoriais/como-implementar-busca-semantica-no-laravel-com-embeddings-e-postgresql-pgvector): Aprenda a implementar busca semântica no Laravel com embeddings, OpenAI e PostgreSQL usando pgvector para consultas por similaridade. - [Como Implementar um Sistema de Recomendação Semântica no Laravel com Embeddings (Sem Tags, Sem Categorias)](https://blog.beerandcode.com.br/tutoriais/como-implementar-um-sistema-de-recomendacao-semantica-no-laravel-com-embeddings-sem-tags-sem-categorias): Aprenda a criar recomendações semânticas no Laravel com embeddings e pgvector, sem tags ou categorias, usando similaridade real. - [Da Indexação Tradicional à Era dos Embeddings: A Evolução da Busca no Google](https://blog.beerandcode.com.br/noticias/da-indexacao-tradicional-a-era-dos-embeddings-a-evolucao-da-busca-no-google): Entenda como a busca do Google evoluiu da indexação por palavras-chave para semântica, contexto e embeddings na era da IA. - [Do Uso de IA para Código à IA como Motor de Negócios](https://blog.beerandcode.com.br/noticias/do-uso-de-ia-para-codigo-a-ia-como-motor-de-negocios): Entenda por que em 2026 a IA deixa de ser só apoio ao código e passa a atuar como infraestrutura estratégica para produtos e negócios. - [O Laravel é lento? Entenda por que sua aplicação não escala](https://blog.beerandcode.com.br/tutoriais/o-laravel-e-lento-entenda-por-que-sua-aplicacao-nao-escala): Entenda por que o Laravel nem sempre é o vilão da lentidão e como queries sargables, índices e whereBetween() melhoram a performance. - [Como implementar Agent Builder e Chatkit da OpenAi com Laravel](https://blog.beerandcode.com.br/tutoriais/como-implementar-agent-builder-e-chatkit-da-openai-com-laravel): Aprenda a integrar Agent Builder e Chatkit da OpenAI com Laravel para criar agentes inteligentes, chats escaláveis e fluxos multiagentes. - [Otimize sua aplicação Laravel com o novo Memoized Cache Driver (Laravel 12.9)](https://blog.beerandcode.com.br/tutoriais/otimize-sua-aplicacao-laravel-com-o-novo-memoized-cache-driver-laravel-129): Aprenda como o Memoized Cache Driver no Laravel 12.9 reduz acessos repetidos ao cache e melhora a performance da aplicação. - [O Poder do Método Boot em Models no Laravel](https://blog.beerandcode.com.br/tutoriais/o-poder-do-metodo-boot-em-models-no-laravel): Aprenda como o método boot em models do Laravel funciona com traits, eventos e escopos globais para criar comportamentos reutilizáveis. - [A Importância do Eager Loading no Laravel: Evitando o Problema N+1](https://blog.beerandcode.com.br/tutoriais/a-importancia-do-eager-loading-no-laravel-evitando-o-problema-n1): Como o eager loading no Laravel acaba com o N+1: o método with, o automatic eager loading e o preventLazyLoading para sua aplicação voar. - [Como alcancei pontuações quase perfeitas no Google Lighthouse em um blog feito com Laravel / Filament](https://blog.beerandcode.com.br/tutoriais/como-alcancei-pontuacoes-quase-perfeitas-no-google-lighthouse-em-um-blog-feito-com-laravel-filament): Aprenda como melhorar performance, SEO e UX em sites com Laravel e Filament para alcançar pontuações acima de 90 no Google Lighthouse. - [Laravel Wayfinder: Integrando seu backend Laravel ao frontend TypeScript com facilidade](https://blog.beerandcode.com.br/pacotes/laravel-wayfinder-integrando-seu-backend-laravel-ao-frontend-typescript-com-facilidade): Veja como o Laravel Wayfinder integra rotas e controllers ao TypeScript com tipagem segura, sem URLs hardcoded e com mais produtividade. - [FilamentPHP V4 está chegando: veja as principais novidades!](https://blog.beerandcode.com.br/pacotes/filamentphp-v4-esta-chegando-veja-as-principais-novidades): Conheça as principais novidades do FilamentPHP V4, com arquitetura unificada, layouts flexíveis e melhorias de desempenho para Laravel. - [Transformando Aplicações Laravel em Apps Mobile Nativos com NativePHP](https://blog.beerandcode.com.br/pacotes/transformando-aplicacoes-laravel-em-apps-mobile-nativos-com-nativephp): Veja como usar o NativePHP para transformar apps Laravel em aplicações nativas no iOS, rodando PHP no dispositivo com setup simples. - [Como Executar Processos em Concorrência no Laravel: Importando Grandes Arquivos CSV](https://blog.beerandcode.com.br/tutoriais/como-executar-processos-em-concorrencia-no-laravel-importando-grandes-arquivos-csv): Aprenda a usar a facade Concurrency do Laravel para processar grandes arquivos CSV em paralelo e melhorar a performance da importação. - [Observabilidade em Sistemas Modernos](https://blog.beerandcode.com.br/tutoriais/observabilidade-em-sistemas-modernos): Compare LogRocket, Bugsnag, Rollbar e outras ferramentas de observabilidade para monitorar erros, logs e performance em sistemas modernos. - [Tutorial Laravel Excel: Como Importar e Exportar Dados com Facilidade](https://blog.beerandcode.com.br/pacotes/tutorial-laravel-excel-como-importar-e-exportar-dados-com-facilidade): Aprenda a usar o Laravel Excel para importar e exportar planilhas no Laravel com um exemplo prático de gerenciamento de usuários. - [Laravel Livewire v3.6: Novas Diretivas HTML e Ações JavaScript](https://blog.beerandcode.com.br/noticias/laravel-livewire-v36-novas-diretivas-html-e-acoes-javascript): Veja as novidades do Livewire 3.6, com wire:show, wire:text e ações JavaScript para interfaces mais dinâmicas e atualizações otimistas. - [Ngrok vs Expose: Qual a Melhor Ferramenta para Tunelar seu Localhost?](https://blog.beerandcode.com.br/tutoriais/ngrok-vs-expose-qual-a-melhor-ferramenta-para-tunelar-seu-localhost): Compare Ngrok e Expose para tunelar localhost, testar APIs e webhooks. Veja diferenças em DNS, tempo de sessão e uso no Laravel. - [Tutorial: Como Integrar o Laravel com Twilio para Enviar e Receber Mensagens no WhatsApp](https://blog.beerandcode.com.br/tutoriais/tutorial-como-integrar-o-laravel-com-twilio-para-enviar-e-receber-mensagens-no-whatsapp): Tutorial Laravel com Twilio: credenciais, webhooks e sandbox para enviar e receber mensagens no WhatsApp e responder automático. Passo a passo. - [Laravel Auto CRUD Generator: Automatize CRUD no Laravel](https://blog.beerandcode.com.br/pacotes/laravel-auto-crud-generator-automatize-crud-no-laravel): Conheça o pacote Laravel Auto CRUD Generator para criar controladores, rotas, validações e APIs com mais rapidez e padrão. ## Optional - [Feed RSS](https://blog.beerandcode.com.br/rss) - [Sitemap XML](https://blog.beerandcode.com.br/sitemap.xml)