#Monitoramento
O Claude caiu hoje e o Codex junto. Do outro lado, engenheiros da Anthropic com o mesmo terminal travado. Eles têm servidor privado? Trocam pra outro modelo? Voltam a ler log na mão? A resposta, cruzando palestra do time de confiabilidade, código vazado, postmortems e 358 incidentes do status page.
Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.
Mapa frio das três opções de LLM observability (uma delas em maintenance mode desde março de 2026), setup Langfuse self-hosted em Laravel e o esquema de tracing mínimo pra reconstruir a decisão do agente sem plataforma nenhuma.
Como evoluir do agente que responde "quanto custa?" para o agente que avisa "baixou agora": cron, webhook, idempotência, deduplicação de alerta e janelas de monitoramento sem estourar custo. Com snippets em Laravel e o que muda no harness quando o agente passa a viver sozinho.
Explore ferramentas de observabilidade como LogRocket, Bugsnag, Rollbar e outras para monitoramento, análise de logs e gestão de erros em sistemas modernos. Compare planos gratuitos, destaques e integrações para encontrar a melhor solução para sua equipe.