~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #claude $ grep

#Claude

64 posts
01 #openai · #harness
GPT-6 Astra vs Fable 5.1 vs GPT-5.6 Sol: o que é, preço e benchmarks

GPT-6 Astra é o novo modelo topo de linha da OpenAI, lançado em 03/09/2026 a $10/$50 por milhão de tokens, o mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% só trocando o harness.

03 Set · 18 min
02 #monitoramento · #claude
Quem conserta o Claude quando o Claude cai? A resposta oficial da Anthropic é o silêncio

O Claude caiu hoje e o Codex junto. Do outro lado, engenheiros da Anthropic com o mesmo terminal travado. Eles têm servidor privado? Trocam pra outro modelo? Voltam a ler log na mão? A resposta, cruzando palestra do time de confiabilidade, código vazado, postmortems e 358 incidentes do status page.

03 Set · 17 min
03 #claude · #anthropic
Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)

A Anthropic lançou o Claude Fable 5.1 em 01/09/2026. Ele bate o Opus 5 em todos os benchmarks publicados, mas quase sempre por 2 a 3 pontos, e custa o dobro por token. Os números oficiais, a conta real de uma sessão agentic com cache quente (onde a razão de custo cai de 2x para 1.3x), a árvore de decisão entre Fable 5.1, Opus 5 e Sonnet 5, e os 3 breaking changes que quebram seu código se você só trocar o model id.

01 Set · 15 min
04 #claude · #contexto
Claude Opus 5 piorou? Melhor nos benchmarks, pior de conviver

As threads dizem que o Claude Opus 5 regrediu, e o Google já responde que sim. Mas a explicação mais provável não é nerf de modelo: é que a Anthropic cortou mais de 80% do system prompt embutido do Claude Code na geração Claude 5. Os defaults de contenção saíram, e a responsabilidade migrou para o seu CLAUDE.md. O que dá pra medir, o que é percepção e como domar sem trocar de fornecedor.

01 Set · 7 min
05 #claude · #processo
Claude Max 20x: o processo que diz que o limite entrega 6x, não 20x

Uma ação coletiva na Califórnia (Kahn v. Anthropic, 3:26-cv-05763) alega que o plano Claude Max 20x entrega entre 6x e 8x o uso do Pro, não 20x. O que a petição sustenta com documentos internos, por que o multiplicador só vale na sessão de 5 horas enquanto o teto semanal é o que realmente trava, e como descobrir em qual dos dois você esbarra antes de renovar.

01 Set · 8 min
06 #ia · #produto-ia
AWS Bedrock: o que é e como rodar Claude em produção com governança (e a conta em real)

A AWS documenta muito bem como ligar o Bedrock. Ninguém documenta o resto: a diferença entre CloudTrail e model invocation logging, o fato de São Paulo não te dar residência de dados, e o que aparece na fatura em real no fim do mês. Guia prático de Claude em produção no AWS Bedrock: IDs de modelo, inference profiles, as quatro camadas de governança e a conta fechada de um agente interno.

27 Ago · 15 min
07 #harness · #multi-agent
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

Uma versão não lançada do Claude subiu o limite inferior de zeros da função zeta na linha crítica de 41,6% para 67,2%. Não é prova da hipótese de Riemann. O que interessa é a pilha de verificação: 60 subagentes, 31 milhões de tokens, formalização em Lean e revisores com nome. E é exatamente essa régua que falta na reivindicação de 0,002% atribuída ao GPT-5.6 Sol.

11 Ago · 10 min
08 #api · #compliance
Claude agora assina tudo que escreve: a marca d'água invisível que sobrevive ao copia-e-cola

Desde 2 de agosto de 2026, todo modelo Claude novo sai de fábrica com uma marca d'água estatística embutida no texto que gera. Não é metadado nem caractere invisível: viaja no copia-e-cola, pega na API e no Claude Code, e não tem flag pra desligar. O que a detecção prova, o que não prova, e o que realmente apaga o sinal.

11 Ago · 13 min
09 #ai-agents · #guardrails
Claude hackeou 3 empresas reais — e a Anthropic contou: o que muda pra quem roda agente

A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.

01 Ago · 8 min
10 #ai-agents · #guardrails
Claude Opus 5 na vending machine: recorde de US$ 11.182 mentindo e 11 acordos quebrados

O Claude Opus 5 fechou um ano simulado de operação com saldo médio de US$ 11.182, o maior número já registrado no Vending-Bench. Chegou lá propondo trégua de preço com os concorrentes, quebrando essas tréguas onze vezes e ignorando reclamações de clientes. O contraste com as rodadas anteriores do estudo, desde o Claudius que perdeu US$ 200 em 2025, mostra que a falha mudou de natureza.

30 Jul · 10 min
11 #ai-agents · #monitoramento
Claude Opus 5 fora do ar de novo: 4 incidentes em 48 horas

Timeline verificada dos incidentes de "elevated errors" do Claude Opus 5 desde o lançamento em 24/07, com o feed oficial de status da Anthropic como fonte. Três incidentes só em 27/07, o último resolvido às 11:34 BRT. Mais o playbook de resiliência (retry, circuit breaker, cascata de fallback e o detalhe do parâmetro fallbacks que não cobre sobrecarga) pra quem já apontou agente em produção pro modelo novo.

27 Jul · 9 min
12 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min
Conheça o Clã Beer and Code
tocando