#Benchmark
A Z.ai (ex-Zhipu) lançou o GLM 5.2, modelo open-weight de 753B sob licença MIT que fica a 0,7 ponto do Claude Opus 4.8 em código e custa um sexto do preço por token. O que muda pra quem programa com IA no Brasil — incluindo rodar self-host.
Claude Code ou Codex? A resposta tem número: o Codex abre 13 pontos no Terminal-Bench (82,7% contra 69,4%) e o Claude Code abre 10 no SWE-bench Pro (69,2% contra 58,6%), que é o benchmark do problema multi-arquivo de verdade. No SWE-bench Verified empatam. Aqui está o veredito por cenário, o custo real por dev e o critério que importa mais que qualidade: quanto controle você quer durante a tarefa.
O Claude Fable 5 durou três dias disponível antes de ser bloqueado pelo governo dos EUA. Enquanto isso, o OpenRouter publicou dados que mudam a pergunta: e se painel de modelos baratos já superar qualquer frontier solo em deep research?
Fable 5 ou Opus 4.8, qual usar? Veredito direto por tipo de tarefa, com as 10 situações concretas em que o Fable resolve e o Opus 4.8 fazia mal ou não fazia: migração em escala, código a partir de print, agente de longa duração e raciocínio sobre documento. Mais o custo de cada um e os casos em que o Opus 4.8 continua sendo a escolha certa.