Ox Alpha "bateu" o Claude Fable 5? Rodaram as 113 tarefas e o número caiu de 80% pra 63%
O Ox Alpha é um modelo de IA que apareceu de graça no OpenRouter em 20 de agosto, sem dono declarado. Em 48 horas a internet decretou que ele tinha batido o Claude Fable 5.
O número que viralizou veio de dez tarefas.
Quando alguém rodou o benchmark inteiro — 113 tarefas — o Ox Alpha virou um GPT-5.6 Sol. E a história boa nem é essa: é quem deixou a impressão digital no tokenizador.
Neste post você vai ver o que o Ox Alpha é de fato, como o benchmark de 80% se desfez, o método que rastreou a autoria do modelo custando US$ 0,00 — e o que dá pra tirar disso antes do acesso gratuito acabar.
TL;DR
- O que é: modelo de raciocínio anônimo ("stealth"), focado em código e trabalho agêntico longo, publicado no OpenRouter em 20/08/2026.
- Specs: 1.048.576 tokens de contexto, até 131.072 de saída. Aceita texto, imagem e vídeo. Function calling e saída JSON.
- Custo: US$ 0,00 de entrada e saída. O acesso gratuito foi anunciado para durar cerca de uma semana a partir de 20/08.
- Autoria: não reivindicada. Evidência técnica forte aponta para a Zhipu (linha GLM) — alta confiança, não confirmado.
O benchmark que viralizou (e por que ele não sustentava a manchete)
A manchete nasceu de um teste no DeepSWE. Na amostra inicial, os números foram estes:
| Modelo | DeepSWE (amostra de 10 tarefas) |
|---|---|
| Ox Alpha | 80% |
| Claude Fable 5 | 65% |
| GLM-5.3 | 62% |
| Grok 4.6 | 62% |
| GPT-5.6 Sol | 52% |
Parece decisivo. Só que o DeepSWE tem 113 tarefas. Dez tarefas são menos de 9% do benchmark.
Com uma amostra desse tamanho, cada tarefa vale 10 pontos percentuais. Acertar uma a mais ou uma a menos move o resultado de 80% pra 70% ou 90%. Isso não é medição, é ruído com casas decimais.
Foi o que aconteceu quando rodaram o conjunto completo: duas execuções independentes das 113 tarefas ficaram perto de 63% — praticamente empatadas com o GPT-5.6 Sol, e não 15 pontos à frente do Claude Fable 5.
Tem uma segunda armadilha, mais silenciosa, nas tabelas que circularam: várias delas comparam o 80% do Ox Alpha no DeepSWE com os ~96% de Claude Opus 5 e GPT-5.6 Sol no SWE-bench Verified. São benchmarks diferentes, com dificuldade e metodologia diferentes. Colocar os dois na mesma coluna não é análise — é erro de planilha virando manchete.
A diferença entre engolir um gráfico e ler um gráfico é a mesma diferença entre usar IA e construir com IA. A segunda é a que a gente treina toda semana no Clã Beer and Code.
Nada disso significa que o Ox Alpha é ruim. 63% no DeepSWE é um modelo de fronteira sendo entregue de graça, com 1M de contexto. É só bem diferente do que a manchete prometeu.
O tokenizador é uma impressão digital
Essa é a parte que merece atenção de quem gosta de engenharia.
Nenhum laboratório assumiu o Ox Alpha. Mas alguém descobriu a linhagem dele sem acesso a peso nenhum, usando um detalhe que praticamente toda API expõe: a contagem de tokens da fatura.
O método é elegante. Toda API de chat devolve usage.prompt_tokens. Se você mede a contagem de uma string-base e depois a contagem da mesma base mais um probe, o overhead do template de chat se cancela na subtração. O que sobra é exatamente quantos tokens aquele modelo gastou pra representar o seu probe.
tokens(base + probe) - tokens(base) = tokens do probe naquele tokenizador
Faça isso com dezenas de probes — idiomas diferentes, código, casos extremos de Unicode — e você tem uma assinatura. Tokenizador é vocabulário treinado: dois laboratórios diferentes praticamente nunca produzem contagens idênticas em toda a bateria.
O resultado do levantamento publicado foi 95 probes contra 14 vocabulários candidatos, em 126 chamadas de API, custando US$ 0,00 — porque o modelo estava de graça.
| Vocabulário testado | Correspondências exatas | Erro médio |
|---|---|---|
| GLM-4.5 (Zhipu) | 84 / 95 | 1,08 |
| Melhor não-GLM (Llama-3.1) | 46 / 95 | 3,83 |
| GLM-5 (vocabulário público) | 95 / 95 | 0,00 |
Noventa e cinco de noventa e cinco, com erro médio zero. Some a isso o comportamento do encoder de vídeo batendo com o GLM-5V-Turbo e a rejeição de áudio no estilo GLM, e a conclusão fica difícil de contornar: o Ox Alpha é da família GLM, provavelmente uma variante multimodal não anunciada.
Se o nome Zhipu te soa familiar, é porque a linha GLM já apareceu por aqui em outra história de perícia técnica.
As ressalvas — que o próprio método declara
Evidência forte não é confissão. O levantamento lista os próprios limites, e eles importam:
Vocabulário identifica linhagem, não operador. O tokenizador diz de qual família o modelo descende. Não prova quem está servindo a API, nem que a empresa autorizou o lançamento.
É uma foto, não um filme. Mudança de template de chat ou de backend invalida medições anteriores. A leitura vale para o dia em que foi feita.
O método é derrotável. Bastaria o provedor corromper os números de usage para embaralhar tudo. O que segura é o incentivo: transparência de faturamento é a única credibilidade que um provedor anônimo não pode abrir mão.
Por isso a formulação honesta é "alta confiança, não confirmada". Enquanto a Zhipu não falar, é a melhor inferência disponível — não um fato.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãO que o Ox Alpha entrega na prática
Fora da polêmica, o modelo é competente e as specs são públicas no card dele no OpenRouter:
- Contexto: 1.048.576 tokens de entrada, até 131.072 de saída.
- Modalidades: texto, imagem e vídeo na entrada; texto na saída.
- Ferramentas: function calling via
tools/tool_choicee saída JSON viaresponse_format(sem enforcement de schema). - Operação: 100% de uptime e 98,94% de sucesso nas 72 horas medidas, latência P50 de 4,34s e cerca de 27 tokens por segundo.
Vinte e sete tokens por segundo é honesto, não impressionante. Para trabalho agêntico longo — o caso de uso que ele declara — throughput importa menos que estabilidade e janela de contexto, e nos dois ele entrega.
Chamar é igual a qualquer modelo do OpenRouter:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/ox-alpha",
"messages": [{"role": "user", "content": "Refatore esta função e explique o porquê."}]
}'
Se você nunca usou a plataforma, tem um guia completo aqui.
Já vimos esse filme
Modelo sem dono, nome de bicho, preço zero, subindo no ranking antes de qualquer anúncio oficial. É um padrão, não um acidente.
Em abril de 2026 foi o Owl Alpha: rodou dois meses disfarçado, entrou no topo do OpenRouter em volume de chamadas, e só em junho a Meituan assumiu que era o LongCat-2.0. Contamos a história inteira aqui.
A mecânica é sempre a mesma, e é boa engenharia de produto: um laboratório precisa de tráfego real, com prompts reais, para avaliar um modelo antes do lançamento. Preço zero compra volume rápido. Anonimato remove o viés de marca — ninguém elogia porque é da Anthropic nem critica porque é chinês. E o ranking público vira uma eval gratuita, feita por milhares de devs.
O Ox Alpha chegou ao segundo lugar do OpenCode em três dias. Como campanha de teste, funcionou perfeitamente.
O preço real do "de graça"
Você não paga em dólar. Paga em prompt.
Todo código que você manda para um modelo stealth vai para um provedor que não se identificou, sob política de retenção que você não leu, num país que você não sabe qual é. Para brincar com código público, tanto faz. Para o repositório do cliente, é uma decisão de segurança tomada por omissão.
O acesso gratuito foi anunciado para durar cerca de uma semana a partir de 20 de agosto — ou seja, a janela fecha por volta de 27/08. Se você construiu alguma coisa apoiada em stealth/ox-alpha, tenha o fallback pronto antes disso. Modelo de preview desaparece do catálogo sem changelog.
FAQ
O Ox Alpha é melhor que o Claude Fable 5 para código? Pelos dados disponíveis, não. Empata com o GPT-5.6 Sol no DeepSWE completo. O 80% da manchete veio de uma amostra de dez tarefas e não se sustentou.
Dá para usar comercialmente? Sem laboratório identificado, não há termos de uso, SLA nem garantia de continuidade. Para produção, é não. Para avaliação, vale enquanto durar.
Como saber se ele saiu do ar?
O card no OpenRouter deixa de listar o modelo e a chamada passa a retornar erro de modelo inexistente. Declare fallback com o array models na requisição para o seu código não quebrar junto.
Por que um laboratório lançaria assim? Para conseguir eval em escala, com tráfego real e sem viés de marca, antes de comprometer a reputação da marca com um lançamento oficial.
O ponto
Duas lições aqui, e a segunda vale mais que a primeira.
A primeira: sempre pergunte o tamanho da amostra. Dez tarefas viraram uma manchete que atravessou o mundo, e bastou rodar o benchmark inteiro para o número cair 17 pontos. Se um gráfico não diz quantas tarefas rodaram, em qual benchmark e com qual metodologia, ele não é evidência — é decoração.
A segunda: a informação mais confiável desse episódio não veio de anúncio nenhum. Veio de alguém subtraindo contagem de token de uma resposta de API. Enquanto a manchete discutia se o modelo era bom, um método de US$ 0,00 respondia de quem ele era.
É essa a diferença entre consumir notícia de IA e fazer engenharia de IA. Uma espera o anúncio. A outra mede.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã