~/beer-and-code
▪ próximo evento Workshop: Loop Engineering — Pare de Ser o Operador do Agente · 19 Ago · 19h (horário de Brasília) — duração de 2 a 4 horas, ao vivo via Google Meet garantir vaga
~ / noticias / claude-hipotese-riemann-67-2-por-cento $
Notícias

Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

LS Lucas Souza · · 10 min de leitura
Claude foi de 41,6% para 67,2% na hipótese de Riemann. E o GPT-5.6 Sol respondeu com 0,002%

No dia 10 de agosto de 2026 a Anthropic publicou um relato que parece roteiro de ficção: uma versão não lançada do Claude subiu o limite inferior conhecido da fração de zeros da função zeta que satisfazem a hipótese de Riemann. De 41,6% para 67,2%.

O timeline fez o que o timeline sempre faz. "A IA resolveu Riemann."

Não resolveu. Nem chegou perto. E no dia seguinte veio a cereja: começou a circular no r/singularity a reivindicação de que um usuário do GPT-5.6 Sol tinha arrancado mais 0,002% em cima do resultado do Claude.

Vamos separar as coisas. Neste post você vai ver o que foi provado de verdade, o que não foi, como o resultado foi produzido (60 subagentes, 31 milhões de tokens de saída, 2.400 comandos de shell) e por que esse "0,002%" é o melhor teste de maturidade que esse mercado recebeu no mês.

TL;DR

  • O que é: um Claude não lançado melhorou um limite inferior clássico de teoria analítica dos números — de 41,6% para 67,2% dos zeros não triviais da zeta provadamente simples e sobre a linha crítica.
  • O que NÃO é: prova da hipótese de Riemann. Para isso o número precisa ser 100%, e a própria Anthropic diz que a técnica não leva lá.
  • Como foi feito: duas sessões no Claude Code, ~60 subagentes se revisando, 2.400 comandos de shell, 31 milhões de tokens de saída, 54 papers do arXiv lidos para checar novidade.
  • Verificação: paper completo, formalização em Lean pública, dois matemáticos internos (Levent Alpöge e Ralph Furman) e dois externos (Brian Conrey e Dan Goldston). Sem peer review de revista, ainda.
  • Links: anúncio oficial da Anthropic, paper em PDF, formalização em Lean.

O que o Claude provou de verdade

A hipótese de Riemann diz que todos os zeros não triviais da função zeta têm parte real igual a 1/2 — todos caem na chamada linha crítica. Ninguém provou isso desde 1859.

O que os matemáticos conseguem provar são frações. "Pelo menos X% dos zeros estão lá." E essa fração andou devagar por um século:

Ano Quem Limite
1914 Hardy infinitos zeros na linha (sem proporção)
1974 Levinson > 1/3 (~33,3%)
1989 Conrey > 2/5 (40%)
2020 Pratt, Robles, Zaharescu e Zeindler 5/12 (~41,67%)
2026 Claude ~67,25%

Olha o intervalo entre 1989 e 2020: trinta e um anos para andar 1,7 ponto percentual. O Claude andou 25,6 pontos de uma vez. Segundo a leitura técnica do paper, o número exato é 67,250% de zeros simples e sobre a linha, mais um resultado companheiro de 83,625% de zeros distintos.

A sacada matemática, em português de dev: em vez de tratar os zeros que estão na linha e os que estão fora como dois problemas separados, o Claude empacotou tudo numa matriz hermitiana finita e usou a lei da inércia de Sylvester para contar assinaturas positivas e negativas — ou seja, ele conta quantos zeros se comportam sem precisar localizar zero nenhum. É uma mudança de representação do problema, não força bruta.

E tem teto. O próprio paper diz que a abordagem satura perto de 0,68185 com os dados de correlação de pares disponíveis hoje. Guarde esse número, ele volta daqui a pouco.

Como o resultado foi produzido: 60 subagentes e 31 milhões de tokens

Essa é a parte que interessa pra quem escreve software.

Na primeira sessão, o Claude gerou e testou cerca de 650 ideias. Nenhuma deu certo. Zero. Se você já rodou agente em tarefa longa, conhece esse cheiro: o modelo produz muito, converge pouco, e você fica olhando o custo subir.

Na segunda sessão a coisa mudou de forma. Cerca de 60 subagentes coordenados por 1,5 dia, executando 2.400 comandos de shell e centenas de scripts Python, com os subagentes revisando o trabalho uns dos outros e validando numericamente contra zeros conhecidos da zeta antes de tentar qualquer prova formal.

Repare no desenho: não é um prompt genial. É orquestração, divisão de contexto, oráculo barato antes de verificador caro e revisão cruzada. É a mesma anatomia de um pipeline multi-agente de produção — só que aplicada a teoria analítica dos números em vez de backlog. Orquestrar dezenas de subagentes com critério de parada e verificação não é prompt bonito, é engenharia de software. É esse tipo de coisa que a gente constrói junto na Beer And Code, com dev aplicando em produto real em vez de assistir vídeo sobre.

Se você quiser o padrão destrinchado com código, já escrevi sobre subagentes dividindo contexto para não estourar o token budget.

A notícia não é o número. É a pilha de verificação.

O que separa esse resultado de mais um print de LLM alucinando teorema é o que veio junto com ele:

  1. Validação numérica contínua — hipótese que não bate com zeros conhecidos morre em segundos, antes de custar token de prova.
  2. Formalização em Lean — tem repositório público e a prova passa no verificador de máquina. Lean não tem opinião nem educação: ou fecha, ou não fecha.
  3. Revisores com nome — Alpöge e Furman internamente, Conrey e Goldston de fora. Nomes reais, reputação em jogo.
  4. Checagem de novidade — 54 papers do arXiv baixados e lidos para confirmar que o resultado não estava publicado desde 2011 em algum canto.
  5. Reprova do zero — o Claude refez o argumento do zero, sem o rastro da primeira derivação.

Esse é o template. Se você constrói agente que produz artefato de valor (migração, refactor, laudo, cálculo financeiro), a lição transferível é essa pilha, não o número:

1. gerar hipótese
2. matar rápido com oráculo barato (teste numérico, lint, unit test, sanity check)
3. só o que sobreviver vai pro verificador caro (prova formal, suíte completa, revisão humana)
4. checar novidade/duplicação contra o que já existe
5. reproduzir do zero, sem o contexto da primeira tentativa
6. publicar o artefato verificável junto com o resultado

Agente sem o passo 3 é gerador de texto confiante. Agente sem o passo 5 é sorte.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

E o "0,002%" atribuído ao GPT-5.6 Sol?

Aqui entra o teste de maturidade.

Um dia depois do anúncio, threads no r/singularity passaram a repetir que um usuário do GPT-5.6 Sol tinha melhorado o resultado do Claude em 0,002%. Milhares de upvotes. Screenshot circulando. "Já superaram."

Fui atrás da fonte primária. Até o fechamento deste post, não existe paper público, não existe formalização em Lean, não existe revisor com nome e não existe sequer clareza sobre o que o "0,002%" significa — se é ponto percentual absoluto (67,25% → 67,252%) ou melhora relativa (67,25% → 67,2513%). São coisas diferentes, e ninguém que espalhou o print pareceu se importar com a diferença.

E lembra do teto de 0,68185 que eu pedi pra você guardar? Uma melhora dessa ordem de grandeza cabe folgadamente dentro do ajuste fino do kernel de otimização que o próprio método já permite. Ou seja: é plausível. Não é absurdo. Pode muito bem ser verdade.

Só que "plausível" não é "verificado".

A diferença entre os dois casos não é a marca do modelo. É que um lado publicou paper, Lean e revisor, e o outro publicou um print. Se amanhã aparecer o repositório com a formalização fechando, o resultado vale — venha de GPT, Claude, Gemini ou de um doutorando com insônia. A régua é a mesma pra todo mundo, e é essa régua que a briga de labs no timeline tenta te fazer esquecer.

Por que "a IA resolveu Riemann" é manchete errada

Três motivos, e nenhum deles é preciosismo.

1. 67,2% não é uma barra de progresso. Não faltam "32,8% para acabar". A hipótese exige 100%, e um único contraexemplo entre os zeros restantes derruba tudo. Ir de 41,6% para 67,2% não te deixa "dois terços do caminho" — te deixa exatamente onde estava em relação à pergunta original: sem resposta.

2. A técnica tem teto matemático. O método satura perto de 68,185% com os dados atuais, e ele funciona por média populacional — é cego a conjuntos excepcionais esparsos. Justamente onde um contraexemplo moraria. A própria Anthropic escreveu, com todas as letras: "We don't expect that the techniques Claude used will lead to proving the Riemann hypothesis."

3. Não passou por peer review de verdade. Dois revisores externos olhando em cima da hora é sinal forte, mas não é o processo da comunidade matemática. E o modelo usado não foi identificado, os pesos não estão disponíveis e ninguém consegue reproduzir a corrida ponta a ponta. O resultado é auditável; o experimento não é.

Nada disso diminui o feito. Diminuir seria dizer que um sistema de IA acabou de produzir o maior salto isolado da história desse limite e isso não muda nada. Muda. Só não muda o que a manchete diz que muda.

Limitações e pontos de atenção

  • Modelo fantasma. "Versão de pesquisa não lançada" significa que você não pode testar, comparar nem replicar. Trate o resultado como publicação científica com artefato aberto, não como benchmark de produto.
  • Custo real escondido. 31 milhões de tokens de saída, 60 subagentes e 1,5 dia de execução. Isso tem preço, e a Anthropic não divulgou. Antes de propor um "swarm de 60 agentes" no seu time, faça a conta do seu caso — na maioria dos problemas de produto, três subagentes especializados batem sessenta.
  • Domínio verificável. Matemática formal tem Lean. Seu domínio tem o quê? Se a resposta é "revisão humana no fim da esteira", o padrão não transfere direto — você precisa construir o verificador antes de escalar o gerador.
  • Não generalize a taxa de acerto. 650 ideias falharam na primeira sessão. O resultado bonito veio de uma segunda tentativa com harness diferente. Isso é reengenharia de processo, não sorte do modelo.

FAQ rápido

Isso significa que a hipótese de Riemann está 67% provada? Não. Significa que está provado que pelo menos ~67,25% dos zeros não triviais são simples e estão na linha crítica. A hipótese exige 100%, e os 32,8% restantes são exatamente onde um contraexemplo poderia estar escondido.

Dá para reproduzir o experimento? Parcialmente. O paper e a formalização em Lean são públicos e verificáveis por qualquer um. A corrida original não, porque o modelo é interno e não foi identificado.

A reivindicação do GPT-5.6 Sol é falsa? Não dá para afirmar isso. Dá para afirmar que, até agora, ela não veio com paper, formalização ou revisor. Sem artefato verificável, é print — independente de qual logo está no canto.

O que eu levo disso para o meu trabalho amanhã? A arquitetura de verificação. Oráculo barato antes de verificador caro, subagentes revisando uns aos outros, reprodução do zero e artefato auditável publicado junto com o resultado. É o que separa agente que entrega de agente que impressiona.

Conclusão

O que aconteceu em 10 de agosto foi bom demais para virar torcida organizada. Um sistema de IA, rodando num harness bem desenhado, produziu matemática nova e a entregou com prova formalizada, revisores nomeados e checagem de novidade. Isso é engenharia de ponta a ponta, não mágica.

O que veio depois — a manchete de que "a IA resolveu Riemann" e a reivindicação de 0,002% sem nenhum artefato — é ruído de mercado. E o ruído sempre vai ser mais rápido que o paper.

Sua vantagem competitiva nos próximos anos não vai ser saber qual modelo está na frente essa semana. Vai ser saber ler o que veio junto com o resultado. Quem construiu verificador, dorme tranquilo. Quem construiu screenshot, precisa de outro screenshot amanhã.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando