DeepSeek V4 Pro 0813: 87,9 no Terminal Bench passa o Opus 4.8 e a conta vai subir
Doze dias atrás o modelo barato da DeepSeek passou o modelo caro da DeepSeek em nove benchmarks de agente. Era constrangedor. Hoje o carro-chefe voltou.
O DeepSeek V4 Pro 0813 apareceu na página oficial de preços da DeepSeek, sob o model ID DeepSeek-V4-Pro-0813, e já está servindo na API. É o release oficial do V4 Pro, aquele que estava preso no rótulo de preview desde abril. O changelog da DeepSeek, no entanto, ainda não tem uma linha sobre ele.
Neste post: o que exatamente entrou no ar hoje, quais números são fato e quais são reportagem, como o 0813 se compara com o Flash 0731 e com o Opus 4.8, e o aviso que está escrito na própria página de preços da DeepSeek e que muda a sua conta nas próximas semanas.
TL;DR
- O que é:
DeepSeek-V4-Pro-0813, o release oficial (GA) do DeepSeek V4 Pro. Estava como preview desde abril de 2026. - Specs: MoE de 1,6 trilhão de parâmetros totais e 49B ativos, 1M de contexto, 384K de saída máxima, modos thinking e non-thinking, tool calling.
- Preço: US$ 0,003625 input com cache hit, US$ 0,435 input com cache miss, US$ 0,87 output por 1M de tokens.
- Benchmark de destaque: 87,9 no Terminal Bench 2.1 — número reportado, ainda não confirmado no changelog oficial.
- O aviso: a página de preços da DeepSeek diz, em letras próprias, que a empresa planeja aumentar os preços da API "em breve", com "aumento significativo esperado".
- Onde já está: API de primeira mão da DeepSeek e OpenRouter, com slug datado.
O que entrou no ar hoje (e o que ainda não entrou)
Vale separar as duas coisas, porque a internet já está tratando tudo como anúncio oficial e não é bem isso.
O que é fato, com fonte primária. O model ID DeepSeek-V4-Pro-0813 está publicado na página de preços da DeepSeek com tabela própria. A OpenRouter já lista o modelo como slug datado e o descreve como "the GA release of DeepSeek V4 Pro". Ou seja: o modelo existe, tem preço, está respondendo e saiu do rótulo de preview.
O que ainda não é fato. O changelog oficial da DeepSeek continua parado em 31 de julho, na entrada do V4-Flash. E aquela entrada termina exatamente assim: "This update only upgrades the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and the APP/WEB models are unchanged. The official release of DeepSeek-V4-Pro will follow soon."
O "soon" era hoje. Só que a tabela de benchmarks que normalmente acompanha um release da DeepSeek ainda não saiu, e o card no Hugging Face do 0813 ainda não está público.
Isso importa por um motivo prático: os números que você está vendo circular hoje não vieram de um documento da DeepSeek que você possa abrir. Vieram de gente lendo a página de preços e reportando as tabelas internas. Trato eles como reportagem neste post, e marco cada um.
Escolher entre Pro 0813, Flash 0731 e Opus 4.8 esta semana não é ler tabela de benchmark — é decidir com informação incompleta e ter repertório pra saber o que a tabela não conta. Esse tipo de leitura é o que a gente faz junto toda semana no Clã Beer and Code: é pago, é assinatura, e é gente testando modelo novo em produto real antes de trocar o que já está em produção.
Os números do DeepSeek V4 Pro 0813
Aqui está a tabela consolidada. A coluna do Pro Preview e a do Flash 0731 vêm da tabela oficial do card do V4-Flash-0731 no Hugging Face — são números da própria DeepSeek. A coluna do Pro 0813 é a reportada, sem documento público ainda.
| Benchmark | Pro 0813 (reportado) | Pro Preview (oficial) | Flash 0731 (oficial) | Opus 4.8 (tabela DeepSeek) |
|---|---|---|---|---|
| Terminal Bench 2.1 | 87,9 | 72,1 | 82,7 | 85,0 |
| DeepSWE | 62,7 | 12,8 | 54,4 | 58,0 |
| CyberGym | 83,3 | 52,7 | 76,7 | 83,1 |
| DSBench-Hard | 67,2 | 31,1 | 59,6 | 71,7 |
| AutomationBench | 31,8 | 12,8 | — | — |
Três leituras que valem mais que os números soltos.
Primeira: o salto do Pro é da mesma família do salto do Flash. O Flash tinha ido de 61,8 para 82,7 no Terminal Bench só com pós-treino, sem tocar em arquitetura. O Pro agora vai de 72,1 para 87,9. É a mesma receita aplicada no modelo grande — exatamente o que a gente apostou que ia acontecer no post do Flash 0731, quando marcamos o V4 Pro oficial como rumor. Virou fato.
Segunda: o DeepSWE de 12,8 para 62,7 é o número que deveria estar na manchete. Terminal Bench mede operar terminal. DeepSWE mede resolver tarefa de engenharia de software de verdade, em repositório. Um modelo saindo de 12,8 para 62,7 na mesma arquitetura não é ajuste fino, é outro comportamento. Se esse número se confirmar, é a diferença entre um modelo que você usa pra rodar comando e um modelo que você deixa mexer em código.
Terceira: o 87,9 passa o Opus 4.8 na própria régua da DeepSeek. Na tabela que a DeepSeek publicou em julho, o Opus 4.8 marcava 85,0 no Terminal Bench 2.1. Se o 87,9 for real, é a primeira vez que um modelo de pesos abertos aparece na frente do Opus nesse teste, medido pela casa que fez o modelo.
E é aí que entra a ressalva de sempre: benchmark rodado pelo lab e benchmark rodado por terceiro quase nunca batem, porque scaffold, número de tentativas e harness mudam. No Flash 0731 a DeepSeek publicou 82,7 e a Artificial Analysis mediu 79% no teste próprio. Espere um recuo parecido aqui quando a medição independente sair. Número de vendor é sinal, não contrato.
Preço do DeepSeek V4 Pro: o cache hit e o aviso que ninguém está lendo
A tabela oficial, por 1M de tokens:
| V4 Pro 0813 | V4 Flash 0731 | |
|---|---|---|
| Input (cache hit) | US$ 0,003625 | US$ 0,0028 |
| Input (cache miss) | US$ 0,435 | US$ 0,14 |
| Output | US$ 0,87 | US$ 0,28 |
O cache hit do Pro custa US$ 0,003625. O cache miss custa US$ 0,435. São 120 vezes de diferença.
Repete isso na cabeça, porque é a informação mais acionável do post inteiro. Se o seu agente tem system prompt grande e estável — e agente de terminal sempre tem — a diferença entre estruturar o prompt pra bater cache e não estruturar não é economia de planilha. É decisão de arquitetura. Você paga o preço de um modelo barato ou o preço de um modelo caro rodando exatamente o mesmo modelo.
E dá pra medir isso hoje, em uma linha de log. O campo que interessa é o cached_tokens:
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=msgs,
)
usage = resp.usage
cached = usage.prompt_tokens_details.cached_tokens
hit_rate = cached / usage.prompt_tokens if usage.prompt_tokens else 0
logger.info("llm_call", extra={
"model_returned": resp.model, # qual build respondeu de verdade
"prompt_tokens": usage.prompt_tokens,
"cached_tokens": cached,
"cache_hit_rate": round(hit_rate, 3), # abaixo de 0.8 é dinheiro no lixo
})
Cache hit rate baixo é o bug de custo mais comum e o mais silencioso: não quebra nada, não aparece em teste, só chega na fatura. E o model_returned no mesmo log é o que vai te dizer, daqui a duas semanas, se a DeepSeek trocou os pesos de novo sem avisar.
Agora o aviso. Está escrito na própria página de preços da DeepSeek:
DeepSeek plans to raise overall pricing for DeepSeek API services in the near future, with a significant increase expected.
A DeepSeek está avisando que vai subir o preço, e usando a palavra "significativo". Não tem data nem percentual. Mas o recado é claro: a tabela que você está lendo hoje é a tabela mais barata que você vai ver dessa geração.
Isso muda o que você faz com essa informação. Se você estava esperando "amadurecer" antes de testar o V4 Pro, o cálculo inverteu: rodar sua eval agora, na tabela atual, é o que te dá base de comparação quando o preço subir. Vale lembrar que essa é uma casa que já experimentou preço variável por horário de pico — tabela de preço da DeepSeek é coisa que se confere, não que se decora.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãDeepSeek V4 Pro vs Flash: Pro 0813 ou Flash 0731?
O Flash não virou lixo hoje. Ele ficou com um recorte mais estreito.
O Pro custa 3,1x o Flash no input com cache miss e 3,1x no output. Em troca, se os números reportados se confirmarem, entrega ~5 pontos a mais no Terminal Bench, ~8 no DeepSWE e ~7 no CyberGym. Não é um salto que justifica trocar tudo por padrão.
Onde o Pro passa a valer:
- Tarefa de repositório inteiro. O DeepSWE de 62,7 contra 54,4 do Flash, e principalmente o histórico do Flash de ser fraco em NL2Repo, apontam o Pro pra esse recorte.
- Contexto realmente longo. Os dois têm 1M, mas 49B de parâmetros ativos sustentam raciocínio longo melhor que 13B. Se o seu caso é análise de codebase inteira, é aqui.
- Quando o erro é caro. Loop de agente que faz commit, mexe em infra ou toca em dado de cliente. Cinco pontos de benchmark viram muitas horas de debug.
Onde o Flash continua ganhando:
- Volume. Classificação, extração, roteamento, sumarização. Pagar 3x por tarefa que o Flash resolve é queimar orçamento.
- Latência. 13B ativos respondem mais rápido que 49B. Em loop interativo isso pesa mais que benchmark.
- Rodar local. O Flash já pede 169 GB de RAM+VRAM no quant bom, como a gente detalhou no post sobre rodar o V4 Flash local. O Pro tem 1,6 trilhão de parâmetros totais. Para máquina de gente, esse modelo é API, não self-hosting.
Limitações e pontos de atenção
O card oficial não saiu. Nenhum dos números do 0813 tem documento público da DeepSeek até agora. Se você vai tomar decisão de arquitetura em cima disso hoje, tome sabendo que a fonte é reportagem, e reconfira quando o changelog subir.
O nome do modelo na API continua sendo alvo móvel. Esse foi o assunto central do post do Flash 0731, e não mudou: na API de primeira mão você chama deepseek-v4-pro e não tem como fixar build. Se pin de versão é requisito do seu produto, o caminho é provider terceiro — a OpenRouter publica o slug datado deepseek/deepseek-v4-pro-0813, o que te dá reprodutibilidade em troca de uma camada a mais e preço um pouco pior.
Benchmark de agente não é benchmark do seu produto. Um salto de 50 pontos no DeepSWE não garante que o seu fluxo melhorou. Pós-treino pesado em ferramenta mexe em formato de saída, verbosidade e obediência a instrução — coisas que podem quebrar seu parser sem aparecer em nenhuma tabela.
Compliance antes de licença. Os pesos do V4 Pro estão sob MIT, o que resolve o lado jurídico do uso comercial. O que não se resolve com licença é o risco geopolítico e a política do seu cliente, que a gente destrinchou no post sobre sanções à IA chinesa open source.
FAQ rápido
Preciso mudar meu código pra usar o 0813?
Não. O nome na API continua deepseek-v4-pro. Se você já chamava o Pro, o 0813 já está respondendo pra você. O trabalho não é de integração, é de validação: rode sua eval e compare com o baseline antes de assumir que melhorou.
Como eu fixo essa versão específica?
Na API de primeira mão da DeepSeek, não fixa. Use o slug datado da OpenRouter (deepseek/deepseek-v4-pro-0813) se reprodutibilidade for requisito. E logue sempre o campo model da resposta — é a sua única testemunha quando o comportamento mudar.
Posso usar comercialmente? Sim, os pesos são MIT. A ressalva relevante é de compliance de cliente, não de licença.
Vale a pena migrar do Flash pro Pro agora? Só se o seu gargalo é tarefa de repositório ou contexto muito longo. Para volume e latência o Flash continua sendo a escolha certa. Migre por medição, não por manchete.
Conclusão
O fato de hoje é pequeno: um model ID novo numa página de preços. A implicação é grande.
A DeepSeek mostrou pela segunda vez em doze dias que consegue arrancar salto grande de agente só com pós-treino, sem tocar em arquitetura. Primeiro no Flash, agora no Pro. E o 87,9 no Terminal Bench, se confirmar, coloca um modelo de pesos abertos na frente do Opus 4.8 pela primeira vez na régua da própria DeepSeek.
Mas a parte que sobrevive ao ciclo de notícia é o aviso na página de preços. A DeepSeek está sinalizando aumento significativo. O modelo aberto barato que estava corroendo a margem dos labs americanos acabou de avisar que vai ficar menos barato. Se a sua arquitetura tem uma premissa de custo embutida nela — e quase toda arquitetura de agente tem — essa premissa tem prazo de validade.
Rode sua eval enquanto a tabela ainda é essa.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã