~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / noticias / deepseek-v4-1-flash-vs-opus-5-sol-k3 $
Notícias

DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

LS Lucas Souza · · 11 min de leitura
DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita

A DeepSeek soltou o V4.1 Flash hoje e a timeline fez o de sempre: print do benchmark, seta vermelha no número, "bateu o Opus 5 por 1% do preço". A parte do preço é verdade; a parte do "bateu" depende de qual benchmark você olha.

O DeepSeek V4.1 Flash é um MoE multimodal de 552B de parâmetros no backbone que ativa 8B por token no prefill e 16B no decode, roda 1M de contexto e saiu com licença MIT. Na tabela oficial da própria DeepSeek ele lidera o Terminal-Bench 2.1 e o DeepSWE v1.1 — à frente do Opus 5, do GPT-5.6 Sol, do Kimi K3 e do GLM-5.3. Na mesma tabela oficial, ele leva uma surra no Terminal-Bench 3.0 e 4.0.

Ninguém está citando essas duas últimas linhas. Este post cita. Vamos comparar o V4.1 Flash com os equivalentes reais de mercado em preço e em benchmark, mostrar onde a economia se paga e onde ela sai cara, e fechar com o dado que mais me surpreendeu: o scaffold que você usa muda mais o resultado do que a troca do modelo.

TL;DR

  • O que é: DeepSeek V4.1 Flash, MoE multimodal de 552B (8B/16B ativos), contexto de 1M, visão nativa, licença MIT.
  • Modelos comparados: Claude Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3, DeepSeek V4 Pro, GPT-6 Astra, Grok 4.6, Qwen 3.8 Flash.
  • Custo/Acesso: US$ 0,15 por 1M de entrada e US$ 0,60 por 1M de saída fora do pico. Pesos abertos no Hugging Face.
  • O detalhe que muda a decisão: lidera o Terminal-Bench 2.1 com 90,6 e cai para 30,0 no 3.0 e 31,2 no 4.0, enquanto o Opus 5 sustenta 43,3 e 51,8.
  • Link útil: changelog oficial da API e model card no Hugging Face.

O que a DeepSeek lançou (e o que morre no dia 14)

Comecemos pelo que é fato documentado, porque tem coisa aqui que vai quebrar código na sua mão.

O modelo novo atende por deepseek-flash na API. Os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp foram descontinuados e estão temporariamente redirecionados para o V4.1 Flash. E o aviso que interessa a quem tem agente em produção, no changelog oficial:

Starting at 04:00 UTC on Sept 14, 2026, all deepseek-v4-pro requests will route to V4.1-Flash at V4.1-Flash rates.

Traduzindo: 1h da manhã de domingo, 14 de setembro, no horário de Brasília, quem chama deepseek-v4-pro acorda rodando outro modelo. Com outra arquitetura, outro comportamento e outro preço. Se isso soa familiar, é porque é a segunda vez: a DeepSeek já tinha trocado os pesos do V4 Flash sem mudar o nome na API em julho, e o V4 Pro 0813 que analisamos no mês passado é justamente o modelo que está sendo aposentado agora.

A parte de engenharia é genuinamente interessante. A arquitetura se chama Causal Encoder-Decoder: 40 camadas organizadas como 20 de encoder causal seguidas de 20 de decoder, com o KV cache global do decoder projetado a partir dos hidden states finais do encoder em vez de derivado camada a camada. É isso que permite ativar só 8B de parâmetros por token no prefill. Somando o Compressed Sparse Attention 2 e o cache KV em FP4, a pegada do cache global cai para 890 bytes por token — cerca de 1/4 do V4 Flash anterior. Para carga agêntica, que é entrada-pesada por natureza, isso é o jogo inteiro.

Escolher entre esses modelos é a parte fácil da decisão. A difícil é montar o harness e o eval que te dizem se a troca valeu no seu código — e é exatamente isso que a gente constrói ao vivo, com erro aparecendo e sendo debugado na hora, no AI Engineering Lab 3ª Edição, dias 19 e 20 de setembro.

Preço: o DeepSeek V4.1 Flash contra os equivalentes

Aqui a conversa é curta, porque os números não deixam margem. Preços em dólar por 1M de tokens, coletados no OpenRouter em 10/09/2026:

Modelo Entrada Saída Contexto
DeepSeek V4.1 Flash 0,15 0,60 1M
Qwen 3.8 Flash 0,15 0,47 1M
GLM-5.3 Flash 0,15 0,50 1,3M
GPT-5.6 Luna 0,20 1,20 1,05M
DeepSeek V4 Pro 0,87 1,74 1M
GLM-5.3 1,40 4,40 1,3M
Grok 4.6 2,00 6,00 500k
GPT-5.6 Sol 2,00 10,00 1,05M
Kimi K3 3,00 15,00 1M
Claude Opus 5 5,00 25,00 1M
GPT-6 Astra 10,00 50,00 1,05M

O token de saída do Opus 5 custa 41 vezes o do V4.1 Flash. O do GPT-6 Astra, 83 vezes. E note uma coisa que a maioria dos posts de comparação erra: o V4.1 Flash não é o mais barato da tabela. Qwen 3.8 Flash e GLM-5.3 Flash cobram o mesmo na entrada e menos na saída. A briga da faixa de US$ 0,15 já tem três participantes — o que o V4.1 Flash traz de novo não é o preço, é o que ele entrega nesse preço.

Vale lembrar que o preço direto na API da DeepSeek tem tarifa por horário de pico: os US$ 0,15 e US$ 0,60 são de fora do pico. Entre 01:00–04:00 e 06:00–10:00 UTC de segunda a sexta, dobra.

Benchmark: onde ele ganha de verdade

Esta é a tabela oficial do model card, com esforço de raciocínio no máximo. Não é print de tweet, é o documento que a própria DeepSeek publicou:

Benchmark Opus 5 GPT-5.6 Sol Kimi K3 GLM-5.3 V4 Pro V4.1 Flash
GPQA Diamond 93,4 94,1 92,9 88,1 92,4 90,9
HLE 56,3 44,5 43,5 42,0 42,7 36,8
Terminal-Bench 2.1 89,1 88,8 88,3 88,2 87,9 90,6
DeepSWE v1.1 74,0 73,0 67,5 66,9 62,7 74,2
Codeforces (rating) 3348 3471
CyberGym 84,5 80,0 84,5 83,3 88,1
AutomationBench 50,3 45,8 46,7 48,8 43,2 54,8
Agent's Last Exam 28,6 26,7 27,6 28,5 25,7 31,8
NL2Repo-Bench 75,3 56,8 58,0 58,0 61,5 64,0
ProgramBench 37,0 23,0 17,5 19,0 15,5 20,3

Leia com calma, porque tem duas histórias aqui.

A primeira é real e boa: em tarefa agêntica de terminal e resolução de issue — Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench, CyberGym — o V4.1 Flash lidera. Não empata: lidera, à frente de modelo que custa 40 vezes mais. Para quem roda agente que abre PR, corrige bug reportado e mexe em repositório existente, isso é dinheiro no bolso.

A segunda é o contrapeso: em raciocínio puro e construção do zero, ele apanha. HLE 36,8 contra 56,3 do Opus 5. ProgramBench 20,3 contra 37,0. NL2Repo-Bench 64,0 contra 75,3. GPQA Diamond abaixo do Opus 5, do Sol e do próprio V4 Pro que ele está substituindo.

O padrão é consistente e faz sentido arquitetural: um modelo que ativa 8B de parâmetros por token de entrada é excelente para navegar contexto grande e barato, e limitado para sintetizar raciocínio novo e profundo.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

O benchmark que ninguém está citando

Agora a parte que sumiu de todo print que circulou hoje. Terminal-Bench não tem uma versão só:

Opus 5 GPT-5.6 Sol GLM-5.3 Kimi K3 V4.1 Flash
Terminal-Bench 2.1 89,1 88,8 88,2 88,3 90,6
Terminal-Bench 3.0 43,3 34,4 28,3 17,7 30,0
Terminal-Bench 4.0 51,8 39,9 37,9 12,6 31,2

O 2.1 é o benchmark que todo mundo está citando, e nele o V4.1 Flash é o primeiro colocado com 90,6.

No 3.0 ele cai para 30,0 — abaixo do Opus 5 e do GPT-5.6 Sol. No 4.0 cai para 31,2, enquanto o Opus 5 sobe para 51,8. Uma diferença de 20 pontos absolutos.

Por que isso acontece? Porque o Terminal-Bench 2.1 está saturado. Cinco modelos diferentes tirando entre 87,9 e 90,6 não é um benchmark medindo capacidade — é um benchmark medindo quem treinou mais perto do conjunto de tarefas dele. As versões 3.0 e 4.0 existem justamente porque a 2.1 parou de discriminar. E é nelas que a distância entre modelo de fronteira e modelo barato reaparece inteira.

Isso não é acusação de má-fé com a DeepSeek — os números do 3.0 e do 4.0 estão publicados na tabela oficial deles, sem esconder nada. O problema é o ciclo de divulgação, que recorta a linha boa e joga fora as duas de baixo.

E casa com o teste independente que rodou em paralelo. Pawel Huryn testou o modelo em dois repositórios com 105 bugs escondidos, pedindo para achar e corrigir o que conseguisse:

Modelo (esforço) Bugs corrigidos Custo
Opus 5 (max) 27 US$ 51,33
Grok 4.6 (max) 27 US$ 16,96
DeepSeek V4.1 Flash (max) 24 US$ 1,80
GPT-5.6 Luna (xhigh) 23 US$ 2,50
Opus 5 (high) 21 US$ 38,77

Não é o placar de "esmagou o Opus 5" que circulou. É um placar de 24 contra 27 — 11% menos bugs corrigidos por 3,5% do custo. O que, convenhamos, continua sendo um resultado absurdo. Só não é o resultado que o print prometia.

Repare também na linha do Opus 5 (high): 21 bugs por US$ 38,77. O mesmo modelo, com menos esforço de raciocínio, entrega menos que o V4.1 Flash cobrando 21 vezes mais. Configuração errada é mais cara que modelo errado.

O scaffold muda mais que o modelo

Este é o dado que eu mais queria ter visto há um ano, e que está escondido no fim do model card. Mesmo modelo, mesmas tarefas, mesmas configurações de sampling — mudando só o harness que orquestra o agente:

Scaffold DeepSWE v1.1 Terminal-Bench 2.1
mini-SWE 74,2 90,3
DSH Minimal 72,6 90,6
DSH Standard 70,5 85,8
Claude Code 69,8 88,0
DSH PTC 67,6 85,8
Pi 66,2 86,1
Codex 65,6 84,1
OpenCode 65,5 85,0

8,7 pontos de diferença no DeepSWE, com o modelo idêntico. Só trocando o scaffold.

Compare com a distância que gerou toda a discussão de hoje: 74,2 do V4.1 Flash contra 74,0 do Opus 5 no mesmo benchmark. Dois décimos.

Ou seja: a escolha do harness pesou quarenta vezes mais no resultado final do que a escolha entre o modelo mais barato e o mais caro do mercado. Se o seu agente está indo mal, a chance de o problema estar no seu loop de orquestração — como você monta o contexto, quantos passos permite, como trata a saída de ferramenta — é muito maior do que a chance de estar no modelo.

É por isso que "qual modelo devo usar" é quase sempre a pergunta errada. E é por isso que trocar de modelo raramente resolve o que a gente espera que resolva.

Limitações e pontos de atenção

O roteamento do V4 Pro é dia 14 e não é opcional. Se você tem agente em produção apontando para deepseek-v4-pro, tem quatro dias para testar o V4.1 Flash no seu fluxo. O comportamento vai mudar — o V4 Pro é um MoE de 1,6T com 49B ativos, o V4.1 Flash é 552B com 8B/16B. Não é a mesma cabeça.

Rodar local não é para qualquer máquina. Pesos MIT no Hugging Face não significa que cabe na sua GPU. São 552B de backbone mais 196B do Engram. A licença é aberta; a conta de VRAM, nem tanto.

A tarifa dobra no pico. Todo cálculo de economia feito com US$ 0,15 e US$ 0,60 assume janela fora do pico. Se sua carga roda no horário comercial brasileiro, confira em que faixa UTC ela cai antes de prometer economia para o time.

Reasoning effort não é detalhe. O modelo aceita esforço contínuo de 1 a 100, e todos os números deste post são com 100. Rodar em esforço baixo derruba resultado e custo juntos — e é uma variável que você precisa fixar antes de comparar qualquer coisa com qualquer coisa.

Benchmark saturado é ruído. Se um benchmark tem cinco modelos separados por 2,7 pontos, ele parou de te ajudar a decidir. Procure a versão nova, ou monte seu próprio conjunto de tarefas com o código que você realmente mantém.

FAQ rápido

Vale trocar meu agente de Opus 5 para V4.1 Flash hoje? Se o trabalho é agêntico e repetitivo — corrigir bug reportado, mexer em repo existente, rodar comando de terminal, triagem — vale testar já: o benchmark favorece e a economia é de mais de uma ordem de grandeza. Se o trabalho é arquitetura nova, raciocínio longo ou construção do zero, os números do NL2Repo-Bench e do ProgramBench dizem para ficar onde está.

Qual nome de modelo eu chamo na API? deepseek-flash aponta para o V4.1 Flash. deepseek-v4-flash e deepseek-v4-flash-vision-exp estão redirecionados temporariamente, e deepseek-v4-pro passa a ser redirecionado às 04:00 UTC de 14/09/2026. Fixe o nome novo antes da data.

Posso usar comercialmente? Sim. Os pesos estão sob licença MIT no Hugging Face. Via API, valem os termos da DeepSeek. Se o seu contexto é empresa com dado sensível, a conversa é de governança e residência de dado, não de licença — e aí OpenRouter ou provedor gerenciado muda o cálculo.

Ele é multimodal de verdade ou é adaptador colado depois? De verdade. O vision encoder foi treinado do zero e as embeddings visuais entram junto com as de texto desde o início do pré-treino, sobre um corpus de 45T tokens multimodal. Na prática: DocVQA 95,6 e RefCOCO 86,0 no modelo base.

Conclusão

O DeepSeek V4.1 Flash é um lançamento importante e a economia é real — para carga agêntica, ele entrega perto do topo cobrando uma fração. Isso não é hype, é a tabela oficial.

Mas o post que só mostra a linha do Terminal-Bench 2.1 está te vendendo metade da informação. A outra metade é que o mesmo modelo cai 20 pontos abaixo do Opus 5 nas versões novas do mesmo benchmark, e que o scaffold que você escolhe move o resultado quarenta vezes mais do que a troca de modelo.

A lição que sobra não é sobre a DeepSeek. É sobre método: se você não tem um conjunto de tarefas do seu próprio código e um harness estável para rodar as duas opções lado a lado, você não está escolhendo modelo. Está escolhendo manchete.

Se quiser ver a conta de token de um agente sendo montada linha a linha, o próximo passo é quanto custa um agente de IA em produção. E para entender por que benchmark de fronteira anda descolando da experiência real, vale o comparativo GPT-6 Astra vs Fable 5.1 vs GPT-5.6 Sol.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando