DeepSeek V4.1 Flash vs Opus 5, Sol e K3: 41x mais barato e o benchmark que ninguém cita
A DeepSeek soltou o V4.1 Flash hoje e a timeline fez o de sempre: print do benchmark, seta vermelha no número, "bateu o Opus 5 por 1% do preço". A parte do preço é verdade; a parte do "bateu" depende de qual benchmark você olha.
O DeepSeek V4.1 Flash é um MoE multimodal de 552B de parâmetros no backbone que ativa 8B por token no prefill e 16B no decode, roda 1M de contexto e saiu com licença MIT. Na tabela oficial da própria DeepSeek ele lidera o Terminal-Bench 2.1 e o DeepSWE v1.1 — à frente do Opus 5, do GPT-5.6 Sol, do Kimi K3 e do GLM-5.3. Na mesma tabela oficial, ele leva uma surra no Terminal-Bench 3.0 e 4.0.
Ninguém está citando essas duas últimas linhas. Este post cita. Vamos comparar o V4.1 Flash com os equivalentes reais de mercado em preço e em benchmark, mostrar onde a economia se paga e onde ela sai cara, e fechar com o dado que mais me surpreendeu: o scaffold que você usa muda mais o resultado do que a troca do modelo.
TL;DR
- O que é: DeepSeek V4.1 Flash, MoE multimodal de 552B (8B/16B ativos), contexto de 1M, visão nativa, licença MIT.
- Modelos comparados: Claude Opus 5, GPT-5.6 Sol, Kimi K3, GLM-5.3, DeepSeek V4 Pro, GPT-6 Astra, Grok 4.6, Qwen 3.8 Flash.
- Custo/Acesso: US$ 0,15 por 1M de entrada e US$ 0,60 por 1M de saída fora do pico. Pesos abertos no Hugging Face.
- O detalhe que muda a decisão: lidera o Terminal-Bench 2.1 com 90,6 e cai para 30,0 no 3.0 e 31,2 no 4.0, enquanto o Opus 5 sustenta 43,3 e 51,8.
- Link útil: changelog oficial da API e model card no Hugging Face.
O que a DeepSeek lançou (e o que morre no dia 14)
Comecemos pelo que é fato documentado, porque tem coisa aqui que vai quebrar código na sua mão.
O modelo novo atende por deepseek-flash na API. Os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp foram descontinuados e estão temporariamente redirecionados para o V4.1 Flash. E o aviso que interessa a quem tem agente em produção, no changelog oficial:
Starting at 04:00 UTC on Sept 14, 2026, all
deepseek-v4-prorequests will route to V4.1-Flash at V4.1-Flash rates.
Traduzindo: 1h da manhã de domingo, 14 de setembro, no horário de Brasília, quem chama deepseek-v4-pro acorda rodando outro modelo. Com outra arquitetura, outro comportamento e outro preço. Se isso soa familiar, é porque é a segunda vez: a DeepSeek já tinha trocado os pesos do V4 Flash sem mudar o nome na API em julho, e o V4 Pro 0813 que analisamos no mês passado é justamente o modelo que está sendo aposentado agora.
A parte de engenharia é genuinamente interessante. A arquitetura se chama Causal Encoder-Decoder: 40 camadas organizadas como 20 de encoder causal seguidas de 20 de decoder, com o KV cache global do decoder projetado a partir dos hidden states finais do encoder em vez de derivado camada a camada. É isso que permite ativar só 8B de parâmetros por token no prefill. Somando o Compressed Sparse Attention 2 e o cache KV em FP4, a pegada do cache global cai para 890 bytes por token — cerca de 1/4 do V4 Flash anterior. Para carga agêntica, que é entrada-pesada por natureza, isso é o jogo inteiro.
Escolher entre esses modelos é a parte fácil da decisão. A difícil é montar o harness e o eval que te dizem se a troca valeu no seu código — e é exatamente isso que a gente constrói ao vivo, com erro aparecendo e sendo debugado na hora, no AI Engineering Lab 3ª Edição, dias 19 e 20 de setembro.
Preço: o DeepSeek V4.1 Flash contra os equivalentes
Aqui a conversa é curta, porque os números não deixam margem. Preços em dólar por 1M de tokens, coletados no OpenRouter em 10/09/2026:
| Modelo | Entrada | Saída | Contexto |
|---|---|---|---|
| DeepSeek V4.1 Flash | 0,15 | 0,60 | 1M |
| Qwen 3.8 Flash | 0,15 | 0,47 | 1M |
| GLM-5.3 Flash | 0,15 | 0,50 | 1,3M |
| GPT-5.6 Luna | 0,20 | 1,20 | 1,05M |
| DeepSeek V4 Pro | 0,87 | 1,74 | 1M |
| GLM-5.3 | 1,40 | 4,40 | 1,3M |
| Grok 4.6 | 2,00 | 6,00 | 500k |
| GPT-5.6 Sol | 2,00 | 10,00 | 1,05M |
| Kimi K3 | 3,00 | 15,00 | 1M |
| Claude Opus 5 | 5,00 | 25,00 | 1M |
| GPT-6 Astra | 10,00 | 50,00 | 1,05M |
O token de saída do Opus 5 custa 41 vezes o do V4.1 Flash. O do GPT-6 Astra, 83 vezes. E note uma coisa que a maioria dos posts de comparação erra: o V4.1 Flash não é o mais barato da tabela. Qwen 3.8 Flash e GLM-5.3 Flash cobram o mesmo na entrada e menos na saída. A briga da faixa de US$ 0,15 já tem três participantes — o que o V4.1 Flash traz de novo não é o preço, é o que ele entrega nesse preço.
Vale lembrar que o preço direto na API da DeepSeek tem tarifa por horário de pico: os US$ 0,15 e US$ 0,60 são de fora do pico. Entre 01:00–04:00 e 06:00–10:00 UTC de segunda a sexta, dobra.
Benchmark: onde ele ganha de verdade
Esta é a tabela oficial do model card, com esforço de raciocínio no máximo. Não é print de tweet, é o documento que a própria DeepSeek publicou:
| Benchmark | Opus 5 | GPT-5.6 Sol | Kimi K3 | GLM-5.3 | V4 Pro | V4.1 Flash |
|---|---|---|---|---|---|---|
| GPQA Diamond | 93,4 | 94,1 | 92,9 | 88,1 | 92,4 | 90,9 |
| HLE | 56,3 | 44,5 | 43,5 | 42,0 | 42,7 | 36,8 |
| Terminal-Bench 2.1 | 89,1 | 88,8 | 88,3 | 88,2 | 87,9 | 90,6 |
| DeepSWE v1.1 | 74,0 | 73,0 | 67,5 | 66,9 | 62,7 | 74,2 |
| Codeforces (rating) | — | — | — | — | 3348 | 3471 |
| CyberGym | — | 84,5 | 80,0 | 84,5 | 83,3 | 88,1 |
| AutomationBench | 50,3 | 45,8 | 46,7 | 48,8 | 43,2 | 54,8 |
| Agent's Last Exam | 28,6 | 26,7 | 27,6 | 28,5 | 25,7 | 31,8 |
| NL2Repo-Bench | 75,3 | 56,8 | 58,0 | 58,0 | 61,5 | 64,0 |
| ProgramBench | 37,0 | 23,0 | 17,5 | 19,0 | 15,5 | 20,3 |
Leia com calma, porque tem duas histórias aqui.
A primeira é real e boa: em tarefa agêntica de terminal e resolução de issue — Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench, CyberGym — o V4.1 Flash lidera. Não empata: lidera, à frente de modelo que custa 40 vezes mais. Para quem roda agente que abre PR, corrige bug reportado e mexe em repositório existente, isso é dinheiro no bolso.
A segunda é o contrapeso: em raciocínio puro e construção do zero, ele apanha. HLE 36,8 contra 56,3 do Opus 5. ProgramBench 20,3 contra 37,0. NL2Repo-Bench 64,0 contra 75,3. GPQA Diamond abaixo do Opus 5, do Sol e do próprio V4 Pro que ele está substituindo.
O padrão é consistente e faz sentido arquitetural: um modelo que ativa 8B de parâmetros por token de entrada é excelente para navegar contexto grande e barato, e limitado para sintetizar raciocínio novo e profundo.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãO benchmark que ninguém está citando
Agora a parte que sumiu de todo print que circulou hoje. Terminal-Bench não tem uma versão só:
| Opus 5 | GPT-5.6 Sol | GLM-5.3 | Kimi K3 | V4.1 Flash | |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 89,1 | 88,8 | 88,2 | 88,3 | 90,6 |
| Terminal-Bench 3.0 | 43,3 | 34,4 | 28,3 | 17,7 | 30,0 |
| Terminal-Bench 4.0 | 51,8 | 39,9 | 37,9 | 12,6 | 31,2 |
O 2.1 é o benchmark que todo mundo está citando, e nele o V4.1 Flash é o primeiro colocado com 90,6.
No 3.0 ele cai para 30,0 — abaixo do Opus 5 e do GPT-5.6 Sol. No 4.0 cai para 31,2, enquanto o Opus 5 sobe para 51,8. Uma diferença de 20 pontos absolutos.
Por que isso acontece? Porque o Terminal-Bench 2.1 está saturado. Cinco modelos diferentes tirando entre 87,9 e 90,6 não é um benchmark medindo capacidade — é um benchmark medindo quem treinou mais perto do conjunto de tarefas dele. As versões 3.0 e 4.0 existem justamente porque a 2.1 parou de discriminar. E é nelas que a distância entre modelo de fronteira e modelo barato reaparece inteira.
Isso não é acusação de má-fé com a DeepSeek — os números do 3.0 e do 4.0 estão publicados na tabela oficial deles, sem esconder nada. O problema é o ciclo de divulgação, que recorta a linha boa e joga fora as duas de baixo.
E casa com o teste independente que rodou em paralelo. Pawel Huryn testou o modelo em dois repositórios com 105 bugs escondidos, pedindo para achar e corrigir o que conseguisse:
| Modelo (esforço) | Bugs corrigidos | Custo |
|---|---|---|
| Opus 5 (max) | 27 | US$ 51,33 |
| Grok 4.6 (max) | 27 | US$ 16,96 |
| DeepSeek V4.1 Flash (max) | 24 | US$ 1,80 |
| GPT-5.6 Luna (xhigh) | 23 | US$ 2,50 |
| Opus 5 (high) | 21 | US$ 38,77 |
Não é o placar de "esmagou o Opus 5" que circulou. É um placar de 24 contra 27 — 11% menos bugs corrigidos por 3,5% do custo. O que, convenhamos, continua sendo um resultado absurdo. Só não é o resultado que o print prometia.
Repare também na linha do Opus 5 (high): 21 bugs por US$ 38,77. O mesmo modelo, com menos esforço de raciocínio, entrega menos que o V4.1 Flash cobrando 21 vezes mais. Configuração errada é mais cara que modelo errado.
O scaffold muda mais que o modelo
Este é o dado que eu mais queria ter visto há um ano, e que está escondido no fim do model card. Mesmo modelo, mesmas tarefas, mesmas configurações de sampling — mudando só o harness que orquestra o agente:
| Scaffold | DeepSWE v1.1 | Terminal-Bench 2.1 |
|---|---|---|
| mini-SWE | 74,2 | 90,3 |
| DSH Minimal | 72,6 | 90,6 |
| DSH Standard | 70,5 | 85,8 |
| Claude Code | 69,8 | 88,0 |
| DSH PTC | 67,6 | 85,8 |
| Pi | 66,2 | 86,1 |
| Codex | 65,6 | 84,1 |
| OpenCode | 65,5 | 85,0 |
8,7 pontos de diferença no DeepSWE, com o modelo idêntico. Só trocando o scaffold.
Compare com a distância que gerou toda a discussão de hoje: 74,2 do V4.1 Flash contra 74,0 do Opus 5 no mesmo benchmark. Dois décimos.
Ou seja: a escolha do harness pesou quarenta vezes mais no resultado final do que a escolha entre o modelo mais barato e o mais caro do mercado. Se o seu agente está indo mal, a chance de o problema estar no seu loop de orquestração — como você monta o contexto, quantos passos permite, como trata a saída de ferramenta — é muito maior do que a chance de estar no modelo.
É por isso que "qual modelo devo usar" é quase sempre a pergunta errada. E é por isso que trocar de modelo raramente resolve o que a gente espera que resolva.
Limitações e pontos de atenção
O roteamento do V4 Pro é dia 14 e não é opcional. Se você tem agente em produção apontando para deepseek-v4-pro, tem quatro dias para testar o V4.1 Flash no seu fluxo. O comportamento vai mudar — o V4 Pro é um MoE de 1,6T com 49B ativos, o V4.1 Flash é 552B com 8B/16B. Não é a mesma cabeça.
Rodar local não é para qualquer máquina. Pesos MIT no Hugging Face não significa que cabe na sua GPU. São 552B de backbone mais 196B do Engram. A licença é aberta; a conta de VRAM, nem tanto.
A tarifa dobra no pico. Todo cálculo de economia feito com US$ 0,15 e US$ 0,60 assume janela fora do pico. Se sua carga roda no horário comercial brasileiro, confira em que faixa UTC ela cai antes de prometer economia para o time.
Reasoning effort não é detalhe. O modelo aceita esforço contínuo de 1 a 100, e todos os números deste post são com 100. Rodar em esforço baixo derruba resultado e custo juntos — e é uma variável que você precisa fixar antes de comparar qualquer coisa com qualquer coisa.
Benchmark saturado é ruído. Se um benchmark tem cinco modelos separados por 2,7 pontos, ele parou de te ajudar a decidir. Procure a versão nova, ou monte seu próprio conjunto de tarefas com o código que você realmente mantém.
FAQ rápido
Vale trocar meu agente de Opus 5 para V4.1 Flash hoje? Se o trabalho é agêntico e repetitivo — corrigir bug reportado, mexer em repo existente, rodar comando de terminal, triagem — vale testar já: o benchmark favorece e a economia é de mais de uma ordem de grandeza. Se o trabalho é arquitetura nova, raciocínio longo ou construção do zero, os números do NL2Repo-Bench e do ProgramBench dizem para ficar onde está.
Qual nome de modelo eu chamo na API?
deepseek-flash aponta para o V4.1 Flash. deepseek-v4-flash e deepseek-v4-flash-vision-exp estão redirecionados temporariamente, e deepseek-v4-pro passa a ser redirecionado às 04:00 UTC de 14/09/2026. Fixe o nome novo antes da data.
Posso usar comercialmente? Sim. Os pesos estão sob licença MIT no Hugging Face. Via API, valem os termos da DeepSeek. Se o seu contexto é empresa com dado sensível, a conversa é de governança e residência de dado, não de licença — e aí OpenRouter ou provedor gerenciado muda o cálculo.
Ele é multimodal de verdade ou é adaptador colado depois? De verdade. O vision encoder foi treinado do zero e as embeddings visuais entram junto com as de texto desde o início do pré-treino, sobre um corpus de 45T tokens multimodal. Na prática: DocVQA 95,6 e RefCOCO 86,0 no modelo base.
Conclusão
O DeepSeek V4.1 Flash é um lançamento importante e a economia é real — para carga agêntica, ele entrega perto do topo cobrando uma fração. Isso não é hype, é a tabela oficial.
Mas o post que só mostra a linha do Terminal-Bench 2.1 está te vendendo metade da informação. A outra metade é que o mesmo modelo cai 20 pontos abaixo do Opus 5 nas versões novas do mesmo benchmark, e que o scaffold que você escolhe move o resultado quarenta vezes mais do que a troca de modelo.
A lição que sobra não é sobre a DeepSeek. É sobre método: se você não tem um conjunto de tarefas do seu próprio código e um harness estável para rodar as duas opções lado a lado, você não está escolhendo modelo. Está escolhendo manchete.
Se quiser ver a conta de token de um agente sendo montada linha a linha, o próximo passo é quanto custa um agente de IA em produção. E para entender por que benchmark de fronteira anda descolando da experiência real, vale o comparativo GPT-6 Astra vs Fable 5.1 vs GPT-5.6 Sol.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã