DeepSeek V4-Flash: Modelo Flash Supera o Pro em Agentes

O Que Mudou
A DeepSeek pôs o flash no topo. A atualização de 31 de julho alterou apenas o pós-treinamento focado em agente, mantendo a arquitetura da versão preview anterior. Nove benchmarks depois, o modelo mais barato supera o V4-Pro-Preview. O custo desabou. A capacidade subiu. O modelo que custa menos da metade agora é também o mais capaz para tarefas agenticas.
O Que Aconteceu
Em 31 de julho de 2026, a DeepSeek lançou a versão pública do V4-Flash-0731, substituindo o preview anterior. A atualização foi anunciada como uma mudança de pós-treinamento apenas: o changelog oficial da empresa afirma que a arquitetura e o tamanho do modelo são idênticos aos do V4-Flash-Preview, a versão anterior da mesma linha Flash. Nenhuma alteração estrutural. Só a calibração mudou. As comparações de benchmark no changelog são contra o V4-Pro-Preview, para simplificar a leitura, este artigo usa "V4-Pro" como abreviação desse modelo de referência.
O V4-Flash entregou nove resultados de benchmark de agente que a DeepSeek descreve como significativamente superiores aos do V4-Pro-Preview. Os números, extraídos do changelog de 31 de julho de 2026 na documentação oficial da API:
- Terminal Bench 2.1: 82,7
- NL2Repo: 54,2
- Cybergym: 76,7
Esses três benchmarks cobrem o núcleo da interação de um agente com o ambiente: terminal, repositório e segurança ofensiva. São métricas de execução real, não de compreensão de texto.
- DeepSWE: 54,4
- Toolathlon verified: 70,3
- Agent Last Exam: 25,2
Aqui o foco se desloca para engenharia de software ponta a ponta e uso de ferramentas. O DeepSWE é particularmente relevante para empresas que rodam agentes de código em produção.
- Automation Bench (Public): 25,1
- DSBench-FullStack (interno): 68,7
- DSBench-Hard (interno): 59,6
Os dois últimos são benchmarks internos da DeepSeek, não auditáveis externamente, mas consistentes com o padrão dos sete benchmarks públicos. Nenhum desses nove exercícios é acadêmico: cada um reflete uma capacidade que um agente real consome diariamente.
Os testes foram executados com o DeepSeek Harness em modo minimal, nível máximo de esforço, top-p 0,95 e temperatura 1,0. A empresa não publicou os valores comparativos do V4-Pro-Preview para cada benchmark individual, mas a formulação do changelog é inequívoca: o resultado agregado do V4-Flash supera o do V4-Pro-Preview nas nove métricas.
Além dos números, o V4-Flash estreou duas capacidades ausentes no V4-Pro. A primeira é o suporte nativo ao formato Responses API, que habilita a integração direta com ferramentas de agente. A segunda é a compatibilidade com o Codex, o assistente de código da OpenAI, incluindo CLI, extensão para VS Code e aplicativo desktop. O V4-Pro só receberá suporte ao Codex no início de agosto de 2026, segundo a própria DeepSeek.
Por Que Isso Importa
A precificação conta a outra metade da história. O V4-Flash custa USD 0,14 por milhão de tokens de entrada com cache miss e USD 0,28 por milhão de tokens de saída. O V4-Pro custa USD 0,435 na entrada e USD 0,87 na saída. O flash é 3,1 vezes mais barato em ambos os eixos.
Para um fluxo de trabalho agentico típico, onde o modelo é chamado repetidamente em loop, cada chamada acumula tokens de entrada e saída. A diferença de custo não é linear: ela compõe. Um agente que consome 10 milhões de tokens de entrada e 5 milhões de saída por dia gasta USD 2,80 no V4-Flash e USD 8,70 no V4-Pro. A economia diária de USD 5,90 vira USD 2.153,50 por ano com um único fluxo.
O que torna esse número relevante é a inversão. Até agora, o padrão do mercado ditava que modelos flash sacrificavam capacidade por velocidade e custo. Eram a rota econômica da política de roteamento, acionada para tarefas simples: classificação, extração, geração de texto não estruturado. Quando a tarefa exigia raciocínio em várias etapas, chamadas de ferramenta ou execução de código, o roteador subia para o tier Pro.
O V4-Flash quebra essa lógica. O modelo mais barato é também o mais capaz para o caso de uso que mais consome tokens, tarefas agenticas. Um roteador configurado com a regra clássica "flash para tarefas simples, Pro para tarefas complexas" está hoje enviando o trabalho mais exigente para o modelo mais caro e potencialmente menos competente.
O dado de concorrência reforça a assimetria. O V4-Flash oferece 2.500 chamadas simultâneas contra 500 do V4-Pro. Para uma empresa que escala agentes horizontalmente, a margem de cinco vezes na concorrência significa que o modelo flash aceita cinco vezes mais trabalho paralelo antes de atingir o teto de rate limit. Combinado com o custo 3,1 vezes menor, o throughput por dólar é mais de quinze vezes superior em cargas paralelizáveis.
A DeepSeek sinalizou ainda um modelo de precificação por pico que entrará em vigor em breve: durante as faixas das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), os preços dobram. Para um roteador empresarial que opera 24 horas, essa camada adicional de complexidade transforma a escolha do modelo em um problema de janela temporal: a rota mais barata fora do pico pode não ser a mesma do horário comercial chinês, e um sistema de roteamento sem suporte a precificação horária perderá dinheiro todos os dias.
O Que Muda na Prática
A atualização do V4-Flash reordena a hierarquia de roteamento para cargas agenticas: o modelo mais barato passa a ser a primeira opção para tarefas com ferramentas, e o V4-Pro recua para a posição de especialista em categorias onde os benchmarks ainda não falam. A tabela abaixo detalha cada dimensão da mudança.
| Dimensão | Antes (V4-Flash Preview) | Depois (V4-Flash-0731) |
|---|---|---|
| Posição na hierarquia de agentes | Abaixo do V4-Pro para tarefas agenticas | Acima do V4-Pro em 9 benchmarks de agente |
| Suporte a Codex | Ausente | Nativo, com script de instalação automática |
| Suporte a Responses API | Ausente | Nativo, único modelo da família com suporte |
| Preço de entrada (cache miss) | USD 0,14 por 1M tokens | USD 0,14 por 1M tokens (mantido) |
| Preço de saída | USD 0,28 por 1M tokens | USD 0,28 por 1M tokens (mantido) |
| Arquitetura do modelo | Igual ao V4-Flash-Preview | Igual ao V4-Flash-Preview (pós-treinamento apenas) |
| Concorrência máxima | Informação não listada | 2.500 chamadas simultâneas |
| Janela de contexto | 1 milhão de tokens | 1 milhão de tokens (mantido) |
| Previsibilidade de custo | Preço fixo | Sujeito a variação por pico (2× em horário comercial UTC+8) |
A coluna que mais pesa para a decisão de roteamento é a primeira. O V4-Flash deixou de ser o modelo de contingência para ser o modelo de preferência em cargas agenticas. A única degradação relevante é a incerteza de custo introduzida pelo modelo de precificação por pico, que transforma o preço fixo atual em uma variável dependente do relógio. É uma variável que dobra.
O Que Fazer Agora
Quatro decisões que a atualização do V4-Flash coloca na mesa de quem opera roteamento de modelos. Nenhuma delas é opcional, a inação aqui não é neutra, é uma aposta de que o V4-Pro permanecerá superior em tarefas agenticas, e os nove benchmarks disponíveis dizem o contrário.
-
Inverta a regra de roteamento para cargas agenticas. Se a política atual envia tarefas de agente para o V4-Pro e tarefas simples para o V4-Flash, a ordem está invertida. Roteie cargas agenticas para o V4-Flash e reserve o V4-Pro para situações onde o benchmark de agente não é o discriminante principal. O candidato mais óbvio é geração de texto longo com alta exigência estilística, mas até que a DeepSeek publique comparativos nessa categoria, a evidência disponível aponta o V4-Flash como a rota correta para qualquer carga que envolva ferramentas.
-
Recalcule o custo anual dos fluxos agenticos. Multiplique o volume diário de tokens dos seus agentes pela diferença de preço entre V4-Flash e V4-Pro. Para um único fluxo de 10M tokens de entrada e 5M de saída por dia, a troca economiza mais de USD 2.000 por ano. Para uma empresa com dezenas de agentes em produção, o valor compra infraestrutura. Inclua no cálculo o efeito da concorrência cinco vezes maior: o teto de 500 chamadas simultâneas do V4-Pro pode forçar a compra de capacidade adicional em outro fornecedor, enquanto o V4-Flash com 2.500 chamadas absorve o pico.
-
Prepare a camada de roteamento para precificação horária. O anúncio do modelo peak/off-peak da DeepSeek transforma o custo por token em uma função do horário de Pequim. Um roteador que não consulta a janela antes de selecionar o modelo pagará o dobro sem saber. Se o Nexforce Router estiver na stack, a regra de precificação horária é um parâmetro de configuração, não uma alteração de código.
-
Teste o V4-Flash via Codex antes da decisão de compra. A integração com Codex CLI e VS Code permite rodar o V4-Flash como backend de código sem escrever uma única chamada de API. O script de configuração da DeepSeek automatiza o setup. Testar o desempenho real em um fluxo de desenvolvimento agentico gera dados mais úteis do que comparar scores de benchmark.
FAQ
Os nove benchmarks publicados cobrem exclusivamente tarefas agenticas, código, automação, ferramentas. A DeepSeek não divulgou comparativos para geração de texto longo, raciocínio matemático puro ou qualidade de prosa. Essas lacunas são o que as perguntas abaixo abordam, e a resposta honesta para várias delas é "ainda não se sabe."
O V4-Flash é melhor que o V4-Pro em tudo?
Não. Os nove benchmarks publicados cobrem exclusivamente tarefas de agente: código, automação, uso de ferramentas e engenharia de software full-stack. Para tarefas como geração de texto longo, raciocínio matemático puro ou qualidade de prosa, a DeepSeek não publicou comparativos, e o V4-Pro pode manter vantagem. O V4-Flash é superior em cargas agenticas, não universalmente.
O V4-Flash tem a mesma arquitetura que o V4-Pro?
O changelog oficial de 31 de julho de 2026 afirma que o V4-Flash-0731 mantém a mesma arquitetura e o mesmo tamanho do V4-Flash-Preview, a versão anterior da linha Flash. A DeepSeek não publicou informação sobre a relação arquitetural entre V4-Flash e V4-Pro. O que se sabe é que o V4-Flash recebeu pós-treinamento focado em capacidades de agente, e o resultado desse ajuste supera o V4-Pro-Preview nos nove benchmarks.
Por que o modelo flash tem integrações que o Pro não tem?
A DeepSeek priorizou o V4-Flash para o lançamento do Codex e da Responses API porque o perfil de custo e latência do modelo flash se alinha melhor com cargas agenticas, que fazem chamadas frequentes em loop. O V4-Pro receberá suporte ao Codex no início de agosto de 2026, conforme a documentação oficial.
O que muda com a precificação por pico?
Os preços dobram nas faixas das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8). Para uma empresa em São Paulo (UTC-3), o pico de preço cai entre 22h e 1h e entre 3h e 7h da manhã, o que atenua o impacto. Para uma empresa na Europa, o pico cobre boa parte do expediente comercial.
O V4-Flash é o modelo certo para substituir o V4-Pro na minha aplicação?
Depende da carga. Se a aplicação usa agentes, chama ferramentas ou executa código, a resposta provavelmente é sim, e a recomendação é testar via Codex antes de alterar a rota. Se a aplicação depende de qualidade de escrita, formatação longa ou raciocínio matemático sem ferramentas, o V4-Pro permanece a escolha mais segura até que a DeepSeek publique benchmarks nessas categorias.
Referências e Leitura Complementar
Fontes primárias do evento:
- DeepSeek API Docs: Change Log, 2026-07-31. Changelog oficial com os nove benchmarks e notas técnicas da atualização.
- DeepSeek API Docs: Integrate with Codex. Documentação oficial da integração com Codex, incluindo script de configuração automática e parâmetros de conexão.
- DeepSeek API Docs: Models & Pricing. Tabela de preços vigente e anúncio do modelo peak/off-peak com as faixas horárias aplicáveis.
Para o comprador que decide com base em custo, não em score técnico:
- Benchmark de LLMs para CFOs: o que importa além do score técnico. Como ler benchmarks de modelo com lente de comprador, separando o que mexe no orçamento do que mexe no paper.
- Comparação de Custos de LLMs em 2026: Roteamento Inteligente com Nexforce Router. O custo como função da rota, não do modelo, a premissa que o V4-Flash acaba de validar com nove benchmarks.
Para a arquitetura de roteamento que transforma essa inversão em economia real:
- Model Router: o middleware que falta na sua stack de IA. Como uma camada de roteamento inverte a dependência de fornecedor único e transforma eventos de benchmark em decisões automáticas de rota.
- API Unificada para Modelos Multimodais: Gateway de LLMs em 2026. Arquitetura de gateway como superfície de controle de custo e capacidade, com a precificação horária como parâmetro de configuração.
O Cenário à Frente
A DeepSeek transformou uma regra de ouro do mercado de LLMs em exceção. O flash venceu o Pro-Preview em nove benchmarks de agente. E não foi por pouco: a vantagem veio com concorrência quintuplicada, suporte a ferramentas que o modelo mais caro ainda não tem, e um preço 3,1 vezes menor. Quem opera roteamento de modelos e não reposicionar o V4-Flash na hierarquia está pagando mais por menos capacidade, e a equação só piora quando o preço por pico entrar em vigor. Para o comprador do Nexforce Router, essa inversão reforça uma verdade que o produto explora desde o lançamento: a decisão de modelo é uma decisão de rota, ela muda com o benchmark, a carga e o relógio, e quem terceiriza essa lógica para uma tabela fixa de preços compra a resposta errada todos os dias.

Acelere a eficiênciaoperacional do seu negócio
Nós desenhamos a tecnologia do amanhã para impulsionar a escala do negócio
Falar com EspecialistaArtigos relacionados

Amazon bloqueia o agente Muse da Meta: quem responde pelo acesso
A Amazon cortou o agente Muse, da Meta, das compras em suas lojas por falta de fronteira de confiança acordada. O caso define quem responde pelo acesso de um agente ao sistema de outra empresa.
Read more
Salesforce Koa: o modelo de raciocínio de CRM que muda a rota
O Koa é o primeiro modelo de raciocínio de CRM da Salesforce, treinado sobre Nemotron e hospedado na própria fronteira de confiança. O roteamento de agentes ganha um eixo de decisão por fronteira de dados, além do preço por token.
Read more
OpenAI publica log de misalignment: modelos escondem erros no próprio resumo
OpenAI publica um framework de reporte e um log de desalinhamento com seis incidentes em que modelos esconderam erros, inventaram dados ou moveram arquivos sozinhos durante o treino.
Read more