Pular para conteúdo principal

DeepSeek V4-Flash: Modelo Flash Supera o Pro em Agentes

Camila Duarte
Camila DuarteAugust 4, 20265 min. de leitura
DeepSeek V4-Flash: Modelo Flash Supera o Pro em Agentes

O Que Mudou

A DeepSeek pôs o flash no topo. A atualização de 31 de julho alterou apenas o pós-treinamento focado em agente, mantendo a arquitetura da versão preview anterior. Nove benchmarks depois, o modelo mais barato supera o V4-Pro-Preview. O custo desabou. A capacidade subiu. O modelo que custa menos da metade agora é também o mais capaz para tarefas agenticas.

O Que Aconteceu

Em 31 de julho de 2026, a DeepSeek lançou a versão pública do V4-Flash-0731, substituindo o preview anterior. A atualização foi anunciada como uma mudança de pós-treinamento apenas: o changelog oficial da empresa afirma que a arquitetura e o tamanho do modelo são idênticos aos do V4-Flash-Preview, a versão anterior da mesma linha Flash. Nenhuma alteração estrutural. Só a calibração mudou. As comparações de benchmark no changelog são contra o V4-Pro-Preview, para simplificar a leitura, este artigo usa "V4-Pro" como abreviação desse modelo de referência.

O V4-Flash entregou nove resultados de benchmark de agente que a DeepSeek descreve como significativamente superiores aos do V4-Pro-Preview. Os números, extraídos do changelog de 31 de julho de 2026 na documentação oficial da API:

  • Terminal Bench 2.1: 82,7
  • NL2Repo: 54,2
  • Cybergym: 76,7

Esses três benchmarks cobrem o núcleo da interação de um agente com o ambiente: terminal, repositório e segurança ofensiva. São métricas de execução real, não de compreensão de texto.

  • DeepSWE: 54,4
  • Toolathlon verified: 70,3
  • Agent Last Exam: 25,2

Aqui o foco se desloca para engenharia de software ponta a ponta e uso de ferramentas. O DeepSWE é particularmente relevante para empresas que rodam agentes de código em produção.

  • Automation Bench (Public): 25,1
  • DSBench-FullStack (interno): 68,7
  • DSBench-Hard (interno): 59,6

Os dois últimos são benchmarks internos da DeepSeek, não auditáveis externamente, mas consistentes com o padrão dos sete benchmarks públicos. Nenhum desses nove exercícios é acadêmico: cada um reflete uma capacidade que um agente real consome diariamente.

Os testes foram executados com o DeepSeek Harness em modo minimal, nível máximo de esforço, top-p 0,95 e temperatura 1,0. A empresa não publicou os valores comparativos do V4-Pro-Preview para cada benchmark individual, mas a formulação do changelog é inequívoca: o resultado agregado do V4-Flash supera o do V4-Pro-Preview nas nove métricas.

Além dos números, o V4-Flash estreou duas capacidades ausentes no V4-Pro. A primeira é o suporte nativo ao formato Responses API, que habilita a integração direta com ferramentas de agente. A segunda é a compatibilidade com o Codex, o assistente de código da OpenAI, incluindo CLI, extensão para VS Code e aplicativo desktop. O V4-Pro só receberá suporte ao Codex no início de agosto de 2026, segundo a própria DeepSeek.

Por Que Isso Importa

A precificação conta a outra metade da história. O V4-Flash custa USD 0,14 por milhão de tokens de entrada com cache miss e USD 0,28 por milhão de tokens de saída. O V4-Pro custa USD 0,435 na entrada e USD 0,87 na saída. O flash é 3,1 vezes mais barato em ambos os eixos.

Para um fluxo de trabalho agentico típico, onde o modelo é chamado repetidamente em loop, cada chamada acumula tokens de entrada e saída. A diferença de custo não é linear: ela compõe. Um agente que consome 10 milhões de tokens de entrada e 5 milhões de saída por dia gasta USD 2,80 no V4-Flash e USD 8,70 no V4-Pro. A economia diária de USD 5,90 vira USD 2.153,50 por ano com um único fluxo.

O que torna esse número relevante é a inversão. Até agora, o padrão do mercado ditava que modelos flash sacrificavam capacidade por velocidade e custo. Eram a rota econômica da política de roteamento, acionada para tarefas simples: classificação, extração, geração de texto não estruturado. Quando a tarefa exigia raciocínio em várias etapas, chamadas de ferramenta ou execução de código, o roteador subia para o tier Pro.

O V4-Flash quebra essa lógica. O modelo mais barato é também o mais capaz para o caso de uso que mais consome tokens, tarefas agenticas. Um roteador configurado com a regra clássica "flash para tarefas simples, Pro para tarefas complexas" está hoje enviando o trabalho mais exigente para o modelo mais caro e potencialmente menos competente.

O dado de concorrência reforça a assimetria. O V4-Flash oferece 2.500 chamadas simultâneas contra 500 do V4-Pro. Para uma empresa que escala agentes horizontalmente, a margem de cinco vezes na concorrência significa que o modelo flash aceita cinco vezes mais trabalho paralelo antes de atingir o teto de rate limit. Combinado com o custo 3,1 vezes menor, o throughput por dólar é mais de quinze vezes superior em cargas paralelizáveis.

A DeepSeek sinalizou ainda um modelo de precificação por pico que entrará em vigor em breve: durante as faixas das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8), os preços dobram. Para um roteador empresarial que opera 24 horas, essa camada adicional de complexidade transforma a escolha do modelo em um problema de janela temporal: a rota mais barata fora do pico pode não ser a mesma do horário comercial chinês, e um sistema de roteamento sem suporte a precificação horária perderá dinheiro todos os dias.

O Que Muda na Prática

A atualização do V4-Flash reordena a hierarquia de roteamento para cargas agenticas: o modelo mais barato passa a ser a primeira opção para tarefas com ferramentas, e o V4-Pro recua para a posição de especialista em categorias onde os benchmarks ainda não falam. A tabela abaixo detalha cada dimensão da mudança.

inline-01.png
DimensãoAntes (V4-Flash Preview)Depois (V4-Flash-0731)
Posição na hierarquia de agentesAbaixo do V4-Pro para tarefas agenticasAcima do V4-Pro em 9 benchmarks de agente
Suporte a CodexAusenteNativo, com script de instalação automática
Suporte a Responses APIAusenteNativo, único modelo da família com suporte
Preço de entrada (cache miss)USD 0,14 por 1M tokensUSD 0,14 por 1M tokens (mantido)
Preço de saídaUSD 0,28 por 1M tokensUSD 0,28 por 1M tokens (mantido)
Arquitetura do modeloIgual ao V4-Flash-PreviewIgual ao V4-Flash-Preview (pós-treinamento apenas)
Concorrência máximaInformação não listada2.500 chamadas simultâneas
Janela de contexto1 milhão de tokens1 milhão de tokens (mantido)
Previsibilidade de custoPreço fixoSujeito a variação por pico (2× em horário comercial UTC+8)

A coluna que mais pesa para a decisão de roteamento é a primeira. O V4-Flash deixou de ser o modelo de contingência para ser o modelo de preferência em cargas agenticas. A única degradação relevante é a incerteza de custo introduzida pelo modelo de precificação por pico, que transforma o preço fixo atual em uma variável dependente do relógio. É uma variável que dobra.

O Que Fazer Agora

Quatro decisões que a atualização do V4-Flash coloca na mesa de quem opera roteamento de modelos. Nenhuma delas é opcional, a inação aqui não é neutra, é uma aposta de que o V4-Pro permanecerá superior em tarefas agenticas, e os nove benchmarks disponíveis dizem o contrário.

  1. Inverta a regra de roteamento para cargas agenticas. Se a política atual envia tarefas de agente para o V4-Pro e tarefas simples para o V4-Flash, a ordem está invertida. Roteie cargas agenticas para o V4-Flash e reserve o V4-Pro para situações onde o benchmark de agente não é o discriminante principal. O candidato mais óbvio é geração de texto longo com alta exigência estilística, mas até que a DeepSeek publique comparativos nessa categoria, a evidência disponível aponta o V4-Flash como a rota correta para qualquer carga que envolva ferramentas.

  2. Recalcule o custo anual dos fluxos agenticos. Multiplique o volume diário de tokens dos seus agentes pela diferença de preço entre V4-Flash e V4-Pro. Para um único fluxo de 10M tokens de entrada e 5M de saída por dia, a troca economiza mais de USD 2.000 por ano. Para uma empresa com dezenas de agentes em produção, o valor compra infraestrutura. Inclua no cálculo o efeito da concorrência cinco vezes maior: o teto de 500 chamadas simultâneas do V4-Pro pode forçar a compra de capacidade adicional em outro fornecedor, enquanto o V4-Flash com 2.500 chamadas absorve o pico.

  3. Prepare a camada de roteamento para precificação horária. O anúncio do modelo peak/off-peak da DeepSeek transforma o custo por token em uma função do horário de Pequim. Um roteador que não consulta a janela antes de selecionar o modelo pagará o dobro sem saber. Se o Nexforce Router estiver na stack, a regra de precificação horária é um parâmetro de configuração, não uma alteração de código.

  4. Teste o V4-Flash via Codex antes da decisão de compra. A integração com Codex CLI e VS Code permite rodar o V4-Flash como backend de código sem escrever uma única chamada de API. O script de configuração da DeepSeek automatiza o setup. Testar o desempenho real em um fluxo de desenvolvimento agentico gera dados mais úteis do que comparar scores de benchmark.

FAQ

Os nove benchmarks publicados cobrem exclusivamente tarefas agenticas, código, automação, ferramentas. A DeepSeek não divulgou comparativos para geração de texto longo, raciocínio matemático puro ou qualidade de prosa. Essas lacunas são o que as perguntas abaixo abordam, e a resposta honesta para várias delas é "ainda não se sabe."

O V4-Flash é melhor que o V4-Pro em tudo?

Não. Os nove benchmarks publicados cobrem exclusivamente tarefas de agente: código, automação, uso de ferramentas e engenharia de software full-stack. Para tarefas como geração de texto longo, raciocínio matemático puro ou qualidade de prosa, a DeepSeek não publicou comparativos, e o V4-Pro pode manter vantagem. O V4-Flash é superior em cargas agenticas, não universalmente.

O V4-Flash tem a mesma arquitetura que o V4-Pro?

O changelog oficial de 31 de julho de 2026 afirma que o V4-Flash-0731 mantém a mesma arquitetura e o mesmo tamanho do V4-Flash-Preview, a versão anterior da linha Flash. A DeepSeek não publicou informação sobre a relação arquitetural entre V4-Flash e V4-Pro. O que se sabe é que o V4-Flash recebeu pós-treinamento focado em capacidades de agente, e o resultado desse ajuste supera o V4-Pro-Preview nos nove benchmarks.

Por que o modelo flash tem integrações que o Pro não tem?

A DeepSeek priorizou o V4-Flash para o lançamento do Codex e da Responses API porque o perfil de custo e latência do modelo flash se alinha melhor com cargas agenticas, que fazem chamadas frequentes em loop. O V4-Pro receberá suporte ao Codex no início de agosto de 2026, conforme a documentação oficial.

O que muda com a precificação por pico?

Os preços dobram nas faixas das 9h às 12h e das 14h às 18h no horário de Pequim (UTC+8). Para uma empresa em São Paulo (UTC-3), o pico de preço cai entre 22h e 1h e entre 3h e 7h da manhã, o que atenua o impacto. Para uma empresa na Europa, o pico cobre boa parte do expediente comercial.

O V4-Flash é o modelo certo para substituir o V4-Pro na minha aplicação?

Depende da carga. Se a aplicação usa agentes, chama ferramentas ou executa código, a resposta provavelmente é sim, e a recomendação é testar via Codex antes de alterar a rota. Se a aplicação depende de qualidade de escrita, formatação longa ou raciocínio matemático sem ferramentas, o V4-Pro permanece a escolha mais segura até que a DeepSeek publique benchmarks nessas categorias.

Referências e Leitura Complementar

Fontes primárias do evento:

Para o comprador que decide com base em custo, não em score técnico:

Para a arquitetura de roteamento que transforma essa inversão em economia real:

O Cenário à Frente

A DeepSeek transformou uma regra de ouro do mercado de LLMs em exceção. O flash venceu o Pro-Preview em nove benchmarks de agente. E não foi por pouco: a vantagem veio com concorrência quintuplicada, suporte a ferramentas que o modelo mais caro ainda não tem, e um preço 3,1 vezes menor. Quem opera roteamento de modelos e não reposicionar o V4-Flash na hierarquia está pagando mais por menos capacidade, e a equação só piora quando o preço por pico entrar em vigor. Para o comprador do Nexforce Router, essa inversão reforça uma verdade que o produto explora desde o lançamento: a decisão de modelo é uma decisão de rota, ela muda com o benchmark, a carga e o relógio, e quem terceiriza essa lógica para uma tabela fixa de preços compra a resposta errada todos os dias.

Nexforce

Acelere a eficiênciaoperacional do seu negócio

Nós desenhamos a tecnologia do amanhã para impulsionar a escala do negócio

Falar com Especialista

Artigos relacionados