Ir al contenido principal

DeepSeek V4-Flash: El Modelo Flash Supera al Pro en Agentes

Camila Duarte
Camila DuarteAugust 4, 20265 min. de leitura
DeepSeek V4-Flash: El Modelo Flash Supera al Pro en Agentes

Qué Cambió

DeepSeek puso al modelo flash en la cima. La actualización del 31 de julio modificó únicamente el post-entrenamiento enfocado en agente, manteniendo la arquitectura de la versión preview anterior. En nueve benchmarks, el modelo más barato supera al V4-Pro-Preview. El costo se desplomó. La capacidad subió. El modelo que cuesta menos de la mitad es ahora también el más capaz para cargas de trabajo agentivas.

Qué Ocurrió

El 31 de julio de 2026, DeepSeek lanzó la versión pública de V4-Flash-0731, reemplazando el preview anterior. La actualización fue anunciada como un cambio de post-entrenamiento únicamente: el changelog oficial de la empresa afirma que la arquitectura y el tamaño del modelo son idénticos a los de V4-Flash-Preview, la versión anterior de la misma línea Flash. Ningún cambio estructural. Solo la calibración cambió. Las comparaciones de benchmark en el changelog son contra V4-Pro-Preview; para simplificar la lectura, este artículo usa "V4-Pro" como abreviatura de ese modelo de referencia.

V4-Flash entregó nueve resultados de benchmark de agente que DeepSeek describe como significativamente superiores a los de V4-Pro-Preview. Las cifras, extraídas del changelog del 31 de julio de 2026 en la documentación oficial de la API:

  • Terminal Bench 2.1: 82,7
  • NL2Repo: 54,2
  • Cybergym: 76,7

Estos tres benchmarks cubren el núcleo de la interacción de un agente con el entorno: terminal, repositorio y seguridad ofensiva. Son métricas de ejecución real, no de comprensión de texto.

  • DeepSWE: 54,4
  • Toolathlon verified: 70,3
  • Agent Last Exam: 25,2

Aquí el foco se desplaza hacia la ingeniería de software de punta a punta y el uso de herramientas. DeepSWE es particularmente relevante para empresas que ejecutan agentes de código en producción.

  • Automation Bench (Public): 25,1
  • DSBench-FullStack (interno): 68,7
  • DSBench-Hard (interno): 59,6

Los dos últimos son benchmarks internos de DeepSeek, no auditables externamente, pero consistentes con el patrón de los siete benchmarks públicos. Ninguno de estos nueve ejercicios es académico: cada uno refleja una capacidad que un agente real consume a diario.

Las pruebas se ejecutaron con DeepSeek Harness en modo minimal, nivel máximo de esfuerzo, top-p 0,95 y temperatura 1,0. La empresa no publicó los valores comparativos del V4-Pro-Preview para cada benchmark individual, pero la formulación del changelog es inequívoca: el resultado agregado de V4-Flash supera al de V4-Pro-Preview en las nueve métricas.

Más allá de los números, V4-Flash estrenó dos capacidades ausentes en V4-Pro. La primera es el soporte nativo al formato Responses API, que habilita la integración directa con herramientas de agente. La segunda es la compatibilidad con Codex, el asistente de código de OpenAI, incluyendo CLI, extensión para VS Code y aplicación de escritorio. V4-Pro solo recibirá soporte para Codex a principios de agosto de 2026, según la propia DeepSeek.

Por Qué Importa

La fijación de precios cuenta la otra mitad de la historia. V4-Flash cuesta USD 0,14 por millón de tokens de entrada con cache miss y USD 0,28 por millón de tokens de salida. V4-Pro cuesta USD 0,435 en entrada y USD 0,87 en salida. El modelo flash es 3,1 veces más barato en ambos ejes.

Para un flujo de trabajo agentivo típico, donde el modelo se llama repetidamente en bucle, cada llamada acumula tokens de entrada y salida. La diferencia de costo no es lineal: compone. Un agente que consume 10 millones de tokens de entrada y 5 millones de salida por día gasta USD 2,80 en V4-Flash y USD 8,70 en V4-Pro. El ahorro diario de USD 5,90 se convierte en USD 2.153,50 al año con un único flujo.

Lo que vuelve relevante esta cifra es la inversión. Hasta ahora, el estándar del mercado dictaba que los modelos flash sacrificaban capacidad por velocidad y costo. Eran la ruta económica de la política de enrutamiento, activada para tareas simples: clasificación, extracción, generación de texto no estructurado. Cuando la tarea exigía razonamiento en múltiples pasos, llamadas a herramientas o ejecución de código, el enrutador subía al tier Pro.

V4-Flash rompe esa lógica. El modelo más barato es también el más capaz para el caso de uso que más tokens consume: las tareas agentivas. Un enrutador configurado con la regla clásica "flash para tareas simples, Pro para tareas complejas" está hoy enviando el trabajo más exigente al modelo más caro y potencialmente menos competente.

El dato de competencia refuerza la asimetría. V4-Flash ofrece 2.500 llamadas simultáneas contra 500 de V4-Pro. Para una empresa que escala agentes horizontalmente, el margen de cinco veces en concurrencia significa que el modelo flash acepta cinco veces más trabajo paralelo antes de alcanzar el techo de rate limit. Combinado con el costo 3,1 veces menor, el throughput por dólar es más de quince veces superior en cargas paralelizables.

DeepSeek también señaló un modelo de fijación de precios por pico que entrará en vigor próximamente: durante las franjas de 9 a 12 y de 14 a 18 en horario de Pekín (UTC+8), los precios se duplican. Para un enrutador empresarial que opera 24 horas, esta capa adicional de complejidad convierte la elección del modelo en un problema de ventana temporal: la ruta más barata fuera del pico puede no ser la misma que durante el horario comercial chino, y un sistema de enrutamiento sin soporte a precios horarios perderá dinero todos los días.

Qué Cambia en la Práctica

La actualización de V4-Flash reordena la jerarquía de enrutamiento para cargas agentivas: el modelo más barato pasa a ser la primera opción para tareas con herramientas, y V4-Pro retrocede a la posición de especialista en categorías donde los benchmarks todavía no hablan. La tabla a continuación detalla cada dimensión del cambio.

inline-01.png
DimensiónAntes (V4-Flash Preview)Después (V4-Flash-0731)
Posición en la jerarquía de agentesPor debajo de V4-Pro para tareas agentivasPor encima de V4-Pro en 9 benchmarks de agente
Soporte a CodexAusenteNativo, con script de instalación automática
Soporte a Responses APIAusenteNativo, único modelo de la familia con soporte
Precio de entrada (cache miss)USD 0,14 por 1M tokensUSD 0,14 por 1M tokens (mantenido)
Precio de salidaUSD 0,28 por 1M tokensUSD 0,28 por 1M tokens (mantenido)
Arquitectura del modeloIgual a V4-Flash-PreviewIgual a V4-Flash-Preview (solo post-entrenamiento)
Concurrencia máximaInformación no listada2.500 llamadas simultáneas
Ventana de contexto1 millón de tokens1 millón de tokens (mantenido)
Previsibilidad de costoPrecio fijoSujeto a variación por pico (2× en horario comercial UTC+8)

La columna que más pesa para la decisión de enrutamiento es la primera. V4-Flash dejó de ser el modelo de contingencia para ser el modelo de preferencia en cargas agentivas. La única degradación relevante es la incertidumbre de costo introducida por el modelo de precios por pico, que convierte el precio fijo actual en una variable dependiente del reloj. Es una variable que se duplica.

Qué Hacer Ahora

Cuatro decisiones que la actualización de V4-Flash coloca sobre la mesa de quien opera enrutamiento de modelos. Ninguna es opcional. La inacción aquí no es neutral: es una apuesta a que V4-Pro permanecerá superior en tareas agentivas, y los nueve benchmarks disponibles dicen lo contrario.

  1. Invierta la regla de enrutamiento para cargas agentivas. Si la política actual envía tareas de agente a V4-Pro y tareas simples a V4-Flash, el orden está invertido. Enrute cargas agentivas hacia V4-Flash y reserve V4-Pro para situaciones donde el benchmark de agente no es el discriminante principal. El candidato más obvio es la generación de texto largo con alta exigencia estilística, pero hasta que DeepSeek publique comparativos en esa categoría, la evidencia disponible apunta a V4-Flash como la ruta correcta para cualquier carga que involucre herramientas.

  2. Recalcule el costo anual de los flujos agentivos. Multiplique el volumen diario de tokens de sus agentes por la diferencia de precio entre V4-Flash y V4-Pro. Para un único flujo de 10M tokens de entrada y 5M de salida por día, el cambio ahorra más de USD 2.000 por año. Para una empresa con decenas de agentes en producción, el ahorro compra infraestructura. Incluya en el cálculo el efecto de la concurrencia cinco veces mayor: el techo de 500 llamadas simultáneas de V4-Pro puede forzar la compra de capacidad adicional en otro proveedor, mientras que V4-Flash con 2.500 llamadas absorbe el pico.

  3. Prepare la capa de enrutamiento para precios horarios. El anuncio del modelo peak/off-peak de DeepSeek convierte el costo por token en una función del horario de Pekín. Un enrutador que no consulta la ventana antes de seleccionar el modelo pagará el doble sin saberlo. Si el Nexforce Router está en la stack, las reglas de precio horario son un parámetro de configuración, no un cambio de código.

  4. Pruebe V4-Flash vía Codex antes de la decisión de compra. La integración con Codex CLI y VS Code permite ejecutar V4-Flash como backend de código sin escribir una sola llamada de API. El script de configuración de DeepSeek automatiza el setup. Probar el rendimiento real en un flujo de desarrollo agentivo genera datos más útiles que comparar scores de benchmark.

FAQ

Los nueve benchmarks publicados cubren exclusivamente tareas agentivas: código, automatización y herramientas. DeepSeek no divulgó comparativos para generación de texto largo, razonamiento matemático puro o calidad de prosa. Esas lagunas son lo que las preguntas a continuación abordan, y la respuesta honesta para varias de ellas es "todavía no se sabe."

¿V4-Flash es mejor que V4-Pro en todo?

No. Los nueve benchmarks publicados cubren exclusivamente tareas de agente: código, automatización, uso de herramientas e ingeniería de software full-stack. Para tareas como generación de texto largo, razonamiento matemático puro o calidad de prosa, DeepSeek no ha publicado comparativos, y V4-Pro puede mantener ventaja. V4-Flash es superior en cargas agentivas, no universalmente.

¿V4-Flash tiene la misma arquitectura que V4-Pro?

El changelog oficial del 31 de julio de 2026 afirma que V4-Flash-0731 mantiene la misma arquitectura y el mismo tamaño que V4-Flash-Preview, la versión anterior de la línea Flash. DeepSeek no ha publicado información sobre la relación arquitectural entre V4-Flash y V4-Pro. Lo que se sabe es que V4-Flash recibió post-entrenamiento enfocado en capacidades de agente, y el resultado de ese ajuste supera a V4-Pro-Preview en los nueve benchmarks.

¿Por qué el modelo flash tiene integraciones que el Pro no tiene?

DeepSeek priorizó V4-Flash para el lanzamiento de Codex y Responses API porque el perfil de costo y latencia del modelo flash se alinea mejor con cargas agentivas, que realizan llamadas frecuentes en bucle. V4-Pro recibirá soporte para Codex a principios de agosto de 2026, según la documentación oficial.

¿Qué cambia con la fijación de precios por pico?

Los precios se duplican en las franjas de 9 a 12 y de 14 a 18 en horario de Pekín (UTC+8). Para una empresa en Ciudad de México (UTC-6), el pico de precio cae entre 19 y 22 horas y entre 00 y 4 de la madrugada, lo que atenúa el impacto. Para una empresa en Buenos Aires (UTC-3), el pico nocturno cubre parte de la madrugada pero no el horario comercial.

¿V4-Flash es el modelo adecuado para reemplazar a V4-Pro en mi aplicación?

Depende de la carga. Si la aplicación usa agentes, llama herramientas o ejecuta código, la respuesta probablemente es sí, y la recomendación es probar vía Codex antes de alterar la ruta. Si la aplicación depende de calidad de escritura, formato largo o razonamiento matemático sin herramientas, V4-Pro sigue siendo la elección más segura hasta que DeepSeek publique benchmarks en esas categorías.

Referencias y Lectura Complementaria

Fuentes primarias del evento:

Para el comprador que decide con base en costo, no en score técnico:

Para la arquitectura de enrutamiento que convierte esta inversión en ahorro real:

El Panorama por Delante

DeepSeek convirtió una regla de oro del mercado de LLMs en excepción. El modelo flash venció al Pro-Preview en nueve benchmarks de agente. Y no fue por poco: la ventaja vino con concurrencia quintuplicada, soporte a herramientas que el modelo más caro aún no tiene, y un precio 3,1 veces menor. Quien opera enrutamiento de modelos y no reposicione V4-Flash en la jerarquía está pagando más por menos capacidad, y la ecuación solo empeora cuando el precio por pico entre en vigor. Para el comprador del Nexforce Router, esta inversión refuerza una verdad que el producto explota desde su lanzamiento: la decisión de modelo es una decisión de ruta. Cambia con el benchmark, la carga y el reloj, y quien terceriza esa lógica a una tabla fija de precios compra la respuesta equivocada todos los días.

Nexforce

Acelera la eficienciaoperativa de tu negocio

Diseñamos tecnología de nivel global para impulsar escala del negocio

Hablar con un Especialista

Artículos relacionados