Ir al contenido principal

Gemini Agentic Video: hasta 88% menos tokens para analizar video largo

Camila Duarte
Camila Duarte2 de septiembre de 20269 min. de leitura
Gemini Agentic Video: hasta 88% menos tokens para analizar video largo

Google cambia la cuenta de tokens de quien analiza video largo

El 1 de septiembre de 2026, Google lanzó el entendimiento agéntico de video (agentic video understanding) en el Gemini API: en lugar de ingerir el video a una tasa fija de frames, el modelo decide, con propósito, qué volver a leer. Para quien paga por token, la implicación es única: el costo de analizar video largo deja de ser duración por un FPS fijo. Fuente primaria: el anuncio oficial de Google, con fecha 2026-09-01.

Qué pasó

Google anunció el agente de entendimiento de video (agentic video understanding) en el Gemini API el 1 de septiembre de 2026. La nueva capacidad está disponible hoy para Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite, mediante subidas de video y videos de YouTube, accesibles en Google AI Studio y en la Gemini Enterprise Agent Platform.

La activación se hace con un flag en la API: configurar processing como agentic. Sobre los precios, Google no cobra una tarifa extra por la función: se aplican los precios estándar de token del Gemini API. Es decir, el ahorro aparece en el volumen, no en una tabla separada.

Los números publicados por el propio Google, siempre comparados con el procesamiento estático a 1 FPS, son: hasta 88% menos tokens, hasta 66% menos costo de análisis y hasta 7% más precisión. Vale leer el "hasta": son ganancias medidas por Google en sus propias pruebas, no una promesa contratada por tarea.

El mecanismo explica el motivo de la ganancia. En lugar de leer cada cuadro a la misma tasa, el modelo elige de forma dinámica qué ventanas de frames observar, y hasta puede remuestrear una ventana a un FPS mayor cuando un tramo de movimiento rápido discrimina la respuesta. Cuando el audio carga con la decisión, trae el audio. En video largo, puede primero barrer la transcripción para localizar dónde está la respuesta y solo entonces volver al tramo correcto.

Los casos que menciona Google pasan por recuperación de momentos en fracciones de segundo, búsqueda de aguja en el pajar en grabaciones de varias horas, inspección de movimiento rápido y conteo de acciones y objetos. Esta no es la salida del modelo Gemini 3.7 Flash, que llegó en agosto: es una capacidad nueva aplicada sobre los Flash que ya existían, y el significado aquí es ahorro de tokens en una clase de carga.

Por qué importa

Para el CTO y el CFO que pagan por token el análisis de una clase de 90 minutos, de una grabación de reunión, de cámaras de seguridad o de un tutorial de 10 minutos, el cambio no es de modelo: es de cómo se compone el costo de la tarea. En el régimen estático a 1 FPS, el gasto es predecible: duración multiplicada por una tasa fija de frames. Cada minuto equivale a un número fijo de frames y, por tanto, de tokens. El costo por tarea es la suma de todos los frames.

Con el flag agentic, la ecuación cambia. El costo pasa a ser proporcional a lo que el modelo decide volver a leer, no a toda la duración. Un video de varias horas puede costar lo mismo que leer unas pocas ventanas relevantes, o incluso menos, porque la mayor parte del flujo nunca se tokeniza en detalle. Del otro lado, un tramo de movimiento rápido puede costar más que la tasa fija, porque vale la pena remuestrear a un FPS mayor para no equivocarse en la respuesta.

Esto crea un problema contable real para quien depende de un gateway. Quien fija el precio de cada token de entrada en una sola línea, como si el video fuera texto en serie, miente sobre el costo real de la tarea. La tabla de precio por millón describe la entrada que pasa por el gateway, no el trabajo que el modelo decidió hacer. En video largo, esa tabla empieza a describir menos de aquello que el CFO realmente firma.

Por eso el enrutamiento importa cada vez más. Google resolvió un problema de ingesta dentro del modelo, pero la decisión de cómo entra esa clase de carga en la cuenta sigue estando en la capa que queda entre tu aplicación y los proveedores. El ahorro de 88% solo aparece en la factura si la petición llega configurada y medida de la forma correcta. Eso es lo que diferencia "gestionar modelos" de "gestionar el costo de las tareas".

Qué cambia en la práctica

En el régimen estático a 1 FPS, cada segundo de video se vuelve un número fijo de frames y un costo proporcional al tiempo. En el agéntico, el costo depende de las ventanas que el modelo efectivamente vuelve a leer, lo que baja la factura justamente donde la ganancia es mayor: video largo, donde la mayor parte del flujo no necesita leerse en detalle.

inline-01.png

La comparación de abajo resume los dos regímenes no como un benchmark exacto, sino como la dirección de lo que cambia:

Carga de videoRégimen 1 FPS estáticoRégimen agentic
Guía de 10 min~600 frames de tokens fijos; costo proporcional a la duraciónSolo las ventanas relevantes; remuestrea donde el detalle discrimina
Clase de 90 min~5.400 frames fijos; factura alta incluso sin necesidadBarre la transcripción, localiza la respuesta y relee solo el tramo correcto
Grabación multi-horaFactura alta o pérdida de detalle, en la elección entre costo y precisiónRelectura objetiva guiada por la pregunta
Precisión (medida Google)Línea base a 1 FPSHasta 7% más precisión y hasta 66% menos costo

Donde se concentra la ganancia es en el video largo en el que la tasa fija forzaba una elección incómoda: pagar caro para leer todo en detalle, o ahorrar y perder justamente el tramo de la respuesta. Para guías de 10 minutos el efecto existe, pero es en clases, reuniones, cámaras y grabaciones largas donde el agéntico cambia el costo de una clase completa de carga.

La lectura honesta es que el agéntico empuja la decisión de gasto del volumen a la tarea. En el estático, sabes cuánto vas a gastar antes de ejecutar. En el agéntico, el costo depende de la pregunta y del video, lo cual es mejor para la cuenta, pero exige un nivel distinto de visibilidad sobre lo que cada llamada consumió de verdad.

Qué hacer ahora

No hace falta esperar a que tu pila de modelos se reorganice para aprovechar el cambio. El camino práctico es corto y comienza con la medición:

  1. Mide tokens con y sin agentic en una carga representativa de video largo antes de cambiar cualquier configuración de producción, porque el 88% y el 66% son de Google, no tuyos.
  2. Clasifica tus cargas de video por riesgo de relectura: la clase larga y el tutorial tienden a ganar frente al video donde cada cuadro ya era necesario.
  3. Revisa el techo de gasto que tu gateway asume para video, ya que la línea de costo por token ya no refleja la clase de carga por sí sola.
  4. No fijes el precio del video largo como si fuera texto en serie: si la capa de enrutamiento cobra cada frame como entrada, está cobrando un trabajo que el modelo ya no hace en el agéntico.
  5. Valida el delta de precisión en tus propios clips, porque el 7% del anuncio depende de la naturaleza de tu análisis; mide antes de confiar en la ganancia.

Preguntas frecuentes

¿Es la salida del Gemini 3.7 Flash? No. El modelo Gemini 3.7 Flash se anunció en agosto de 2026. El evento de hoy es la capacidad agentic video understanding aplicada sobre los Flash que ya existían (3.7 Flash, 3.6 Flash y 3.5 Flash-Lite), sin reabrir el lanzamiento del modelo en sí.

¿El agentic cuesta más caro por token? Según lo que anunció Google, no. La activación usa los precios estándar de token del Gemini API, sin tarifa extra por la función. El ahorro viene del volumen menor de tokens, no de una tabla separada.

¿Los números de 88%, 66% y 7% valen para mi caso? Son medidas publicadas por Google, que comparan el modo agéntico con el estático a 1 FPS en sus propias pruebas. La ganancia real de tu carga depende del tipo de video y de respuesta, así que el camino es medir con y sin el flag en tus propios clips antes de asumir el valor en la factura.

¿Cómo activo la capacidad? Configurando processing como agentic en la llamada al Gemini API. La disponibilidad ya está abierta hoy para subidas de video y videos de YouTube, vía Google AI Studio y la Gemini Enterprise Agent Platform.

¿La capa de enrutamiento sigue siendo relevante si el modelo ahorra por sí solo? El ahorro de tokens ocurre dentro del modelo, pero la forma en que la tarea entra en la cuenta de quien paga sigue decidiéndose en la capa de enrutamiento, que ve el costo real por tarea cuando el mismo Flash consume 88% menos tokens con un solo flag. Medir y enrutar por costo de tarea es lo que convierte la función en ahorro de caja, no de marketing.

Referencias y lectura complementaria

  • Anuncio oficial de Google: Introducing agentic video understanding with Gemini (fuente primaria, publicada el 1 de septiembre de 2026). Es de esta página de donde vienen los hechos, los 3 modelos, el flag agentic, la disponibilidad y los números de 88%, 66% y 7%. Accedida el 1 de septiembre de 2026.
  • AlphaSignal (canal de descubrimiento, 2026-09-01): la newsletter que señaló el hecho. No es la cita de los datos, que están en la fuente primaria de Google.
  • Lectura complementaria en el blog de Nexforce: enrutamiento por costo de tarea y contabilidad de tokens por clase de carga.

Qué esperar en las próximas semanas

Es razonable esperar que el agéntico de video se vuelva el estándar en las cuentas de quien necesita análisis útil de grabaciones largas, no solo por precisión, sino por pura aritmética: cuando un flag baja el 88% de la entrada en una clase de carga, cada proveedor tiene el incentivo de seguir el mismo camino, y cada equipo de medios tiene el incentivo de medir la diferencia.

El punto de atención para las próximas semanas es contable, no de modelo. El ahorro solo aparece en la factura si la comprensión de lo que se tokenizó es precisa, y es la capa de enrutamiento la que lo ve por tarea. Cuando el mismo Flash pasa de una línea estática de frames a ventanas remuestreadas, el Nexforce Router lo trata como una decisión de enrutamiento por el costo completo de la tarea, y no como un precio más por millón en la misma tabla: una API, decenas de modelos, elección por el costo real de lo que necesitas responder.

Mientras el mercado descubre cómo fijar el precio del trabajo que el modelo decide hacer, el movimiento más barato es simple: no tratar todo video como texto en serie, medir con y sin agentic y dejar que el flag trabaje a favor de quien paga la cuenta.

Nexforce

Acelera la eficienciaoperativa de tu negocio

Diseñamos tecnología de nivel global para impulsar escala del negocio

Hablar con un Especialista

Artículos relacionados