Ir al contenido principal

Enrutamiento de LLM: qué hacer si cambia el precio del token

Rafael Torres
Rafael Torres11 de septiembre de 20265 min. de leitura
Enrutamiento de LLM: qué hacer si cambia el precio del token

Cuando cambia el precio del token, el costo de una ruta fija de LLM cambia con él, sin aviso. El procedimiento: releer la tabla de precios con fecha de lectura, recalcular el costo de la ruta fija con el perfil de consumo real, comparar con la alternativa enrutada y fijar la cadencia de reevaluación.

El aviso viene de los datos. Entre las lecturas del 17 de agosto y el 7 de septiembre de 2026 en Artificial Analysis, el GPT-5.6 Sol, modelo top de línea, recortó el precio de entrada en 20% y el de salida en 33%. En el mismo intervalo de 21 días, el DeepSeek V4 Flash 0731, categoría económica, subió 214% en la entrada y 371% en la salida. Misma ventana, direcciones opuestas.

La premisa que se rompe es operacional: la tabla de precios de modelos de IA dejó de ser un insumo anual y pasó a ser un insumo que se mueve dentro del mes. Esta guía ejecuta la re-decisión en cinco pasos, con esos dos modelos como ejemplo corrido, y muestra dónde el middleware del stack de IA a escala absorbe el movimiento sin renegociar contrato y sin reintegrar código.

El recorrido completo:

  1. Fijar el perfil de consumo por modelo, separando entrada y salida.
  2. Leer la tabla de precios con la fecha de lectura anotada.
  3. Recalcular el costo de la ruta fija con el perfil real.
  4. Comparar ruta fija contra ruta enrutada.
  5. Fijar la cadencia de reevaluación y la regla de re-decisión.

Lo que necesitas antes de redecidir la ruta

La re-decisión de ruta es una cuenta con tres insumos. El porcentaje, sin perfil, es abstracción. Sin fecha de lectura, la comparación entre tablas no es válida. Sin la política de ruta actual, no existe línea de base para medir el efecto del cambio. Nada de eso exige una herramienta nueva, y ningún paso depende del proveedor del modelo.

Tres elementos, en este orden:

  1. Perfil de consumo por modelo. Millones de tokens de entrada y de salida por mes, separados por modelo, leídos del rastro de llamadas o de la factura. Si el gateway etiqueta cada llamada por clave o por proyecto, la separación ya está hecha; si no, la factura del proveedor la trae por modelo. Un total agregado sirve para contabilidad, no para decidir una ruta.
  2. Tabla de precios con fecha de lectura. Precio de entrada y de salida por millón de tokens, el tier contratado, la fuente y el día de la lectura anotados junto al número, porque un precio sin fecha no es un dato, es un recuerdo.
  3. Política de ruta actual. Qué modelo atiende qué carga hoy y bajo qué regla, para que la comparación del Paso 4 tenga línea de base.

Paso 1: Fijar el perfil de consumo por modelo

El perfil de consumo convierte el porcentaje en dinero: millones de tokens de entrada y de salida por modelo, por mes, leídos del rastro de llamadas. Con él, la re-precificación del modelo top se vuelve US$400 al mes en la ruta, US$300 de la salida y US$100 de la entrada, y la del modelo económico se vuelve US$61,20, US$31,20 de la salida y US$30 de la entrada, en el ejemplo del Paso 3. Sin perfil, el porcentaje es ruido.

El perfil vive en el rastro de auditoría de las llamadas del gateway, en los reportes de consumo del proveedor o en la planilla del equipo de datos. La separación entre entrada y salida es invariante, porque los dos tienen precios distintos y, en esta ventana, movimientos distintos: la salida cargó con el recorte de 33% del modelo top y con la suba de 371% del modelo económico, entre las lecturas de 2026-08-17 y 2026-09-07 de Artificial Analysis.

La composición de la carga también entra. Extracción de datos estructurados y resumen de documentos son cargas pesadas en entrada. Generación de reportes y de código es salida pesada. Dos cargas con el mismo total de tokens pagan cuentas distintas, y el perfil es lo que muestra cuál es la tuya.

Paso 2: Leer la tabla de precios con fecha de lectura

La tabla de precios de modelos de IA es un documento que se mueve, así que la lectura vale por el día en que se hizo. Anota precio de entrada y de salida por millón de tokens, el tier contratado, la fuente y la fecha. Dos lecturas separadas por 21 días bastaron para mover los dos modelos en direcciones opuestas.

El tier importa tanto como el precio: la tabla lista precios por volumen, y el recálculo del Paso 3 vale lo que vale el tier que tu consumo realmente alcanza. Una lectura tomada en el tier equivocado envenena la cuenta entera, con todos los números correctos por fuera.

Las dos lecturas de esta guía:

ModeloEntrada / salida en la lectura de 2026-08-17Entrada / salida en la lectura de 2026-09-07Delta de entradaDelta de salida
GPT-5.6 SolUS$5,00 / US$30,00US$4,00 / US$20,00-20%-33%
DeepSeek V4 Flash 0731US$0,14 / US$0,28US$0,44 / US$1,32+214%+371%

Valores por millón de tokens, en el tier máximo listado en cada fecha. Fuente: Artificial Analysis, lecturas de 2026-08-17 y 2026-09-07.

La lectura corriente es que el precio de un modelo de IA solo baja. Esta ventana es la refutación con dos números fechados: el modelo top recortó precio mientras el modelo económico subía, dentro de 21 días.

Tendencia de fondo no es operación.

La misma ventana trajo un segundo movimiento, de marcador y no de precio: Artificial Analysis re-baseó el Intelligence Index a la versión 4.2 el 4 de septiembre de 2026. Score y precio son lecturas separadas; la re-decisión por score está en el artículo sobre el re-base del ranking de inteligencia, y esta guía se queda en la tabla de precios.

En producción, la lectura fechada es el insumo que alimenta la política de enrutamiento; el pilar del model router muestra cómo la capa transforma lectura en regla.

Paso 3: Recalcular el costo por token de la ruta fija

El recálculo multiplica el perfil de consumo por los precios fechados, dos veces: una con la tabla vieja, otra con la tabla nueva. La diferencia es cuánto cambió de costo la ruta fija sin ninguna decisión tuya. El ejemplo de abajo usa el perfil ilustrativo de 100 millones de tokens de entrada y 30 millones de salida al mes.

GPT-5.6 Sol, tabla de 2026-08-17: 100 millones de entrada × US$5,00 = US$500; 30 millones de salida × US$30,00 = US$900. Total: US$1.400 al mes.

GPT-5.6 Sol, tabla de 2026-09-07: entrada a US$4,00 y salida a US$20,00 cierran la misma ruta en US$1.000 al mes: US$400 menos, una caída de 28,6% en la factura, un porcentaje que no está en la tabla: el efecto combinado del recorte de 20% en la entrada con el de 33% en la salida.

DeepSeek V4 Flash 0731, tabla de 2026-08-17: 100 millones de entrada × US$0,14 = US$14; 30 millones de salida × US$0,28 = US$8,40. Total: US$22,40.

DeepSeek V4 Flash 0731, tabla de 2026-09-07: entrada a US$0,44 y salida a US$1,32 cierran la misma ruta en US$83,60 al mes: US$61,20 más, un aumento de 273% en la factura.

Ruta fija (100M de entrada + 30M de salida al mes)Costo con tabla de 2026-08-17Costo con tabla de 2026-09-07Delta mensual
GPT-5.6 SolUS$1.400,00US$1.000,00-US$400,00 (-28,6%)
DeepSeek V4 Flash 0731US$22,40US$83,60+US$61,20 (+273%)

Fuente de los precios: Artificial Analysis, lecturas de 2026-08-17 y 2026-09-07. Perfil: ilustrativo.

Ruta fija re-precificada

La cuenta expone el error que esta guía combate. La re-precificación del modelo top se vuelve US$400 al mes en la ruta, US$300 de la salida y US$100 de la entrada, y la del modelo económico se vuelve US$61,20, US$31,20 de la salida y US$30 de la entrada: el porcentaje mayor pertenece a la cuenta menor. La tabla no avisa. El colapso del precio del token sigue siendo real y de largo plazo, pero dentro de tres semanas la dirección que importa es la de tu perfil, y esta no sigue la tendencia del mercado.

Paso 4: Comparar la ruta fija con la ruta enrutada

La comparación transforma el recálculo en decisión. La ruta fija cuesta lo que dice la tabla nueva, y el costo vence a cada cambio de precio. La ruta enrutada terceriza la re-decisión a una capa que reevalúa modelos por precio y desempeño en tiempo real. Lo que te queda es gobernanza, no la lectura de la tabla.

CriterioRuta fijaRuta enrutada
Quién lee la tabla de preciosTu equipo, a cada cambioLa capa de enrutamiento, continuamente
Intervalo hasta el ajuste de costoDías a semanas, el ciclo humano de re-decisiónEl tiempo de una reevaluación de modelo
Failover cuando un modelo caeManual, con reintegraciónAutomático, con fallback configurable
Cambio de modeloReintegración en el códigoCambio de variable de endpoint, sin reintegración
Gobernanza de gastoFactura y planillaTecho por clave, agente o proyecto, consumo en tiempo real

La tabla compara categorías, y merece una lectura honesta. La ruta enrutada no decide sola qué tarea tolera el modelo económico: la política es tuya, con reglas por clave y techos de gasto. La capa ejecuta. Donde la calidad exige el modelo top, la regla fija esa ruta y el enrutamiento respeta la regla, porque el default por costo es la decisión equivocada justamente donde latencia o calidad son restricciones duras. La política de enrutamiento en producción existe para marcar esas rutas antes de que el costo las decida.

La elección de ruta parece decisión de ingeniería y se toma como tal, en el código; al cierre del mes aparece en la factura como decisión de margen.

El Nexforce Router es esa capa: un gateway de LLM con más de 300 modelos detrás de una única API compatible con OpenAI, enrutamiento inteligente por costo, desempeño, latencia y contexto, ranking de modelos en tiempo real por precio y desempeño, failover automático con fallback configurable y cambio de modelo sin reintegración. Nexforce declara un ahorro de hasta 50% en el costo por token, número declarado por la propia empresa como techo de posicionamiento, no como resultado verificado: la cuenta de tu ruta, hecha en el Paso 3, es la que decide.

Antes de mover la ruta, el mismo prompt corre en paralelo en los modelos candidatos, y la decisión sale de un resultado medido, no de un palpite. Si el objetivo es recortar la factura antes de mover la arquitectura, el procedimiento para reducir costos de inferencia cubre ese terreno; este paso decide quién absorbe el movimiento de la tabla. El argumento económico estático del enrutamiento ya quedó defendido en el artículo sobre el costo de los modelos de IA; la comparación de arriba agrega el tiempo: la ruta fija re-precifica cuando la tabla cambia, y la enrutada re-decide. La regla del benchmark de LLMs para CFOs, costo antes de score, se aplica línea por línea: la tabla de precios es la materia prima de esa regla.

Paso 5: Fijar la cadencia y la regla de re-decisión

La cadencia es lo que impide que la ruta fija venza otra vez en silencio. Fija tres cosas: la frecuencia de lectura de la tabla, el umbral de variación que obliga a recalcular y la regla que decide entre mantener la ruta fija y migrar a la ruta enrutada. Una ventana de 21 días bastó para mover precios en 33% y 371%.

Frecuencia: lectura fechada de la tabla de precios una vez por mes, con el historial guardado. Comparar la tabla de hoy con la de hace seis meses, sin las intermedias, esconde el momento exacto en que la ruta venció; el historial lo muestra.

Umbral: 10% de variación en el costo mensual de la ruta fija obliga a recalcular. Por debajo de eso, ruido. El cambio de precio de un modelo de IA es recurrente, y el gatillo es el costo mensual, no el porcentaje de la tabla: la ventana de esta guía mostró 371% costando menos, en dólares, que 28,6%.

Regla: ruta con exigencia firme de calidad o latencia queda en ruta fija monitoreada; volumen sin política de calidad migra a la ruta enrutada. Ninguna de las tres cosas exige renegociar contrato ni reintegrar código. Con la capa de enrutamiento a escala en su lugar, la re-decisión se vuelve política en el gateway, y la tabla de precios vuelve a ser insumo, no evento.

Flujo de re-decisión de ruta

Cómo confirmar que la decisión valió la pena

Verificar es comparar el costo efectivo por token antes y después, en el mismo perfil de consumo, con el rastro de cada llamada. Sin rastro por llamada, la comparación es opinión. Con rastro, el costo por token efectivo de la ruta aparece al mes siguiente, y la decisión de ruta se vuelve un número auditable.

El Nexforce Router entrega el rastro que la verificación pide: cada llamada auditable, observabilidad central con logs, métricas y dashboards, y analytics de ahorro y desempeño por modelo. Tres números cierran la verificación. El costo por token efectivo del mes, dividiendo la factura por el total de tokens servidos. La porción de llamadas que cayó en el fallback, que revela cuántas veces el modelo principal de la ruta quedó indisponible y cuántas veces el fallback sostuvo la operación sin que nadie abriera un ticket. El consumo contra el techo de gasto, que muestra si la gobernanza sostuvo el mes.

El número final es uno solo.

Cinco errores comunes en la re-decisión de ruta

Los errores de abajo son los cinco que la ventana de agosto y septiembre de 2026 expone con más fuerza. Cada uno tiene corrección de una línea. Todos comparten la misma raíz: decidir ruta con el dato equivocado, porcentaje sin perfil o lectura sin fecha.

Leer porcentaje sin perfil de consumo. La re-precificación del GPT-5.6 Sol se vuelve US$400 al mes en el perfil del Paso 3, US$300 de la salida y US$100 de la entrada, y la del DeepSeek V4 Flash 0731 se vuelve US$61,20, US$31,20 de la salida y US$30 de la entrada. El porcentaje sin perfil invierte la prioridad de la fila. Corrección: ningún número de tabla entra en una decisión sin pasar por el perfil real.

Comparar lecturas sin fecha. Sin fecha de lectura, la comparación entre dos tablas no compara nada: cada número vale por el día en que fue leído, y el día desapareció. Corrección: fuente y fecha anotados junto a cada precio, como en las lecturas de 2026-08-17 y 2026-09-07 de Artificial Analysis.

Mirar solo la línea de entrada. En el modelo top, la salida es la línea cara de la factura; en el modelo económico de esta ventana, la entrada pasa a liderar la cuenta. Los dos movimientos de esta ventana fueron mayores en la salida, -33% y +371% contra -20% y +214% en la entrada, y quien leyó solo la primera línea subestimó la cuenta. Corrección: entrada y salida en el recálculo, siempre.

Cambiar de modelo por precio y perder la tarea. El modelo económico subió 371% y sigue barato en valor absoluto; la pregunta de ruta nunca es qué modelo cuesta menos por token, es cuál cumple la tarea al menor costo por resultado. Corrección: comparar dentro de la misma calidad de entrega, con el mismo prompt corrido en paralelo antes de migrar.

Tratar el re-base de un índice como cambio de precio. El Intelligence Index v4.2, re-baseado el 4 de septiembre de 2026, movió el marcador de score, no la tabla de precios. Quien confunde las dos lecturas re-decide ruta por un movimiento que no tocó el costo. Corrección: score y precio en lecturas separadas, cada una con su fecha.

Preguntas frecuentes sobre el precio del token y el enrutamiento de LLM

¿Por qué cambian los precios de los modelos de IA?

Reprecificación competitiva entre proveedores, costo de cómputo que se mueve y reestructuración de tiers y de contextos largos son los motores más comunes. Ninguna tabla viene con aviso previo: las dos lecturas de esta ventana, de 2026-08-17 y 2026-09-07 en Artificial Analysis, capturaron un recorte de hasta 33% y una suba de hasta 371% sin nota explicativa registrada en las páginas de precio consultadas. El precio es decisión del proveedor, y la defensa es cadencia de lectura, no adivinación.

¿Cuánto cambia el costo cuando cambia el precio del token?

Depende del perfil de consumo, y la respuesta para cada caso: en el perfil ilustrativo de 100 millones de entrada y 30 millones de salida al mes, el recorte en el modelo top vale US$400 al mes y la suba en el modelo económico vale US$61,20. Un perfil tres veces mayor multiplica los dos valores por tres. Porcentaje sin perfil no responde. Nunca.

¿Vale la pena mantener una ruta fija en un modelo?

Depende de la ruta, y la respuesta para cada caso: ruta con exigencia firme de calidad o latencia queda en ruta fija, monitoreada con la cadencia del Paso 5, porque la previsibilidad de comportamiento vale más que la diferencia de costo. Volumen sin política de calidad migra a la ruta enrutada, que absorbe el cambio de precio sin retrabajo.

¿Qué es el enrutamiento de LLM?

Es la capa que elige el modelo de cada llamada por costo, desempeño, latencia y contexto, manteniendo el ranking de modelos actualizado y el failover listo. El model router como middleware es el pilar que detalla la arquitectura completa, y la decisión de ruta pasa a ser política en él, no un evento en tu calendario.

Referências e Leitura Complementar

Para llevar a la próxima lectura de la tabla de precios

La tabla de precios de modelos de IA va a seguir cambiando, en los dos sentidos, sin aviso. Lo que queda: perfil de consumo fijado, lectura fechada, recálculo de la ruta fija, comparación con la ruta enrutada y cadencia de reevaluación. El enrutamiento ejecuta la re-decisión como política; la decisión de mantener, migrar o monitorear sigue siendo tuya.

Dos números fechados abren y cierran este artículo: en la misma ventana de tres semanas, entre las lecturas de 2026-08-17 y 2026-09-07 de Artificial Analysis, el modelo top quedó US$400 al mes más barato en el perfil trabajado, y el modelo económico quedó US$61,20 más caro. La ruta fija que no reevalúa paga los dos, y la que reevalúa transforma la tabla de precios en insumo. La referencia de la arquitectura está en la guía de referencia del model router, y la capa que ejecuta la reevaluación está descrita en la página del Nexforce Router.

La tabla de precios vuelve a cambiar. Esa parte no depende de ti. Llegar al próximo cambio con perfil de consumo, fecha de lectura y cadencia depende de ti, y ahí es donde la decisión le gana a la sorpresa.

Nexforce

Ahorra hasta un 50% de créditoscon una sola API inteligente

Conecta tu operación a nuestro AI Router y optimiza el consumo de múltiples LLMs

Prueba Gratis

Artículos relacionados