Ir al contenido principal

Costo por tarea: cómo decidir la ruta de un modelo IA

Rafael Torres
Rafael Torres14 de septiembre de 202616 min. de leitura
Costo por tarea: cómo decidir la ruta de un modelo IA

Artificial Analysis publicó el 2026-09-07 la versión v4.3 de su Intelligence Index, y la cima de la tabla quedó incómoda para quien tiene que decidir. Claude Fable 5.1 (max with fallback) y GPT-6 Astra (max) marcaron los mismos 53 puntos. Empataron. Uno de ellos cuesta US$ 3,26 por tarea. El otro cuesta US$ 7,63.

Un empate en el marcador es el peor escenario posible para una decisión de ruta, porque no es un empate. Es un problema disfrazado de no-problema. Quien mira solo la columna del puntaje concluye que da igual y elige por cualquier otro motivo: el modelo que el equipo ya conoce, el que el proveedor empujó mejor, el que apareció primero en la evaluación interna. Cualquier criterio sirve cuando el número en el que todos confiaron dejó de discriminar.

El costo por tarea no es ese número por casualidad. Es el único que responde la pregunta que el puntaje dejó abierta, y responde en dólares: cuánto cuesta resolver una tarea del conjunto de evaluación, con el modelo entregando la calidad exigida. Este texto recorre la decisión en cinco pasos, desde el piso de calidad hasta la auditoría de la ruta, y muestra dónde termina el dato publicado y dónde empieza la medición que solo su propia carga de trabajo puede producir.

Por qué el puntaje de inteligencia ya no decide la ruta

Un puntaje de inteligencia mide capacidad dentro de un conjunto estandarizado de tareas. Cuando dos modelos miden exactamente el mismo número, ese número deja de discriminar, y el criterio que queda es el costo de resolver la tarea. El puntaje deja de ser el objetivo de la decisión y pasa a ser su filtro.

La trampa vive en la diferencia entre capacidad medida y capacidad necesaria. El índice no mide su problema, mide un compendio de problemas que Artificial Analysis eligió, y su valor es justamente ser lo bastante estandarizado para comparar laboratorios distintos. La estandarización tiene precio: la tarea en la que su producto gana o pierde dinero puede no estar representada ahí con el peso que tiene en su volumen real.

GPT-6 Astra es el caso más claro del momento. El lanzamiento del modelo ya había sido cubierto aquí con precio, benchmarks y la nota Critical de seguridad, en GPT-6 Astra: precio, benchmarks y seguridad de OpenAI, el 2026-09-09. Lo que faltaba era la cuenta. Un modelo que empata en la cima del índice y cuesta 57% menos por tarea que su compañero de empate no es una elección de gusto, es una elección de margen esperando que alguien firme.

Qué mide el índice v4.3

El Intelligence Index v4.3 es un compuesto que pasó a incluir la versión v4.0 de Terminal-Bench. Sustituyó la evaluación bancaria por AutomationBench-AA, construida con Zapier sobre 657 tareas privadas y retenidas. Con eso, el peso de las evaluaciones que usan tareas o respuestas privadas subió de 40% a 45%, y una violación de guardrail anula la tarea.

La prueba privada importa por un motivo simple: un conjunto retenido no se filtra al entrenamiento del próximo modelo, así que mide capacidad en lugar de memoria. Todo número de esta pieza lleva la versión y la fecha por eso. El índice tiene historial de re-base. El reset ya obligó a equipos a redecidir ruta en El ranking de modelos de IA se reinició, y un costo por tarea sin versión al lado es un número sin fecha de caducidad declarada.

Qué es el costo por tarea y por qué separa lo que el puntaje empata

Costo por tarea es cuánto cuesta resolver una tarea del conjunto del índice, en dólares, calculado a partir del precio de tokens de entrada, lectura de caché, escritura de caché, razonamiento y respuesta, dividido por el número de tareas y ponderado por el peso de la evaluación en el índice. En la práctica es la unidad que transforma marcador en presupuesto, porque convierte capacidad medida en costo por unidad de trabajo entregado.

El índice v4.3 publica ese número junto al puntaje, y la lectura del 2026-09-07 entrega dos pares que cuentan la historia completa. El primero es un empate caro. El segundo es un empate barato.

ParPuntaje (max)Costo por tareaDiferencia
GPT-6 Astra (max)53US$ 3,26referencia del par caro
Claude Fable 5.1 (max with fallback)53US$ 7,6357% más caro con el mismo puntaje
GLM-5.3-Flash42US$ 0,25referencia del par económico
GPT-5.6 Terra (max)42US$ 1,4018% del costo; 5,6x es una razón derivada, no medida por la fuente

El par económico enseña más que el par caro, porque 42 puntos sigue siendo un puntaje respetable y US$ 0,25 por tarea es otro orden de magnitud. Un equipo que solo mira la cima de la tabla nunca encuentra esa línea. Es el mismo tipo de asimetría que ya sostuvo el argumento económico del enrutamiento en Costo de modelos de IA en 2026, ahora con una unidad de decisión en lugar de un spread por token.

El empate en el índice no es la única señal de calidad disponible, y el segundo eje muestra que el par caro no es un empate técnico disfrazado. En Terminal-Bench v4.0, medido en 66 tareas por 3 ejecuciones, GPT-6 Astra (max) marca 59,1% de pass@1. Claude Fable 5.1 queda en 52,0% y Claude Opus 5 en 49,0%. Los dos primeros tienen fortalezas en ejes distintos, y la propia Artificial Analysis registra que Fable 5.1 va adelante en AA-Briefcase y SciCode mientras Astra lidera en Terminal-Bench v4.0 y en AutomationBench-AA. El puntaje compuesto trata como iguales a dos modelos que ganan en lugares distintos, y por eso no decide.

inline-01.png

Paso 1: fije el piso de calidad aceptable

Antes de comparar precio, la tarea define qué puntaje es suficiente. El piso de calidad aceptable es el mínimo de capacidad que la familia de tareas tolera sin generar retrabajo, y viene del costo del error. No del ranking. Escrito una vez, convierte el puntaje en filtro y libera el costo por tarea para decidir entre los aprobados.

Ese piso es una decisión de negocio disfrazada de parámetro técnico. Un pipeline que genera un borrador revisado por un humano tolera un modelo de 42 puntos. Una ruta que escribe directo en el sistema del cliente, no. La pregunta no es cuál modelo es mejor. Es cuánto error absorbe la etapa antes de que lo barato salga caro, y esa respuesta vive con quien es dueño del proceso, no con quien escribió el prompt.

Quien empieza por el ranking invierte el orden y traba la decisión. El piso debe escribirse antes de mirar la tabla. Una vez que el marcador entra en escena se vuelve el objetivo, y un equipo con el objetivo equivocado elige el modelo más caro con convicción.

Paso 2: lea el costo por tarea del índice con la fecha

Un costo por tarea publicado se lee con tres datos en la mano: la versión del índice, la fecha de publicación y la definición de la columna. Sin eso, el número se vuelve precio de góndola de supermercado, comparable con cualquier cosa y responsable de nada. La lectura del 2026-09-07 es el retrato válido hasta la próxima versión.

El error más común es tratar el costo por tarea publicado como pronóstico de factura. No lo es. Es una medición hecha sobre un conjunto fijo de tareas, bajo una política de ejecución que no es la suya, y sirve para comparar modelos entre sí, no para estimar su mes. Quien necesita el puente entre la medición de un tercero y su propio presupuesto ya tropezó con esa diferencia, y el camino documentado está en Cómo medir el desempeño de proveedores de LLM.

El segundo error es leer la columna aislada, sin el puntaje al lado. Un costo por tarea de US$ 0,25 parece imbatible hasta que alguien recuerda que resuelve una tarea de 42 puntos. El tercer error es ignorar la versión: un número de v4.2 comparado con uno de v4.3 es una comparación entre reglas distintas, y vale exactamente lo que vale comparar dos mediciones de cosas distintas.

Paso 3: mida su costo por tarea con tráfico propio

El número publicado define la lista corta. El número que decide la ruta es el suyo, medido en prueba paralela, con el mismo prompt enviado a dos o tres modelos aprobados en el piso y las respuestas evaluadas contra el criterio de la etapa. Aquí vive la mayor parte del trabajo de la decisión.

Una prueba paralela no es jugar a comparar respuestas en el chat de la interfaz. Es instrumentación: la misma entrada en los dos lados, la tasa de degradación contada, el costo acumulado sumado. Lo que casi nadie contabiliza es lo que ocurre después del primer intento. Los retries y el fallback no aparecen en el costo por tarea publicado y son la tajada que hace que un modelo barato salga caro cuando falla en medio de una tarea larga. Un enrutamiento que decide por la complejidad de la solicitud ya resolvió parte de eso, y vale leer el criterio en Enrutamiento por complejidad, pero complejidad no es costo: el primero estima el esfuerzo, el segundo mide el resultado.

La cuenta honesta de su costo por tarea incluye cuatro líneas que la medición publicada no cobra. Tokens de entrada en contexto largo, que crecen con el historial de la conversación. Retries y la segunda llamada que nadie presupuesta. Fallback, cuando el modelo principal no disponible empuja tráfico a uno más caro. Y la tarea abandonada a medias, que consumió tokens y no entregó resultado, la línea que suele ser la mayor y la menos visible. Y el retry que entra en la cuenta necesita un límite: sin backoff exponencial con tope y un circuit breaker, el fallback agresivo se vuelve el propio problema, porque todo cliente reejecuta al mismo tiempo y repone la llamada más cara en lugar de evitarla.

Paso 4: escriba la política de ruta con fallback y tope de gasto

Cinco pasos, y este es el que exige una decisión escrita. La política de ruta nombra el modelo default, el modelo de fallback, la condición que autoriza escalar y el tope de gasto que cierra la discusión. Sin los cuatro ítems en papel, la ruta se vuelve una convención oral que cambia cuando sale quien la sostenía.

El procedimiento consolidado, en orden:

  1. Fijar el piso de calidad aceptable por familia de tarea, a partir del costo del error que tolera cada etapa.
  2. Leer el costo por tarea del índice v4.3 con versión y fecha, cruzado con el puntaje. La salida es una lista de dos a tres modelos.
  3. Medir el costo por tarea real de cada finalista en prueba paralela, con tráfico propio, contabilizando retries, fallback, contexto largo y tarea abandonada.
  4. Escribir la política de ruta con modelo default, modelo de fallback, condición de escalamiento y tope de gasto por clave o por proyecto.
  5. Auditar. Re-medir cada vez que un modelo nuevo entre en la lista corta, y antes de eso en la cadencia definida en el paso anterior.

Sin una capa de gateway en el medio, ninguna de esas cuatro decisiones sobrevive al primer día en que cambiar de modelo exija reintegrar la aplicación. Nexforce Router es esa capa: selección de modelo por costo, desempeño y contexto, prueba paralela con un prompt y varios modelos, ranking de modelo en tiempo real, fallback configurable con failover automático, reglas de ruta por clave, tope de gasto por clave o por proyecto, rastro de auditoría de cada llamada y cambio de modelo sin reintegración.

El tope de gasto merece el párrafo que casi nunca recibe, porque es el único ítem de la política que funciona sin confianza. El equipo puede estar en desacuerdo con el piso, con el default y con la condición de escalamiento. El tope no pide acuerdo. Interrumpe la ruta cuando el consumo pasa del límite definido, y esa interrupción es la diferencia entre un mes de costo previsible y un correo de finanzas preguntando qué pasó en octubre.

inline-02.png

Paso 5: audite el resultado contra la decisión

Promover un modelo a default es una hipótesis, y una hipótesis sin verificación se vuelve folclore corporativo en dos semanas. Auditar significa comparar el costo por tarea medido después del cambio con lo que la decisión preveía, y revisar si la calidad se mantuvo. Si el costo bajó y la degradación subió, la ruta quedó más barata y peor. Nadie se dio cuenta.

La auditoría tiene una pregunta central y dos de apoyo. La central: ¿el costo por tarea bajó en la proporción que preveía la medición del Paso 3? Las de apoyo: si la tasa de retry cambió, y dónde disparó el fallback en el último período. Un fallback que dispara cada semana dejó de ser contingencia y pasó a ser parte de la ruta, lo que cambia la cuenta y merece una re-decisión. El costo de operar esa capa, que es pequeño pero no es cero, está desglosado en Costo operativo del gateway de IA en producción.

La cadencia importa más que la sofisticación del informe. Una re-medición por trimestre, más una lectura forzada cada vez que Artificial Analysis publique una versión nueva del índice, cubre el intervalo en que el mercado se mueve. Un modelo nuevo entra en la lista corta cada semana. Una ruta revalidada cada seis meses es una apuesta, no una política.

Cuándo el marcador todavía decide

Existen cuatro casos en los que el puntaje del índice vuelve a mandar, y uno de ellos es una trampa. El primero es la tarea en el borde de la capacidad medida: sin margen en el piso, dos puntos separan funcionar de no funcionar. Ahí el costo por tarea es la variable dependiente. El segundo es la auditoría. Ahí la elección necesita un criterio publicado.

El tercero es la tarea de volumen bajísimo. Si la ruta resuelve doscientas tareas por mes, el costo por tarea mueve centavos. La decisión debe ir a la calidad o a la reducción de riesgo operativo. Automatizar una decisión de bajo impacto es gastar gobernanza con quien no la necesita. El cuarto caso es la limitación de la propia unidad: el costo por tarea que publica el índice es un promedio sobre un conjunto de tareas que no es el suyo.

El costo por tarea publicado es la medición de una institución, sobre un conjunto fijo de tareas, bajo una política de ejecución que no es la suya. No incluye contexto largo, retries, fallback, tareas abandonadas ni la revisión humana que entra después de la respuesta. Tratar ese número como la factura de diciembre es el error simétrico del equipo que decide solo por el marcador.

FAQ

Las cinco preguntas siguientes cierran los puntos que deciden una ruta en la práctica: qué significa la unidad, qué hacer cuando dos modelos empatan en el índice, por qué el número publicado no es su factura, cómo medir su propia carga y dónde entra el tope de gasto en la política.

¿Qué es el costo por tarea en modelos de IA? Es el costo en dólares de resolver una tarea de un conjunto de evaluación, sumando los tokens que el modelo consume para entregar la respuesta con la calidad exigida. En el Intelligence Index v4.3, publicado el 2026-09-07, el costo por tarea y el puntaje de inteligencia aparecen uno al lado del otro, modelo por modelo.

Si dos modelos empatan en el índice, ¿cuál elegir? Por el costo por tarea, después de fijar el piso de calidad que la tarea tolera. GPT-6 Astra (max) y Claude Fable 5.1 (max with fallback) empataron en 53 puntos en la lectura del 2026-09-07, a US$ 3,26 contra US$ 7,63 por tarea. Un puntaje idéntico no separa nada; el costo separa.

¿El costo por tarea publicado es lo que voy a pagar? No. Es la medición de una institución sobre un conjunto fijo de tareas, bajo una política de ejecución que no es la suya. Compara modelos entre sí, y no estima su factura. El número que decide su ruta sale de una prueba paralela con su tráfico, contando retries, fallback y tareas abandonadas.

¿Cómo medir el costo por tarea de mi propia carga? Ejecutando la misma entrada en dos o tres modelos aprobados en el piso, en prueba paralela, y sumando el costo de todos los intentos hasta la respuesta aceptable, no solo el primero. La composición real de tareas es el divisor. Un conjunto estandarizado de otra empresa nunca representa su volumen.

¿Dónde entra el tope de gasto en la política de ruta? Como el único ítem que no depende de consenso. La política nombra modelo default, fallback, condición de escalamiento y tope por clave o por proyecto. El tope interrumpe el consumo cuando pasa del límite, y es lo que transforma la decisión de ruta en costo previsible en lugar de intención declarada.

Referencias y Lectura Complementaria

La decisión que queda

El próximo lunes, la decisión cambia de lugar: el marcador sale de la silla de decisor y se sienta en la de filtro. El equipo escribe el piso de calidad, lee el costo por tarea del índice con versión y fecha, mide el número real contra los finalistas y cierra la política con default, fallback y tope. Después audita.

El empate de 53 puntos entre GPT-6 Astra y Claude Fable 5.1 se recordará como el día en que el índice dejó de responder. La diferencia de 57% en el costo por tarea entre dos modelos que el marcador trata como idénticos es la respuesta que la cuenta esperaba. Solo aparece para quien decidió mirar el costo antes del ranking.

Nexforce

Ahorra hasta un 50% de créditoscon una sola API inteligente

Conecta tu operación a nuestro AI Router y optimiza el consumo de múltiples LLMs

Prueba Gratis

Artículos relacionados