Ir al contenido principal

Modelo pequeño cerca del líder: cuándo basta la inteligencia

Rafael Torres
Rafael Torres1 de septiembre de 202611 min. de leitura
Modelo pequeño cerca del líder: cuándo basta la inteligencia

El 30 de julio de 2026, Artificial Analysis registró el Inkling Small, de Thinking Machines, con 40 puntos en el Intelligence Index, un punto detrás de su hermano de frontera Inkling, que marca 41, usando menos de un tercio de los parámetros totales y activos: 276B totales contra 975B, 12B activos contra 41B. El costo ponderado por tarea del índice, en la página del modelo en Artificial Analysis, es de US$ 0,07. Un punto de distancia no paga, en la mayoría de las tareas, el múltiplo de porte que los separa. La frontera del costo por inteligencia se desplazó, y eso se convierte en política de enrutamiento.

Hallazgos principales

La medición de Artificial Analysis, del 30 de julio de 2026, dejó al Inkling Small un punto detrás del líder en el Intelligence Index, 40 contra 41, con menos de un tercio de los parámetros y un costo de US$ 0,07 por tarea del índice. La paridad, sin embargo, es selectiva por tipo de tarea. Cinco números resumen el desplazamiento.

  1. Un punto de diferencia. Inkling Small marca 40 en el Intelligence Index de Artificial Analysis; el Inkling marca 41.
  2. Menos de un tercio del porte. 276B de parámetros totales (12B activos) contra 975B (41B activos) del hermano mayor.
  3. Liderazgo de costo por punto de inteligencia. El costo ponderado por tarea del índice en el modelo pequeño es de US$ 0,07.
  4. Paridad selectiva por tipo de tarea. El pequeño empata o supera al líder en codificación y razonamiento de frontera, y pierde en conocimiento factual y tareas agénticas.
  5. Eficiencia de tokens. Cerca de 24 mil tokens de salida por tarea del índice contra 25 mil del hermano mayor, bastante menos que pares del mismo nivel de inteligencia.

¿Cómo se recolectaron los datos?

La fuente primaria es el análisis independiente de Artificial Analysis, del 30 de julio de 2026, y el model card oficial de Thinking Machines para el Inkling Small. La medición usa el Intelligence Index, que agrega nueve evaluaciones ponderadas por peso propio; el costo por tarea deriva de los precios de token de cada proveedor.

Entre las evaluaciones están GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt y AA-Omniscience. El costo por tarea divide los precios de token por entrada, salida y caché de cada proveedor por el número de tareas y pondera por el peso de la evaluación en el índice. Es un benchmark independiente, no un número de marketing del proveedor, con una limitación honesta: mide la capacidad de los modelos bajo las condiciones del índice, no el comportamiento de una operación real o de un proveedor específico. Precio y latencia varían por hospedaje. La muestra es la del índice, no la de su carga.

¿Cuántos parámetros usa de hecho el Inkling Small?

El model card de Thinking Machines informa 276 mil millones de parámetros totales y 12 mil millones activos, en una arquitectura de Mixture-of-Experts. El paralelo importa porque la inferencia cobra los activos por token, no el total. En cada paso, solo una fracción de los especialistas entra en la cuenta. Total es ficha; activo es factura.

DimensiónInkling SmallInkling (líder)
Parámetros totales276B975B
Parámetros activos12B41B
Intelligence Index4041
Costo por tarea del índiceUS$ 0,07no publicado en el mismo recorte
Tokens de salida por tarea del índice~24 mil~25 mil
Contexto256K en el artículo del 30/07; 1M en el model card y en la página del modelo1M tokens
LicenciaApache 2.0 (open weights)open weights

La cuenta del costo de inferencia no es el total de parámetros en la ficha. Es lo que cada ejecución activa, veces el precio del token, veces la cantidad de tokens que la tarea realmente exigió. El número activo explica la ventaja de costo del pequeño: para la mayor parte del tráfico, ese es el costo de verdad, y no es el doble, es una fracción. El detalle de los activos es lo que transforma una diferencia de arquitectura en una diferencia de margen.

¿Cuándo es suficiente un modelo pequeño de IA?

Un modelo pequeño es suficiente cuando la medida independiente de capacidad lo coloca dentro de un margen que no paga el múltiplo de costo del líder y cuando la tarea cae en el tipo de ronda en que empata o gana. El Inkling Small empata en codificación y razonamiento de frontera.

Humanity's Last Exam 32% contra 30%, GPQA Diamond 89% contra 87%, CritPt 8% contra 5%, SciCode 49% contra 46% y Terminal-Bench v2.1 en 55% para los dos. Para esas familias de solicitud, el líder cobra la factura y entrega la misma letra. Un punto no paga eso.

EvaluaciónInkling SmallInkling (líder)
Humanity's Last Exam32%30%
GPQA Diamond89%87%
CritPt8%5%
SciCode49%46%
Terminal-Bench v2.155%55%
AA-Omniscience-92
AA-Omniscience (precisión)31%40%
Tasa de alucinación57%63%
τ³-Banking15%24%

La lectura económica es un costo por punto de inteligencia. Llevar 3,5 veces menos parámetros para marcar un punto atrás se vuelve, en lenguaje de balance, la pregunta correcta: ¿cuántos de sus pedidos realmente exigen el punto que falta? Un sistema que envía todos los pedidos al líder paga el múltiplo del porte sobre la base entera, incluido el ping, el saludo y la consulta de cadastro que el modelo pequeño resuelve en el primer intento. El líder deja de ser la ruta default el día en que el punto de diferencia no aparece en el resultado que el cliente ve.

inline-01.png

¿Cómo promover el modelo pequeño a ruta default?

La política recomendada es el enrutamiento por costo por tarea resuelta, no por una elección fija de modelo. Eso es una decisión de margen, no de benchmark. Las condiciones para promover el pequeño a ruta default tienen nombre y prueba:

  • Paridad por tarea. La tarea necesita caer en un tipo de ronda en que el pequeño empata o supera al líder. De lo contrario, no es la ruta, es una apuesta.
  • Latencia y contexto. El pequeño entrega 44,8 tokens por segundo en el proveedor de referencia de Artificial Analysis, por debajo de la mediana de 66,1 t/s de modelos open-weights de porte similar. El model card y la página del modelo en Artificial Analysis reportan ventana de 1 millón de tokens; el artículo del 30 de julio de 2026 reporta 256 mil para el Inkling Small y 1 millón para el Inkling. La ruta se sostiene solo si el SLO acepta la latencia medida en su endpoint y la tarea cabe en la ventana que ese endpoint realmente entrega.
  • Costo por tarea resuelta. La métrica decisiva no es el precio por token, es cuánto cuesta concluir la tarea correcta en la primera pasada. El pequeño gastó ~24 mil tokens de salida por tarea del índice, contra ~25 mil del líder.

Pero la condición que sostiene las otras tres es la confianza de que el costo es real. En una operación brasileña, la conversión cambiaria y el costo efectivo de contratar el token en el exterior elevan la factura respecto al precio de lista, lo que hace más valioso, no menos, desplazar el tráfico liviano hacia la ruta liviana.

El precio publicado es lista; lo que sale de caja es otra cuenta.

Un enrutador de modelo con clasificación de intención aplica esa política por solicitud: normaliza, clasifica, elige el modelo por costo, desempeño, latencia y contexto, y deja al líder como ruta de reserva configurable. El Nexforce Router es un ejemplo práctico de esa capa, con failover automático, límites de gasto por clave y trazabilidad de cada llamada. Ocupa solo el lugar de infraestructura de enrutamiento; no es un producto de agentes. La política vive en el enrutador.

¿Cuándo el modelo pequeño NO basta?

El punto de distancia no desaparece, se desplaza hacia tipos de tarea específicos. El pequeño no basta en el conocimiento factual sensible, en tareas agénticas y en picos de volumen con SLO de latencia que no entrega. La honestidad técnica exige nombrarlos, uno a uno.

El Inkling Small pierde en el conocimiento factual y en tareas agénticas: AA-Omniscience -9 contra 2 del líder, impulsado por la precisión de 31% contra 40%, y τ³-Banking 15% contra 24%. También es más lento en la inferencia, con 44,8 tokens por segundo contra la mediana de 66,1 de modelos de porte similar.

Para una empresa, eso significa que el pequeño no basta cuando la respuesta errada sobre un hecho cuesta caro, cuando la tarea exige cadenas largas e interdependientes de acción, cuando el pico de volumen exige velocidad que el modelo no entrega, o cuando el contexto explota más allá de lo que el modelo pequeño sostiene con holgura. Mantener al líder como reserva no es conservadurismo. Es la otra mitad de la misma política de costo: pagar el múltiplo solo donde el punto de diferencia aparece en el resultado. No toda tarea cabe en el pequeño.

¿Cuánta diferencia hace el costo por tarea en la factura?

La diferencia aparece en el volumen movido. Una hipótesis operativa, no un número medido en el índice, es desplazar la mayor parte de la carga de la ruta del líder hacia el modelo pequeño y mantener al líder solo donde el punto de diferencia aparece. Eso derriba el costo por tarea resuelta en un valor que la tabla de precios por token no muestra. El cuadro de abajo completa el decisório.

Familia de tareaRutaCriterio de la prueba
Codificación y depuraciónmodelo pequeño (default)paridad medida en GPQA Diamond y SciCode
Razonamiento corto y clasificaciónmodelo pequeño (default)¿exige el punto de diferencia? si no, recorta
Conocimiento factual sensiblelíder (reserva)AA-Omniscience negativo pesa contra el pequeño
Contexto largo por encima de la ventana medida en el endpointlíder (reserva)artículo del 30/07: 256K en el pequeño, 1M en el líder; model card: 1M en los dos
Tarea agéntica con falla caralíder (reserva)τ³-Banking 15% contra 24% es la prueba
Pico de volumen con SLO de latenciaprobar por medición44,8 t/s exige prueba en su carga

Esa tabla es una hipótesis de enrutamiento, no una promesa. La regla que la sostiene es la misma en cualquier factura: enviar todo el tráfico al modelo más caro es pagar por el punto de diferencia sobre una base que no lo usa. Un proxy multimodelo crudo solo reenvía la solicitud y cobra la ruta; un enrutador con política de costo es lo que aplica ese cuadro por solicitud y registra cada elección para el auditor. La economía aparece en el volumen movido.

Preguntas frecuentes sobre modelo pequeño versus líder

¿Cuándo es suficiente un modelo pequeño de IA?

Cuando la medida independiente de capacidad alcanza al líder dentro de un margen que no paga el múltiplo de costo y la tarea cae en un tipo de ronda en que empata o supera al líder, como codificación y razonamiento de frontera. Para conocimiento factual sensible, contexto muy largo o tareas agénticas con falla cara, el líder sigue siendo la ruta de reserva.

¿Qué es el costo por inteligencia de modelos de IA?

Es el costo por punto de inteligencia: el costo ponderado por tarea en el índice dividido por el grado de capacidad alcanzado. El Inkling Small marca 40 puntos con US$ 0,07 por tarea, mientras el líder marca 41. El decisório de enrutamiento usa esa diferencia para mandar la mayor parte de las tareas a la ruta liviana y reservar al líder donde el punto de diferencia aparece.

¿El Inkling Small es mejor que el modelo de frontera?

En algunas mediciones, sí. Empata o supera al hermano mayor en Humanity's Last Exam, GPQA Diamond, CritPt y SciCode, y pierde en conocimiento factual y tareas agénticas. No existe un modelo mejor para todo; existe la combinación de modelo y tipo de tarea con el mejor costo por actividad resuelta.

¿Cómo entra el Nexforce Router en esa decisión?

El Nexforce Router aplica la política de costo por solicitud: normaliza, clasifica la intención y elige el modelo por costo, desempeño, latencia y contexto, con el líder como ruta de reserva, failover automático, límites de gasto por clave y trazabilidad de cada llamada. Es una capa de infraestructura de enrutamiento, no un producto de agentes.

Referencias y lectura complementaria

El análisis de paridad del Inkling Small con el Inkling sale de Artificial Analysis, publicado el 30 de julio de 2026, con la página del modelo en Artificial Analysis para precio, velocidad y contexto, y el model card oficial del Inkling Small en Thinking Machines para los parámetros y la licencia Apache 2.0. Toda la cuenta parte de ahí. En el blog, el contexto del argumento más amplio de enrutamiento como recorte de costo está en El precio por token cae, pero el costo de IA sube, la lectura por complejidad de la solicitud en Enrutamiento por complejidad: calidad sin desperdicio, la variación por endpoint en Evaluación de endpoint y política de enrutamiento, y la elección de la capa de gateway en Cómo evaluar y elegir un LLM gateway. El cambio estructural del índice de frontera está en Intelligence Index 2026: el fin del duopolio de modelos de IA.

El siguiente paso es una política de costo, no un marcador

Un modelo que marca un punto atrás con un tercio del porte no es una noticia de arquitectura. Es una noticia de cuenta. La empresa que trata la elección de modelo como una decisión única, tomada una vez y olvidada, paga el múltiplo del líder sobre toda la base, mientras la ruta liviana, que resuelve la mayor parte de las tareas en la primera pasada, queda apagada en el código. El punto de inteligencia que sobra no paga la factura que cuesta. Paga solo cuando la tarea lo exige, y enrutar por tarea es exactamente donde entra. La decisión siguiente es suya, y es de presupuesto, no de benchmark.

Nexforce

Ahorra hasta un 50% de créditoscon una sola API inteligente

Conecta tu operación a nuestro AI Router y optimiza el consumo de múltiples LLMs

Prueba Gratis

Artículos relacionados