Modelo pequeño cerca del líder: cuándo basta la inteligencia

El 30 de julio de 2026, Artificial Analysis registró el Inkling Small, de Thinking Machines, con 40 puntos en el Intelligence Index, un punto detrás de su hermano de frontera Inkling, que marca 41, usando menos de un tercio de los parámetros totales y activos: 276B totales contra 975B, 12B activos contra 41B. El costo ponderado por tarea del índice, en la página del modelo en Artificial Analysis, es de US$ 0,07. Un punto de distancia no paga, en la mayoría de las tareas, el múltiplo de porte que los separa. La frontera del costo por inteligencia se desplazó, y eso se convierte en política de enrutamiento.
Hallazgos principales
La medición de Artificial Analysis, del 30 de julio de 2026, dejó al Inkling Small un punto detrás del líder en el Intelligence Index, 40 contra 41, con menos de un tercio de los parámetros y un costo de US$ 0,07 por tarea del índice. La paridad, sin embargo, es selectiva por tipo de tarea. Cinco números resumen el desplazamiento.
- Un punto de diferencia. Inkling Small marca 40 en el Intelligence Index de Artificial Analysis; el Inkling marca 41.
- Menos de un tercio del porte. 276B de parámetros totales (12B activos) contra 975B (41B activos) del hermano mayor.
- Liderazgo de costo por punto de inteligencia. El costo ponderado por tarea del índice en el modelo pequeño es de US$ 0,07.
- Paridad selectiva por tipo de tarea. El pequeño empata o supera al líder en codificación y razonamiento de frontera, y pierde en conocimiento factual y tareas agénticas.
- Eficiencia de tokens. Cerca de 24 mil tokens de salida por tarea del índice contra 25 mil del hermano mayor, bastante menos que pares del mismo nivel de inteligencia.
¿Cómo se recolectaron los datos?
La fuente primaria es el análisis independiente de Artificial Analysis, del 30 de julio de 2026, y el model card oficial de Thinking Machines para el Inkling Small. La medición usa el Intelligence Index, que agrega nueve evaluaciones ponderadas por peso propio; el costo por tarea deriva de los precios de token de cada proveedor.
Entre las evaluaciones están GDPval-AA v2, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt y AA-Omniscience. El costo por tarea divide los precios de token por entrada, salida y caché de cada proveedor por el número de tareas y pondera por el peso de la evaluación en el índice. Es un benchmark independiente, no un número de marketing del proveedor, con una limitación honesta: mide la capacidad de los modelos bajo las condiciones del índice, no el comportamiento de una operación real o de un proveedor específico. Precio y latencia varían por hospedaje. La muestra es la del índice, no la de su carga.
¿Cuántos parámetros usa de hecho el Inkling Small?
El model card de Thinking Machines informa 276 mil millones de parámetros totales y 12 mil millones activos, en una arquitectura de Mixture-of-Experts. El paralelo importa porque la inferencia cobra los activos por token, no el total. En cada paso, solo una fracción de los especialistas entra en la cuenta. Total es ficha; activo es factura.
| Dimensión | Inkling Small | Inkling (líder) |
|---|---|---|
| Parámetros totales | 276B | 975B |
| Parámetros activos | 12B | 41B |
| Intelligence Index | 40 | 41 |
| Costo por tarea del índice | US$ 0,07 | no publicado en el mismo recorte |
| Tokens de salida por tarea del índice | ~24 mil | ~25 mil |
| Contexto | 256K en el artículo del 30/07; 1M en el model card y en la página del modelo | 1M tokens |
| Licencia | Apache 2.0 (open weights) | open weights |
La cuenta del costo de inferencia no es el total de parámetros en la ficha. Es lo que cada ejecución activa, veces el precio del token, veces la cantidad de tokens que la tarea realmente exigió. El número activo explica la ventaja de costo del pequeño: para la mayor parte del tráfico, ese es el costo de verdad, y no es el doble, es una fracción. El detalle de los activos es lo que transforma una diferencia de arquitectura en una diferencia de margen.
¿Cuándo es suficiente un modelo pequeño de IA?
Un modelo pequeño es suficiente cuando la medida independiente de capacidad lo coloca dentro de un margen que no paga el múltiplo de costo del líder y cuando la tarea cae en el tipo de ronda en que empata o gana. El Inkling Small empata en codificación y razonamiento de frontera.
Humanity's Last Exam 32% contra 30%, GPQA Diamond 89% contra 87%, CritPt 8% contra 5%, SciCode 49% contra 46% y Terminal-Bench v2.1 en 55% para los dos. Para esas familias de solicitud, el líder cobra la factura y entrega la misma letra. Un punto no paga eso.
| Evaluación | Inkling Small | Inkling (líder) |
|---|---|---|
| Humanity's Last Exam | 32% | 30% |
| GPQA Diamond | 89% | 87% |
| CritPt | 8% | 5% |
| SciCode | 49% | 46% |
| Terminal-Bench v2.1 | 55% | 55% |
| AA-Omniscience | -9 | 2 |
| AA-Omniscience (precisión) | 31% | 40% |
| Tasa de alucinación | 57% | 63% |
| τ³-Banking | 15% | 24% |
La lectura económica es un costo por punto de inteligencia. Llevar 3,5 veces menos parámetros para marcar un punto atrás se vuelve, en lenguaje de balance, la pregunta correcta: ¿cuántos de sus pedidos realmente exigen el punto que falta? Un sistema que envía todos los pedidos al líder paga el múltiplo del porte sobre la base entera, incluido el ping, el saludo y la consulta de cadastro que el modelo pequeño resuelve en el primer intento. El líder deja de ser la ruta default el día en que el punto de diferencia no aparece en el resultado que el cliente ve.
¿Cómo promover el modelo pequeño a ruta default?
La política recomendada es el enrutamiento por costo por tarea resuelta, no por una elección fija de modelo. Eso es una decisión de margen, no de benchmark. Las condiciones para promover el pequeño a ruta default tienen nombre y prueba:
- Paridad por tarea. La tarea necesita caer en un tipo de ronda en que el pequeño empata o supera al líder. De lo contrario, no es la ruta, es una apuesta.
- Latencia y contexto. El pequeño entrega 44,8 tokens por segundo en el proveedor de referencia de Artificial Analysis, por debajo de la mediana de 66,1 t/s de modelos open-weights de porte similar. El model card y la página del modelo en Artificial Analysis reportan ventana de 1 millón de tokens; el artículo del 30 de julio de 2026 reporta 256 mil para el Inkling Small y 1 millón para el Inkling. La ruta se sostiene solo si el SLO acepta la latencia medida en su endpoint y la tarea cabe en la ventana que ese endpoint realmente entrega.
- Costo por tarea resuelta. La métrica decisiva no es el precio por token, es cuánto cuesta concluir la tarea correcta en la primera pasada. El pequeño gastó ~24 mil tokens de salida por tarea del índice, contra ~25 mil del líder.
Pero la condición que sostiene las otras tres es la confianza de que el costo es real. En una operación brasileña, la conversión cambiaria y el costo efectivo de contratar el token en el exterior elevan la factura respecto al precio de lista, lo que hace más valioso, no menos, desplazar el tráfico liviano hacia la ruta liviana.
El precio publicado es lista; lo que sale de caja es otra cuenta.
Un enrutador de modelo con clasificación de intención aplica esa política por solicitud: normaliza, clasifica, elige el modelo por costo, desempeño, latencia y contexto, y deja al líder como ruta de reserva configurable. El Nexforce Router es un ejemplo práctico de esa capa, con failover automático, límites de gasto por clave y trazabilidad de cada llamada. Ocupa solo el lugar de infraestructura de enrutamiento; no es un producto de agentes. La política vive en el enrutador.
¿Cuándo el modelo pequeño NO basta?
El punto de distancia no desaparece, se desplaza hacia tipos de tarea específicos. El pequeño no basta en el conocimiento factual sensible, en tareas agénticas y en picos de volumen con SLO de latencia que no entrega. La honestidad técnica exige nombrarlos, uno a uno.
El Inkling Small pierde en el conocimiento factual y en tareas agénticas: AA-Omniscience -9 contra 2 del líder, impulsado por la precisión de 31% contra 40%, y τ³-Banking 15% contra 24%. También es más lento en la inferencia, con 44,8 tokens por segundo contra la mediana de 66,1 de modelos de porte similar.
Para una empresa, eso significa que el pequeño no basta cuando la respuesta errada sobre un hecho cuesta caro, cuando la tarea exige cadenas largas e interdependientes de acción, cuando el pico de volumen exige velocidad que el modelo no entrega, o cuando el contexto explota más allá de lo que el modelo pequeño sostiene con holgura. Mantener al líder como reserva no es conservadurismo. Es la otra mitad de la misma política de costo: pagar el múltiplo solo donde el punto de diferencia aparece en el resultado. No toda tarea cabe en el pequeño.
¿Cuánta diferencia hace el costo por tarea en la factura?
La diferencia aparece en el volumen movido. Una hipótesis operativa, no un número medido en el índice, es desplazar la mayor parte de la carga de la ruta del líder hacia el modelo pequeño y mantener al líder solo donde el punto de diferencia aparece. Eso derriba el costo por tarea resuelta en un valor que la tabla de precios por token no muestra. El cuadro de abajo completa el decisório.
| Familia de tarea | Ruta | Criterio de la prueba |
|---|---|---|
| Codificación y depuración | modelo pequeño (default) | paridad medida en GPQA Diamond y SciCode |
| Razonamiento corto y clasificación | modelo pequeño (default) | ¿exige el punto de diferencia? si no, recorta |
| Conocimiento factual sensible | líder (reserva) | AA-Omniscience negativo pesa contra el pequeño |
| Contexto largo por encima de la ventana medida en el endpoint | líder (reserva) | artículo del 30/07: 256K en el pequeño, 1M en el líder; model card: 1M en los dos |
| Tarea agéntica con falla cara | líder (reserva) | τ³-Banking 15% contra 24% es la prueba |
| Pico de volumen con SLO de latencia | probar por medición | 44,8 t/s exige prueba en su carga |
Esa tabla es una hipótesis de enrutamiento, no una promesa. La regla que la sostiene es la misma en cualquier factura: enviar todo el tráfico al modelo más caro es pagar por el punto de diferencia sobre una base que no lo usa. Un proxy multimodelo crudo solo reenvía la solicitud y cobra la ruta; un enrutador con política de costo es lo que aplica ese cuadro por solicitud y registra cada elección para el auditor. La economía aparece en el volumen movido.
Preguntas frecuentes sobre modelo pequeño versus líder
¿Cuándo es suficiente un modelo pequeño de IA?
Cuando la medida independiente de capacidad alcanza al líder dentro de un margen que no paga el múltiplo de costo y la tarea cae en un tipo de ronda en que empata o supera al líder, como codificación y razonamiento de frontera. Para conocimiento factual sensible, contexto muy largo o tareas agénticas con falla cara, el líder sigue siendo la ruta de reserva.
¿Qué es el costo por inteligencia de modelos de IA?
Es el costo por punto de inteligencia: el costo ponderado por tarea en el índice dividido por el grado de capacidad alcanzado. El Inkling Small marca 40 puntos con US$ 0,07 por tarea, mientras el líder marca 41. El decisório de enrutamiento usa esa diferencia para mandar la mayor parte de las tareas a la ruta liviana y reservar al líder donde el punto de diferencia aparece.
¿El Inkling Small es mejor que el modelo de frontera?
En algunas mediciones, sí. Empata o supera al hermano mayor en Humanity's Last Exam, GPQA Diamond, CritPt y SciCode, y pierde en conocimiento factual y tareas agénticas. No existe un modelo mejor para todo; existe la combinación de modelo y tipo de tarea con el mejor costo por actividad resuelta.
¿Cómo entra el Nexforce Router en esa decisión?
El Nexforce Router aplica la política de costo por solicitud: normaliza, clasifica la intención y elige el modelo por costo, desempeño, latencia y contexto, con el líder como ruta de reserva, failover automático, límites de gasto por clave y trazabilidad de cada llamada. Es una capa de infraestructura de enrutamiento, no un producto de agentes.
Referencias y lectura complementaria
El análisis de paridad del Inkling Small con el Inkling sale de Artificial Analysis, publicado el 30 de julio de 2026, con la página del modelo en Artificial Analysis para precio, velocidad y contexto, y el model card oficial del Inkling Small en Thinking Machines para los parámetros y la licencia Apache 2.0. Toda la cuenta parte de ahí. En el blog, el contexto del argumento más amplio de enrutamiento como recorte de costo está en El precio por token cae, pero el costo de IA sube, la lectura por complejidad de la solicitud en Enrutamiento por complejidad: calidad sin desperdicio, la variación por endpoint en Evaluación de endpoint y política de enrutamiento, y la elección de la capa de gateway en Cómo evaluar y elegir un LLM gateway. El cambio estructural del índice de frontera está en Intelligence Index 2026: el fin del duopolio de modelos de IA.
El siguiente paso es una política de costo, no un marcador
Un modelo que marca un punto atrás con un tercio del porte no es una noticia de arquitectura. Es una noticia de cuenta. La empresa que trata la elección de modelo como una decisión única, tomada una vez y olvidada, paga el múltiplo del líder sobre toda la base, mientras la ruta liviana, que resuelve la mayor parte de las tareas en la primera pasada, queda apagada en el código. El punto de inteligencia que sobra no paga la factura que cuesta. Paga solo cuando la tarea lo exige, y enrutar por tarea es exactamente donde entra. La decisión siguiente es suya, y es de presupuesto, no de benchmark.

Ahorra hasta un 50% de créditoscon una sola API inteligente
Conecta tu operación a nuestro AI Router y optimiza el consumo de múltiples LLMs
Prueba GratisArtículos relacionados

Ejecución durable para agentes de IA: el motor vive en el código
Los agentes de IA de larga duración fallan a mitad de camino, y la diferencia entre rehacer y retomar decide el costo y la confianza. La ejecución durable escrita en el propio código, con checkpoint por etapa, le gana al motor de orquestación dedicado en la mayoría de las cargas de agentes B2B.
Read more
MCP gateway: la capa de control para el tráfico de herramientas de agentes de IA
Cómo el protocolo MCP transforma la integración de agentes de IA y por qué la gobernanza del tráfico de herramientas exige un gateway centralizado para seguridad, auditoría y control de costos.
Read more
Ranking de modelos de IA: el re-base que reabre la elección
El re-base del principal índice de inteligencia reescaló de una vez todos los marcadores publicados y demostró que las versiones del índice no son comparables. El texto traduce ese reset a un procedimiento de redecisión de ruta bajo incertidumbre de puntaje, con retest con tráfico propio, política de ruta, fallback y tope de gasto, y aterriza en el Nexforce Router.
Read more