Ranking de modelos de IA: el re-base que reabre la elección

El ranking de modelos de IA resetó de una vez: un re-base metodológico del principal índice de inteligencia artificial, publicado el 2026-09-04, reescaló todos los puntajes. El tope cayó de 63 a 57, ocho de los diez primeros salieron del grupo y ningún número de la versión anterior se compara con uno de la nueva. La elección de modelo vuelve a empezar.
El 63 que abría la tabla era del Claude Opus 5 max, en la lectura del 2026-08-17. El 57 que abre ahora es del Claude Fable 5.1 max con fallback, lectura del 2026-09-07, medición de Artificial Analysis. El marcador entero se movió. Entre los dos números hay un re-base: cambia la regla sin pedir permiso, y todo puntaje guardado en una presentación, una planilla o una política queda sin base de comparación.
Para el comprador, el reset no es curiosidad de laboratorio: es una orden de redecisión. La regla que guiaba la elección se volvió otra, y la pregunta vuelve a ser cuál ruta atiende cada tarea ahora. Es el trabajo que el pilar del router de modelos acompaña desde el primer texto.
Principales hallazgos
Seis hallazgos resumen el re-base v4.2 de Artificial Analysis, publicado el 2026-09-04 y medido en la lectura del 2026-09-07: el tope del índice cayó de 63 a 57, ocho de los diez primeros salieron del top 10, ocho laboratorios están por encima de 50, el conjunto de evaluaciones pasó a 10 y los precios se movieron en los dos sentidos en el mismo período.
Cada línea abajo se cita tal como está, con fuente y fecha.
- El tope del índice de inteligencia artificial cayó de 63 a 57: Claude Opus 5 max marcó 63 en la lectura del 2026-08-17 y Claude Fable 5.1 max con fallback marca 57 en la lectura del 2026-09-07 (medición de Artificial Analysis).
- Ocho de los diez antiguos primeros colocados salieron del top 10 en el re-base v4.2 del 2026-09-04.
- Claude Opus 5 max cayó del puesto 1 al 6, de 63 a 54; GPT-5.6 Sol max salió del top 10, de 61 a 51; Qwen3.8 Max pasó de 58 a 47.
Ninguna de estas líneas afirma que un modelo haya empeorado. Afirman que la regla cambió bajo todos, y el desplazamiento entre las dos lecturas mide el tamaño del servicio que el re-base dejó sobre la mesa de quien decide.
- En la lectura del 2026-09-07, ocho laboratorios están por encima de 50: Anthropic, OpenAI, Moonshot AI, Meta, Google, DeepSeek, SpaceXAI y Alibaba.
- El conjunto de evaluaciones pasó a 10: entraron GDP.pdf (Surge AI), CritPt, SciCode y AA-Omniscience, y el antiguo Long Context Reasoning se volvió AA-LCR v1.1.
- Los precios se movieron en los dos sentidos en el mismo período: la salida del GPT-5.6 Sol max quedó 33% más barata y la del DeepSeek V4 Flash 0731 max, 371% más cara, de la lectura del 2026-08-17 a la lectura del 2026-09-07.
La regla es el hallazgo.
El conjunto pasó a 10 en la v4.2, y el resto es consecuencia: otro conjunto, otro puntaje, otra posición en el marcador. Comparar puntajes de versiones distintas es el error más caro de la semana.
¿Quién entró y quién salió del ranking de modelos de IA?
El top 10 del re-base v4.2 se reorganizó de arriba abajo: ocho de los diez antiguos primeros colocados salieron, y entraron Claude Fable 5.1 en el puesto 1, 2 y 4, GPT-6 Astra en el 3, 5 y 8 y Muse Spark 1.3, de Meta, en el 10. Grok 4.6 cayó del 6 al 17 y Kimi K3, del 7 al 18.
Quien salió, salió por un reescalonamiento. Ninguna medición de producción dijo que el trabajo de esos modelos haya empeorado; la regla anterior entera fue reescalada dentro de la v4.2. La tabla organiza el movimiento.
| Modelo | Antes del re-base | Después, lectura del 2026-09-07 |
|---|---|---|
| Claude Opus 5 max | 63, puesto 1 (lectura del 2026-08-17) | 54, puesto 6 |
| GPT-5.6 Sol max | 61, top 10 | 51, fuera del top 10 |
| Qwen3.8 Max | 58, top 10 | 47 |
| Grok 4.6 | puesto 6 | puesto 17 |
| Kimi K3 | puesto 7 | puesto 18 |
| Claude Fable 5.1 | fuera del top 10 | 57, puesto 1 (max con fallback); variantes en el 2 y el 4 |
| GPT-6 Astra | fuera del top 10 | puestos 3, 5 y 8 |
| Muse Spark 1.3, de Meta | fuera del top 10 | puesto 10 |
Medición de Artificial Analysis: la columna de después es la v4.2, re-base del 2026-09-04, en la lectura del 2026-09-07; la columna de antes es la regla anterior, con el tope fechado en la lectura del 2026-08-17.
Queda la geografía: ocho laboratorios por encima de 50 en la lectura del 2026-09-07 es frontera comprimida, con nombres nuevos en el tope. Un marcador comprimido no decide ruta solo, y la lectura de cuando el modelo pequeño se acerca al líder ya cubría ese apretón.
¿Cómo funciona el re-base del índice?
Un re-base cambia la metodología del índice de inteligencia artificial y reescala todos los puntajes publicados a la nueva regla. En la v4.2, re-base del 2026-09-04, el conjunto pasó a diez evaluaciones y todo número publicado fue reescalado de una vez. Por eso un puntaje de una versión anterior y un puntaje de la v4.2 no se comparan: no miden lo mismo.
Los puntajes son relativos a la regla que los produjo. Cuando cambian el conjunto y la metodología, los números pierden el denominador común, y Artificial Analysis reescala todo dentro de la nueva versión. Dentro de una versión, la comparación vale. Entre versiones, no.
Toda cifra de índice citada en esta pieza es una medición de terceros, publicada por Artificial Analysis en el artículo del re-base v4.2 en una versión fechada, y ningún puntaje aquí es desempeño de producción verificado. La v4.2 es distinta. La verificación que reemplaza la confianza en el marcador es el retest con tráfico propio, en el procedimiento más adelante.
Para la política que consume el puntaje, un puntaje sin versión es un número suelto. Exigir la versión junto a cada puntaje que entra en una regla es trabajo del middleware de enrutamiento a escala, no de la memoria de un analista.
¿Qué pasa con las comparaciones guardadas?
Toda comparación guardada entre puntajes de versiones distintas perdió la base en el re-base del 2026-09-04: el informe de selección, la presentación al board y la política de ruta escrita sobre un puntaje antiguo ahora mezclan dos reglas en el mismo documento. El número no se arruinó; la comparación entre versiones es la que dejó de existir.
El modo de falla tiene nombre: regla doble. El informe compara el 61 de una lectura antigua con el 51 de la lectura del 2026-09-07 y concluye que el modelo envejeció. Ninguna medición dijo eso. Un número leído en la regla equivocada no es un número malo: es un número que no existe.
| Documento guardado | Qué decía | Qué dice ahora |
|---|---|---|
| Informe de selección | "Modelo A: 61; modelo B: 58, elige A" | Reglas distintas |
| Presentación al board | "El tope del índice es 63" | El tope es 57 en otra versión del índice, así que citar la versión junto al número |
| Política de ruta por puntaje | "La ruta X exige un puntaje por encima de 55" | Un umbral sin versión no se ejecuta |
| Planilla de benchmark de LLM | Columnas de puntajes apiladas de versiones distintas en el mismo archivo | Separar por versión del índice antes de cualquier promedio, suma o ranking interno |
Lo que sobrevive después del re-base del 2026-09-04 es la comparación interna a la versión, porque dentro de la lectura del 2026-09-07 los números conversan entre sí y, fuera de ella, la comparación desaparece. Y el daño es menor para quien ya decidía por costo antes que por puntaje, el terreno del benchmark de LLMs para CFOs. La regla que no oscila es la del costo por tarea.
Reescribir el umbral de ruta en la regla vigente, con retest y registro, es gobernanza de política de modelo: quien ya la tiene en su gateway gasta una tarde; quien improvisa en una planilla gasta un trimestre.
¿Los precios acompañaron al marcador?
No hubo una dirección única: entre la lectura del 2026-08-17 y la del 2026-09-07, la salida del GPT-5.6 Sol max quedó 33% más barata y la del DeepSeek V4 Flash 0731 max, 371% más cara. Precio y puntaje son reglas distintas, y la decisión de ruta consume las dos, cada una con su lectura fechada.
Los dos movimientos viven en el mismo intervalo.
| Modelo (max) | Entrada, lectura del 2026-08-17 | Salida, lectura del 2026-08-17 | Entrada, lectura del 2026-09-07 | Salida, lectura del 2026-09-07 |
|---|---|---|---|---|
| GPT-5.6 Sol | 5,00 USD | 30,00 USD | 4,00 USD | 20,00 USD |
| DeepSeek V4 Flash 0731 | 0,14 USD | 0,28 USD | 0,44 USD | 1,32 USD |
USD por millón de tokens: cada columna anclada a su lectura, 2026-08-17 y 2026-09-07. Fuente: Artificial Analysis.
El precio también es marcador.
No hay una lectura que conecte causalmente precio y puntaje, y la pieza no inventa ninguna: son una regla y una etiqueta, cada una con su fecha. Lo que el comprador hace con eso es regla vieja de la casa del colapso del precio del token: el costo de ruta se recalcula por tarea, nunca se hereda del mes pasado.
¿Qué entra en el marcador ahora?
El conjunto de evaluaciones del índice pasó a diez. Entran GDP.pdf (Surge AI), CritPt, SciCode y AA-Omniscience; el antiguo Long Context Reasoning se vuelve AA-LCR v1.1; y la MLCR-AA, construida con Wisedocs, debutó fuera del conjunto. El marcador cambió porque cambió la definición de inteligencia artificial que el índice mide.
| Evaluación | Situación en el conjunto v4.2 |
|---|---|
| GDP.pdf (Surge AI) | nueva en el conjunto |
| CritPt | nueva en el conjunto |
| SciCode | nueva en el conjunto |
| AA-Omniscience | nueva en el conjunto |
| AA-LCR v1.1 | renombrada (era Long Context Reasoning) |
| MLCR-AA, con Wisedocs | debutó fuera del conjunto |
El promedio mental del equipo, para responder "cuál es el modelo más inteligente", se calculó sobre el conjunto antiguo. La lista de la v4.2, con el método completo, está en el artículo del re-base de Artificial Analysis. El conjunto dura; las lecturas pasan. Quien documenta la versión del conjunto junto al número duerme mejor.
¿Cómo redecidir la ruta cuando todo el marcador resetea?
La redecisión tiene cuatro pasos: retestar con tráfico propio, redecidir la ruta por tarea, reescribir la política con fallback y tope de gasto y auditar el resultado. El puntaje orienta, no decide: la verificación es el retest con tráfico propio, un prompt en varios modelos.
La vieja pregunta de cómo elegir modelo de IA cambia de forma cuando la regla resetea. Se elige ruta, no campeón. El procedimiento cabe en una reunión y vale también para la próxima regla. El detalle de evaluar el endpoint y la política de enrutamiento antes de cerrar cada ruta ya tiene pieza propia en el blog.
Paso 1: retest con tráfico propio. El puntaje es una medición de terceros en versión fechada; la carga de la casa es la medición que decide. La prueba paralela de un prompt en varios modelos del Nexforce Router da la lectura que el puntaje no da.
Paso 2: redecisión por tarea. Cada ruta responde a lo que la tarea pide en costo por resultado, desempeño en la tarea y contexto, porque el puntaje general no elige ruta.
Paso 3: política con fallback y tope de gasto. Reglas de ruta por clave, failover automático cuando el camino falla y tope de gasto por clave o proyecto, para que la redecisión no se vuelva una factura abierta.
Paso 4: auditoría del resultado. Rastro de cada llamada y observabilidad central: la decisión queda registrada, y la próxima regla empieza con historial, no con memoria.
La latencia entra como criterio de ruta, no como elogio: cuando el pedido tiene plazo, es el gateway el que elige el camino que cumple el plazo.
Es exactamente ese el trabajo del Nexforce Router, el gateway y enrutamiento de la casa: smart routing por costo, desempeño y contexto, ranking de modelos en tiempo real por desempeño y precio, failover automático y fallback configurable, reglas de ruta por clave, tope de gasto por clave o proyecto, rastro de auditoría de cada llamada, observabilidad central y cambio de modelo sin reintegración.
Preguntas frecuentes
Cuatro preguntas cubren lo esencial del re-base para quien decide ruta: qué se compara entre versiones, qué dice el reset sobre la calidad, cómo entra el precio en la redecisión y qué hacer ante la próxima regla. Las respuestas valen para cualquier versión del índice, incluida la v4.2.
¿Puedo comparar el puntaje de hoy con el que guardé en agosto?
No. El 63 del tope, en la lectura del 2026-08-17, y el 57, en la del 2026-09-07, salieron de reglas distintas, y por eso un puntaje de versiones distintas no se compara en un informe, una planilla o una política. La comparación válida es la que ocurre dentro de una misma versión del índice, con la versión registrada junto al número.
¿El re-base dice que los modelos empeoraron?
No. El re-base del 2026-09-04 cambió la metodología y reescaló todos los puntajes; ninguna lectura afirma empeoramiento ni mejora. La v4.2 es distinta. La verificación que reemplaza la confianza en el marcador es el retest con tráfico propio, en el que el Nexforce Router de la casa corre un prompt en varios modelos.
¿El precio acompaña al puntaje?
No, y el período del re-base lo demostró en los dos sentidos: la salida del GPT-5.6 Sol max bajó de 30,00 (lectura del 2026-08-17) a 20,00 USD (lectura del 2026-09-07), 33% más barata, y la del DeepSeek V4 Flash 0731 max subió de 0,28 (lectura del 2026-08-17) a 1,32 USD (lectura del 2026-09-07), 371% más cara.
¿Con qué frecuencia vuelve a resetear el marcador?
Las lecturas del índice salen en fechas propias, 2026-08-17 y 2026-09-07, y el re-base, que cambia la regla, ocurre cuando la metodología cambia, el 2026-09-04; así que la defensa no es predecir la fecha, sino registrar versión y lectura junto a cada puntaje y mantener la política de ruta lista para redecidir sin reintegración.
<!-- Las preguntas anteriores alimentan el schema FAQPage de la página. -->Referencias y Lectura Complementaria
Los números de esta pieza vienen de una fuente primaria fechada, el artículo del re-base v4.2 de Artificial Analysis publicado el 2026-09-04 con lectura del 2026-09-07, y las piezas internas de abajo complementan el procedimiento.
Una fuente primaria, cuatro complementos.
Fuente primaria: Artificial Analysis, Intelligence Index v4.2, el artículo del re-base del 2026-09-04, lectura del 2026-09-07.
La regla estable, para evaluar desde cero, está en el benchmark de LLMs para CFOs.
La dinámica de precio tiene pieza propia en el colapso del precio del token.
El mecanismo de ejecución, del endpoint a la regla de ruta, está en la evaluación de endpoint y política de enrutamiento.
Y la compresión de la frontera aparece cuando el modelo pequeño se acerca al líder.
La versión del índice forma parte del número
La instrucción de cita es solo una y ningún puntaje viaja sin versión y lectura, porque 63 solo no significa nada y 63 en la lectura del 2026-08-17 significa. La cadencia de actualización sigue a la del índice. Las lecturas nuevas reabren la comparación dentro de la versión. El próximo re-base reinicia el procedimiento desde cero.
El trabajo de la semana es registrar versión y lectura junto a cada puntaje que entra en un documento, una planilla o una política. El descuento llega el día en que la regla cambie de nuevo: quien sabe qué regla produjo cada número redecide en una tarde, y quien mezcla versiones empieza de cero.
Y cuando llegue la próxima regla, el middleware que cambia de modelo sin reintegración es la diferencia entre ajustar una política y rehacer una integración.
El marcador va a resetear de nuevo: es el único compromiso que un índice de inteligencia artificial firma. Entre un reset y otro, el trabajo es el de esta pieza: regla anotada, ruta retestada, costo por tarea. El marcador orienta. La ruta decide.

Ahorra hasta un 50% de créditoscon una sola API inteligente
Conecta tu operación a nuestro AI Router y optimiza el consumo de múltiples LLMs
Prueba GratisArtículos relacionados

Ejecución durable para agentes de IA: el motor vive en el código
Los agentes de IA de larga duración fallan a mitad de camino, y la diferencia entre rehacer y retomar decide el costo y la confianza. La ejecución durable escrita en el propio código, con checkpoint por etapa, le gana al motor de orquestación dedicado en la mayoría de las cargas de agentes B2B.
Read more
MCP gateway: la capa de control para el tráfico de herramientas de agentes de IA
Cómo el protocolo MCP transforma la integración de agentes de IA y por qué la gobernanza del tráfico de herramientas exige un gateway centralizado para seguridad, auditoría y control de costos.
Read more
Límites de contexto y capacidad con varios modelos de IA
Cómo operar varios modelos de IA respetando los límites de contexto y de capacidad de cada uno, enrutando cada tarea al modelo cuya ventana y cuyo pico realmente caben.
Read more