Índice de Artificial Analysis v4.3: la nueva prueba

El índice de inteligencia artificial que buena parte del mercado usa para decidir qué modelo contratar cambió de instrumento. Artificial Analysis publicó el 2026-09-07 la versión v4.3 del Intelligence Index, con Terminal-Bench subiendo de v2.1 a v4.0, AutomationBench-AA tomando el peso de 5% que era de tau3-Banking y las evaluaciones con tareas o respuestas privadas pasando de 40% a 45% del total. Cuando la regla cambia, el puntaje del mismo modelo deja de ser el mismo número. Un puntaje sin la versión del índice al lado es un número sin regla, y así es como circula en propuestas comerciales, en planillas de compras y en diapositivas de comité.
Por qué importa
Tres de los cambios de la v4.3 son metodológicos, no cosméticos. Terminal-Bench fue reescrito de v2.1 a v4.0, lo que significa que el conjunto de tareas de terminal cambió de contenido; tau3-Banking salió del índice y AutomationBench-AA entró heredando el peso de 5%; y el bloque de evaluaciones con tareas o respuestas privadas ganó cinco puntos porcentuales.
Nada de eso altera el comportamiento del modelo.
Altera lo que el número mide.
El efecto práctico es directo para quien compra. Si su política de enrutamiento fue calibrada con un puntaje v4.2, fue calibrada con otro instrumento. Un modelo que subió tres puntos entre la lectura anterior y la actual puede haber subido por mérito propio, por una tarea más fácil en el nuevo banco de pruebas, o por una composición de pesos diferente. Artificial Analysis publica la versión junto al número justamente por eso; quien replica el número sin la versión es el que rompe la serie.
La comparabilidad es el activo que una base de evaluación tarda años en construir y que un rebase devuelve en un día. No es un defecto de la v4.3. Es el costo de corregir un instrumento que quedó desactualizado, y la cuenta llega para quien trató el puntaje como una constante.
Qué cambió exactamente en el índice v4.3
La lectura del 2026-09-14 de la fuente primaria registra cuatro alteraciones en el instrumento. Terminal-Bench cambia de versión mayor, tau3-Banking sale de la composición y AutomationBench-AA toma el peso de 5% que era suyo. Y el peso agregado de evaluaciones con tareas o respuestas privadas sube de 40% a 45%.
El cuarto ítem de la lista es el que más altera la naturaleza de la medición, y vale abrirlo en dos partes. AutomationBench-AA es nuevo y entra con un conjunto privado de tareas.
| Banco de pruebas | Versión anterior | v4.3 | Naturaleza del cambio |
|---|---|---|---|
| Terminal-Bench | v2.1 | v4.0 | Versión mayor: el conjunto de tareas de terminal se reescribe |
| tau3-Banking | presente, peso 5% | sale del índice | AutomationBench-AA toma el peso de 5% que era suyo |
| AutomationBench-AA | no existía | nuevo, peso 5% | Benchmark agéntico de automatización de workflow, construido con Zapier, 657 ítems en conjunto privado de tareas held-out, versión 1.0.6 |
| Evaluaciones con tareas o respuestas privadas | 40% | 45% | Peso agregado mayor, consecuencia de que el conjunto privado de tareas entra |
Cada fila merece una frase. Terminal-Bench mide ejecución en entorno de línea de comandos, y el paso a v4.0 cambia el contenido de la prueba, no el modelo que la rinde. tau3-Banking sigue existiendo como evaluación; lo que pasó es que dejó de componer este índice, y AutomationBench-AA heredó su porción. AutomationBench-AA cobra automatización de flujo de trabajo en seis dominios: Finance, HR, Marketing, Operations, Sales y Support. Y el peso privado mayor es la consecuencia aritmética de que haya entrado un conjunto privado de tareas en lugar de un banco de pruebas público.
Un conjunto privado de tareas held-out, y por qué cambia la medición
Un conjunto privado de tareas held-out es un conjunto de prueba que no circula públicamente. La ganancia es medir generalización en vez de medir familiaridad. Cuando el conjunto es público, un laboratorio puede entrenar contra él, y el puntaje sube por sobreajuste a la prueba, no por capacidad.
El detalle que sostiene esa ganancia es operativo: el conjunto no aparece en material de entrenamiento ni en banco de optimización. Con un conjunto privado de tareas de 657 ítems, esa ruta queda cerrada. Es la misma lógica que ya apareció cuando tres evaluaciones agénticas cambiaron la elección de modelo para agentes, y vale registrar lo que no resuelve.
AutomationBench-AA fue construido en colaboración con Zapier y las tareas son de automatización de workflow del mundo real. Zapier es dueña del conjunto, y eso es parte del diseño del instrumento, no patrocinio del resultado: quien escribe las tareas necesitaba flujos de trabajo reales, y Zapier opera esos flujos en producción. Artificial Analysis mantiene la evaluación y reporta los números. Son roles separados, y la distinción importa para quien lee el resultado con escepticismo saludable.
El rigor del diseño aparece en un detalle que suele pasar inadvertido. El benchmark reporta dos medidas distintas. El Score es el promedio de la fracción de objetivos completados por tarea, y es esa la métrica que entra en el Intelligence Index; cualquier violación de guardrail anula esa tarea, lo que es una decisión de diseño y no un detalle de ejecución, porque descarga en cero todo un trabajo que avanzó. El Tasks Completed es la fracción de los flujos de trabajo en que todos los objetivos se completaron sin ninguna violación de guardrail. La fuente declara que completar todo respetando los guardrails sigue siendo más difícil que completar parte del flujo. Leer las dos medidas como si fueran una sola es el error clásico de quien cita benchmark de memoria: la diferencia entre ellas es exactamente lo que la evaluación quiere medir.
Hay un límite honesto en este tipo de conjunto. Un conjunto privado de tareas reduce la optimización contra la prueba, pero no elimina el riesgo de que el conjunto envejezca. 657 tareas describen bien los flujos de trabajo de hoy y van a describir peor los de 2027. Ningún benchmark held-out es permanente, lo que es un motivo más para citar la versión junto al número.
Qué hace el cambio de banco de pruebas con la serie histórica
Un puntaje v4.2 y un puntaje v4.3 del mismo modelo no comparten la misma regla. La pregunta que el comprador necesita hacerse cambió de "cuál es el mejor modelo" a "mejor en relación con cuál instrumento", y no es retórica: es la diferencia entre una decisión reanclada y una decisión heredada.
Dos bancos de pruebas alterados y un bloque de peso privado mayor bastan para invalidar la comparación directa entre las dos lecturas, aunque el nombre del modelo sea idéntico en las dos filas de la tabla. Fue exactamente ese el problema que la pieza sobre el rebase v4.2 y la reelección de elección planteó, y la v4.3 no lo resolvió: lo repitió en otro lugar del instrumento.
El punto vale decirlo sin rodeos: un puntaje es medición de tercero en versión fechada, nunca verdad de producción verificada. Fue producido por un instrumento con fecha, bajo una composición de pesos que está publicada, sobre tareas que usted no vio ejecutar en su carga. Eso no descalifica el índice. Es, hoy, la referencia pública más consistente para posicionar modelos, y la alternativa es decidir a ciegas. Lo que no es, es un certificado sobre su caso.
La consecuencia de gobernanza es incómoda y necesaria. Todo documento interno que cita un puntaje necesita cargar la versión del índice junto a él, como ya carga la fecha de la cotización del dólar. Un requisito que dice "modelo por encima de 50 en el Intelligence Index" envejece mal y va a ser reinterpretado por alguien en tres meses. Un requisito que dice "por encima de 50 en la v4.3, verificación prevista para la próxima versión" sobrevive a la auditoría.
Qué muestra el nuevo índice, y qué no decide
La lectura v4.3 del 2026-09-14 coloca a Claude Fable 5.1 (max with fallback) y GPT-6 Astra (max) empatados en la cima, con 53. Enseguida vienen Claude Opus 5 (max) con 51, Claude Fable 5 (with fallback) con 50, Muse Spark 1.3 (max) con 48 y GPT-5.6 Sol (max) con 47.
Nada de eso es permanente. Son lecturas fechadas, no ranking, y la próxima versión del índice puede reordenar esa lista sin que ninguno de los modelos haya cambiado. La cima del índice, además, ya fue leída como estructura y no como tabla: fue lo que produjo la fotografía del fin del duopolio de modelos, que sigue valiendo como retrato de mercado y sigue sin decir nada sobre el instrumento que produjo los números.
En Terminal-Bench v4.0, GPT-6 Astra (max) marca 59,1% de pass@1 sobre 66 tareas corridas tres veces cada una, contra 52,0% de Claude Fable 5.1 y 49,0% de Claude Opus 5. El intervalo de 7,1 puntos entre el primero y el segundo es grande para un banco de pruebas del mismo tipo, y vale recordar que fue medido en el instrumento nuevo: la distancia no es comparable con ninguna distancia publicada en la v2.1.
Los dos primeros del índice tienen el mismo puntaje y costos por tarea que no se parecen. GPT-6 Astra (max) aparece a US$ 3,26 por tarea y Claude Fable 5.1 (max with fallback) a US$ 7,63, una diferencia de 57% con puntaje idéntico en el índice. Más abajo, GLM-5.3-Flash y GPT-5.6 Terra (max) empatan en 42 a US$ 0,25 y US$ 1,40 por tarea, respectivamente: GLM-5.3-Flash cuesta 18% del par. Son consecuencias visibles de un instrumento que ahora pesa más evaluación con tarea privada, y la lectura que interesa es de instrumento: el costo por tarea del índice es el promedio de un conjunto de tareas que no es el suyo, así que sirve para levantar la hipótesis de ruta, nunca para cerrarla.
Qué cambia esto para quien enruta modelos
La consecuencia operativa es un procedimiento, y es corto. Quien enruta modelos debería tratar un rebase de índice como trataría un cambio de esquema: identifica lo que se rompió, revalida lo que importa y sigue con la política ajustada, sin rehacer todo el análisis de proveedor.
El trabajo no es rehacer todo el análisis de proveedor. Es reanclar las decisiones que estaban apoyadas en el puntaje, y la guía de evaluación con la regla estable sigue siendo el punto de partida para quien va a rehacer la cuenta.
- Anote la versión del índice junto a todo puntaje que circule internamente. Requisito de licitación, justificación de compra, comparación de proveedor. Un puntaje sin versión es un número huérfano, y va a ser citado fuera de contexto por alguien que no tiene cómo saber de dónde vino.
- Trate la serie v4.2 como cerrada, no como tendencia. No calcule la variación entre el puntaje anterior y el actual del mismo modelo como si fuera ganancia o pérdida de capacidad. Si la diferencia importa para la decisión, el camino es reejecutar en el instrumento nuevo, no restar las dos lecturas.
- Re-teste con su tráfico antes de redecidir la ruta. Un conjunto privado de tareas con 657 ítems mide automatización de workflow en general. Su flujo de trabajo no está en ese conjunto. La prueba paralela, con el mismo prompt en varios modelos, resuelve en horas lo que la discusión de puntaje no resuelve en semanas.
- Escriba la política por tarea, con fallback y techo. Un puntaje único no sostiene una decisión de enrutamiento. Lo que la sostiene es regla de ruta por clave para cada clase de tarea, con fallback configurado para cuando el proveedor primario falle y un techo de gasto por clave, por proyecto, para que el cambio de ruta no se convierta en sorpresa al cierre del mes.
- Mantenga el rastro de auditoría de cada llamada. Cuando llegue el próximo rebase, y llega, el historial de ejecución real vale más que cualquier comparación de puntaje público. Es el único dato que responde "cómo se comportó el modelo en mi carga, bajo mi política".
- Reagende la revisión de la política para la próxima versión del índice. La v4.3 es la regla de hoy. Fechas de revisión atadas a un número de versión vencen solas y no dependen de que alguien recuerde.
Aquí es donde entra el Nexforce Router, y entra por el motivo aburrido. Ninguna de esas seis acciones exige cambiar de proveedor de modelo. Todas exigen una capa que quede entre la aplicación y los proveedores, y es la misma capa que los criterios de evaluación de un LLM gateway describen antes de la contratación. El Router es un gateway de LLM con enrutamiento inteligente por costo, desempeño, latencia y contexto, prueba paralela de un prompt en varios modelos, ranking de modelos en tiempo real por desempeño y precio, failover automático y fallback configurable, reglas de ruta por clave y techo de gasto por clave o por proyecto. Mantiene observabilidad central y un rastro de auditoría de cada llamada, y cambia de modelo sin reintegración, que es lo que permite redecidir una ruta sin abrir un proyecto de ingeniería.
El punto de honestidad: el Router no decide qué significa el índice v4.3 para su caso, y no tiene cómo. Le deja medir. La próxima vez que Artificial Analysis reescriba el instrumento, quien tenga la prueba paralela montada reancla la política en una tarde. Quien tenga el puntaje pegado en la planilla va a redescubrir la diferencia entre citar un número y decidir con base en él.
Preguntas frecuentes sobre el índice de Artificial Analysis v4.3
¿Qué cambió en el índice de inteligencia artificial en v4.3? Artificial Analysis publicó la v4.3 el 2026-09-07 con cuatro alteraciones: Terminal-Bench sube de v2.1 a v4.0, tau3-Banking sale del índice, AutomationBench-AA entra y toma el peso de 5% que era de tau3-Banking, y las evaluaciones con tareas o respuestas privadas pasan de 40% a 45%.
¿Qué es el AutomationBench-AA? Es un benchmark agéntico de automatización de workflow, en la versión 1.0.6, construido por Artificial Analysis en colaboración con Zapier sobre un conjunto privado de tareas held-out de 657 ítems, en Finance, HR, Marketing, Operations, Sales y Support. Cualquier violación de guardrail anula la tarea, y toma el peso de 5% que era de tau3-Banking.
¿Por qué puntajes de versiones diferentes del índice no se comparan? Porque el instrumento cambió. Dos bancos de pruebas fueron cambiados o reescritos y el peso de las evaluaciones con tareas o respuestas privadas subió de 40% a 45%. El mismo modelo medido en la v4.2 y en la v4.3 no fue medido por la misma regla, así que la diferencia entre las dos lecturas mezcla cambio de modelo con cambio de prueba.
¿Un conjunto privado de tareas es confiable? Es más resistente a la optimización contra la prueba que un conjunto público, porque el contenido no circula y no entra en banco de entrenamiento. Confiable no significa definitivo: un conjunto privado de tareas held-out de 657 ítems describe bien los flujos de trabajo de hoy y envejece como cualquier conjunto. La lectura correcta es la de instrumento fechado, con la versión citada.
¿Qué hago con el puntaje del índice en mi política de ruta? Úselo como punto de partida, nunca como respuesta final. Re-teste con su tráfico en prueba paralela, escriba la regla por tarea, configure fallback y techo de gasto, y mantenga el rastro de auditoría de cada llamada. Con cada nueva versión del índice, reancla la política con sus propios datos en vez de recalcular la diferencia entre puntajes.
Referencias y lecturas complementarias
- Artificial Analysis, "Announcing the Artificial Analysis Intelligence Index v4.3", publicado el 2026-09-07. artificialanalysis.ai
- Zapier, página de benchmarks de la empresa, que confirma el conjunto de tareas held-out de propiedad de Zapier usado por AutomationBench-AA. zapier.com/benchmarks
- El ranking de modelos de IA se reseteó: qué cambia en la elección, la pieza hermana sobre el rebase v4.2 y la reelección de ruta. nexforce.ai
- Intelligence Index 2026: el fin del duopolio de modelos de IA, la fotografía estructural de quién está en la cima del índice. nexforce.ai
- Tres evaluaciones agénticas cambian cómo elegir modelos para agentes, sobre qué hacer cuando el conjunto de evaluaciones cambia. nexforce.ai
- Benchmark LLM: cómo evaluar y elegir el modelo correcto, la guía de evaluación con la regla estable. nexforce.ai
- Cómo evaluar y elegir un LLM gateway, los criterios que importan antes de contratar la capa de enrutamiento. nexforce.ai
Qué observar en la próxima versión
La v4.3 es la regla de hoy y va a ser sustituida, probablemente antes de lo que la mayoría de las políticas de ruta internas prevé. La señal a seguir no es la posición de un modelo específico: es la nota de metodología que Artificial Analysis publica junto a cada versión. Mientras siga abriendo el peso de los bancos de pruebas y el tamaño de los conjuntos privados, el número sigue siendo auditable. El día en que la nota venga más corta, ahí es cuando la decisión de ruta se vuelve más difícil, porque la regla empieza a cambiar sin explicación pública. Y ahí nadie sabe qué cambió.
Para quien corre modelos en producción, la conclusión práctica cabe en una línea: trate el índice como instrumento fechado, no como veredicto. Cite la versión, re-teste con su tráfico, y mantenga el enrutamiento en una capa donde cambiar de modelo cuesta una configuración y no un proyecto. Las tres primeras semanas después de un rebase son las más caras para quien decidió con el puntaje viejo y no lo sabía.
Los modelos entran y salen de la cima del índice con una frecuencia que ya no sorprende a nadie. Lo que cambia despacio es el instrumento, y es por eso que la v4.3 merece más atención que la posición de cualquier modelo en la lista. Cuando la regla cambia, quien tenía el número memorizado necesita reaprender a medir.

Acelera la eficienciaoperativa de tu negocio
Diseñamos tecnología de nivel global para impulsar escala del negocio
Hablar con un EspecialistaArtículos relacionados

Google lanza Gemini 3.8 Live y 3.8 Live Extended Thinking: razonamiento paralelo en voz
Google presenta Gemini 3.8 Live y 3.8 Live Extended Thinking con razonamiento paralelo y ejecución asíncrona de herramientas en conversaciones de voz continuas.
Read more
TypeSafe lanza Jev: el modelo que no genera texto
TypeSafe lanzó Jev, un modelo que prescinde de la generación de texto y devuelve decisiones con probabilidad calibrada. Por qué alimenta el enrutamiento LLM.
Read more
Anthropic pide frenar la IA; Trump y Pekín lo rechazan
El 14 de septiembre de 2026, Trump y Pekín rechazaron el plan de frenar la frontera de la IA. Sin coordinación, la ruta de modelos pasa a ser una elección de cumplimiento.
Read more