TypeSafe lanza Jev: el modelo que no genera texto

El 15 de septiembre de 2026, TypeSafe, el laboratorio de Diogo Almeida, salió del modo sigiloso y publicó el primer System One Model de la casa, llamado Jev. Jev no genera texto. Elige una respuesta entre opciones definidas de antemano y devuelve un valor estructurado con probabilidad calibrada, a US$ 0,042 por millón de tokens de entrada, con tokens de salida gratuitos, según el anuncio oficial de los System One Models. El mismo anuncio describe el resultado como una "llamada a función de inteligencia de frontera". La implicación que importa para quien compra inferencia: Jev no es un LLM más barato, es una clase de modelo diferente, y entra en la fila antes de la llamada generativa.
Lo que TypeSafe anunció el 15 de septiembre
TypeSafe es un laboratorio fundado por Diogo Almeida, investigador que firmó el paper de InstructGPT en 2022, el método de ajuste por preferencia humana que está en la base de ChatGPT, publicado en 2022 en arXiv. Jev es el primer modelo de la empresa y el primero de una clase que ellos llaman System One. El nombre de la clase rinde homenaje a la división de Daniel Kahneman entre pensamiento rápido y pensamiento lento, y el nombre del modelo rinde homenaje a William Stanley Jevons, el economista de The Coal Question (1865) que describió la paradoja hoy conocida por su apellido.
Lo que Jev hace diferente es la salida. Un LLM generativo recibe una instrucción en lenguaje natural y devuelve texto en lenguaje natural, y transformar ese texto en algo que el software pueda consumir queda a cargo de quien escribió el código: extraer el campo, validar el formato, tratar el caso en que el modelo escribió una frase donde el programa esperaba un número. Jev acepta la pregunta en lenguaje natural, pero la respuesta se elige entre opciones definidas antes de la llamada, y sale como un valor estructurado acompañado de una probabilidad.
De ahí viene la afirmación de que "no puede alucinar". TypeSafe sostiene que el modelo no puede inventar una salida porque todo el espacio de respuestas posibles se define de antemano. Es una alegación del proveedor, pública y fechada, y el artículo la registra como tal. Desde el punto de vista técnico, el anuncio describe un sampler paralelo y un método de entrenamiento bautizado como RLCD, Reinforcement Learning for Calibrated Decisions, en el que la confianza declarada debe coincidir con la frecuencia observada de acierto.
Los números de precio y latencia son del proveedor, en el mismo anuncio. Son US$ 0,042 por millón de tokens de entrada, o US$ 42 por mil millones, con tokens de salida gratuitos. La latencia de extremo a extremo se sitúa entre 70 ms y 500 ms, lo que la empresa posiciona como 40 a 200 veces más rápido que los LLM de frontera. La página de inicio de TypeSafe, verificada el 17 de septiembre, añade 193,6 veces más rápido y 444,6 veces más barato en evaluaciones de workflow. Estos dos últimos números son una declaración del proveedor, no una medida independiente, y valen lo que vale cualquier benchmark de página de lanzamiento.
Lo que existe de verificación fuera de la empresa es una prueba de un medio. El 15 de septiembre, Every publicó un experimento que ejecutó Jev sobre textos del propio autor: 777 juicios en menos de 0,7 segundos, por una estimación de un cuarto de centavo. La mediana fue de 0,35 segundos por pasada frente a 8,83 segundos de un LLM de frontera, y Jev detectó 6 de los 7 defectos plantados, frente a 7 de 7 del comparativo. El autor de la prueba registra la salvedad. La cobertura del 86% de los defectos, con una pasada donde el comparativo acertó todo, es la evidencia independiente disponible hoy, y es pequeña.
TypeSafe describe los casos de uso en una lista corta y específica: condicionales inteligentes, clasificación, enrutamiento, puntuación, extracción de campos, detección de jailbreak y operaciones de map-reduce sobre grandes bases de datos. Es un trabajo de decisión repetida, no de redacción.
Por qué la clase importa más que el multiplicador
La parte relevante del lanzamiento no es el 193,6 de la página de inicio. Es la palabra "clase". Todo modelo que este blog ha cubierto hasta hoy pertenece a la misma curva: recibe texto, devuelve texto, y el comprador compara precio por millón de tokens, posición en índice de inteligencia o costo por tarea concluida. La comparación de costo por tarea solo tiene sentido porque todos los candidatos son generativos. Jev está fuera de esa curva por construcción, y un modelo que no pertenece a la curva no se mide por ella.
El número que sustenta esto es el precio. A US$ 0,042 por millón de tokens de entrada, con salida gratuita, la llamada de decisión cuesta una fracción pequeña de la llamada generativa, y responde en decenas o cientos de milisegundos en lugar de segundos. Esto no convierte a Jev en un competidor del LLM de frontera; lo convierte en candidato para una etapa diferente del mismo flujo. Clasificar una solicitud antes de elegir qué modelo la atiende, determinar si un prompt es un intento de jailbreak, puntuar la relevancia de un fragmento antes de enviarlo al contexto, todo esto hoy se hace con el modelo más caro de la casa, porque es el que está integrado.
La lectura correcta del nombre también merece una línea. Jevons describió el consumo de carbón reaccionando a una ganancia de eficiencia por el aumento del uso, y el nombre es elección del propio proveedor. Si la decisión se vuelve 40 veces más barata, el diseño del sistema que ejecuta una decisión por solicitud puede ejecutar diez decisiones por solicitud. Si este efecto aparece, la cuenta de inferencia de quien adopte el modelo no disminuye. Cambia de forma.
Vale la pena ser precisos sobre lo que queda por probar, porque es aquí donde el artículo se separa del material de lanzamiento. La probabilidad calibrada es una promesa verificable, y la verificación tiene una forma exacta: de 100 casos en los que el modelo marca 0,9, aproximadamente 90 deben ser positivos.
Nada en el anuncio prueba esta propiedad en la carga de un comprador específico, y la única medición de terceros disponible cubre 777 juicios de un solo medio, con la salvedad ya registrada. A esto se suma que el modelo no está indicado para eventos raros, lo que significa que la confianza declarada en un caso aislado no decide nada. Lo que decide es la proporción, medida en el historial del propio comprador.
Hay un límite de datos en el camino de quien vaya a probar. TypeSafe no publica, en el anuncio, una comparación de calidad tarea a tarea contra los modelos de frontera, y Jev está en acceso anticipado. Ningún volumen de búsqueda fue medido para "TypeSafe" o "Jev" en esta ejecución: la herramienta de keywords estaba indisponible, por lo que la demanda de reconocimiento de estos dos nombres es una incógnita declarada, no un número.
Lo que cambia en la práctica
El cambio es de dirección de la decisión. Lo que era una instrucción en lenguaje natural dentro de un prompt, evaluada por el mismo modelo que escribe la respuesta final, pasa a ser una llamada propia, con contrato de entrada y salida y con un número de confianza anexado al resultado.
| Dimensión | Antes de Jev | Con la clase de decisión en la arquitectura |
|---|---|---|
| Salida consumida por el software | Texto en lenguaje natural, tratado por quien escribió el código | Valor estructurado con probabilidad, consumido directamente |
| Tratamiento de error | Validación de formato y repetición de la llamada | Proporción de confianza como base del diseño, con rango declarado |
| Cobertura de opciones | Cualquier respuesta que el modelo decida escribir | Solo las opciones definidas antes de la llamada |
| Costo unitario de la decisión | Precio del modelo de frontera, con salida cobrada | US$ 0,042 por millón de entrada, salida gratuita (proveedor) |
| Latencia de la decisión | Orden de segundos | 70 ms a 500 ms (proveedor) |
| Rol del enrutador | Elegir el modelo que atiende la solicitud | Elegir el modelo y decidir cuándo la llamada barata responde antes |
| Métrica de seguimiento | Precio por millón de tokens | Dos métricas, porque los modelos cobran de formas diferentes |
Lea la última línea con atención. El costo por millón de tokens no describe un modelo que cobra por entrada e ignora la salida. Quien tenga solo la hoja de cálculo de precio por token medirá la mitad generativa de la cuenta y atribuirá a Jev un costo que no tiene, o lo contrario. La capa que aplica política por clave, límite de gasto y seguimiento de llamadas necesita aprender a medir ambas cosas en el mismo panel, porque la decisión de dónde gastar pasa a depender de la comparación entre dos unidades diferentes.
Vale la pena situar a Jev junto al vecino más cercano que la casa ya ha cubierto. Mercury 2.5, un LLM de difusión, tampoco es un transformer autorregresivo, y este artículo mostró que una arquitectura fuera del estándar cambia la economía de servir. La diferencia de grado entre los dos casos es grande. Mercury sigue siendo un generador de texto por otro camino; Jev abandona el texto. Por eso no entra en ningún ranking de calidad de respuesta, y el índice de frontera no tiene dónde colocarlo.
La prueba independiente de Every muestra la otra cara de la misma moneda. Juzgar 777 fragmentos de texto en menos de 0,7 segundos es un tipo de carga que hoy nadie ejecuta en producción, porque el costo prohibitivo decide antes de la arquitectura. Cuando el costo unitario cae a un cuarto de centavo en la estimación del medio, la carga pasa a existir. Es el mismo argumento que sustenta la evaluación de agentes más allá de la respuesta final: medir durante la tarea exige un juez lo suficientemente barato como para ejecutarse muchas veces.
Qué hacer ahora
El trabajo es de arquitectura, no de adquisición. Jev está en acceso anticipado y nada de lo aquí expuesto es una recomendación de compra. Las cinco decisiones a continuación son las que cambian de forma cuando una clase de decisión entra en la fila, y la segunda es la que suele atascarse.
- Liste las decisiones que hoy viajan dentro de un prompt. Clasificación, selección, puntuación, extracción de campo y elección de herramienta son las candidatas. Si la respuesta esperada es una entre un conjunto cerrado, la etapa es de decisión y no de redacción.
- Defina la proporción de confianza aceptable antes de probar el modelo. El diseño es por proporción, no por caso aislado: de 100 casos marcados con 0,9, cuántos positivos tolera su proceso. Sin este número escrito, la prueba no tiene criterio de aceptación y se convierte en una demostración.
- Mida la decisión y la generación en el mismo panel. Rastrear la llamada de LLM con modelo, costo y latencia por solicitud es lo que permite comparar las dos unidades. Dos hojas de cálculo separadas producen dos conclusiones contradictorias sobre la misma cuenta.
- Trate la política de ruta como un lugar donde cabe más de un tipo de llamada. El enrutador sigue eligiendo qué LLM generativo atiende cada solicitud; también puede decidir cuándo la respuesta barata de decisión resuelve antes de gastar la llamada cara. La capa de enrutamiento dentro de un gateway de LLMs es donde esta política vive con alcance por clave.
- Relea el diseño de la regla cuando un modelo no generativo entra en la lista. Lo que la decisión de ruta con evidencia de tráfico real exige es un registro por llamada. Una clase nueva de modelo obliga a revisar qué campos necesita cargar el registro, porque la probabilidad calibrada no es un campo que existiera antes.
El orden importa, porque la acción 3 depende de la 4 y la 4 depende de la 1. Quien empieza midiendo sin tener la lista de decisiones termina optimizando la etapa que no era el cuello de botella.
Preguntas frecuentes
¿Jev sustituye a un LLM de frontera?
No. Por construcción, no genera texto, por lo que no atiende ninguna tarea que exija redacción, resumen o razonamiento abierto. Entra como una llamada anterior, de decisión, para clasificar, puntuar, seleccionar o elegir una herramienta antes de que se realice la llamada generativa. La política de ruta pasa a tener dos tipos de llamadas para posicionar.
¿Qué significa "no puede alucinar" en este caso?
Es la afirmación del proveedor, registrada como tal. La alegación es estructural: el modelo solo elige entre opciones definidas antes de la llamada, por lo que no existe espacio para inventar una salida que no estuviera en la lista. Esto no es lo mismo que acertar siempre. Elegir la opción incorrecta dentro del conjunto sigue siendo posible, y para eso existe la probabilidad calibrada.
¿Qué es la probabilidad calibrada, en la práctica?
Es una promesa verificable: de 100 casos en los que el modelo marca 0,9, aproximadamente 90 deben ser positivos. La verificación se realiza en el historial del propio comprador, acumulando los casos y comparando la confianza declarada con la tasa de acierto observada. TypeSafe publicó el RLCD como método de entrenamiento para esta propiedad, y el modelo no está indicado para eventos raros.
¿Jev es más barato que los modelos que uso hoy?
El precio divulgado es de US$ 0,042 por millón de tokens de entrada, con tokens de salida gratuitos, y es una declaración del proveedor. La comparación directa con un LLM generativo no es válida, porque las unidades son diferentes: uno cobra entrada y salida en lenguaje natural, el otro cobra entrada para devolver un valor estructurado. Lo que se compara es el costo por decisión resuelta, medido en su carga.
¿Se verificaron los números de 193,6x y 444,6x?
No por terceros. Ambos provienen de la página de inicio de TypeSafe, en evaluaciones de workflow de la propia empresa. La única medición independiente disponible es la prueba de Every del 15 de septiembre, con 777 juicios en menos de 0,7 segundos, y esta incluye la salvedad del propio autor: Jev detectó 6 de los 7 defectos plantados, frente a 7 de 7 del comparativo.
Referencias y Lectura Complementaria
- TypeSafe, 15 de septiembre de 2026: Introducing System One Models and Jev, fuente primaria del evento.
- TypeSafe, página de inicio, verificada el 17 de septiembre de 2026, origen de las alegaciones de 193,6x y 444,6x, declaración del proveedor.
- Every, 15 de septiembre de 2026: Jev juzgó todo lo que escribí en 0,7 segundos, entrevista técnica con Diogo Almeida y la prueba independiente con las salvedades del autor.
- InstructGPT, Ouyang et al., 2022, el método en el que Diogo Almeida trabajó antes de ChatGPT.
- Costo por tarea en el enrutamiento de modelos de IA, la unidad de costo que cambia cuando la salida es gratuita.
- Decidir la ruta de un LLM con evidencia de tráfico real, la evidencia que una llamada de decisión produce de forma nativa.
- Evaluación de agentes más allá de la respuesta final, el juez lo suficientemente barato como para ejecutarse varias veces durante la tarea.
- LLM de difusión: lo que Mercury 2.5 cambia en el enrutamiento, la otra clase fuera del transformer autorregresivo que ya ha entrado en el blog.
- Nexforce Router, la capa de enrutamiento multimodelos con una API.
Qué observar en el próximo trimestre
Dos fechas organizan la lectura. La primera es la salida del acceso anticipado, porque es cuando el precio y la latencia divulgados pueden ser medidos por quienes no son TypeSafe. La segunda es la publicación de números de terceros sobre la calibración, porque es la única propiedad de Jev que se verifica sin depender de la confianza en el proveedor.
Vale la pena separar lo que el lanzamiento prueba de lo que promete. Prueba que existe un modelo en producción con salida estructurada, opciones cerradas y precio por entrada, y esto ya es una clase nueva en el estante. Promete calibración y velocidad en cargas que nadie ha medido desde fuera aún. La distancia entre ambas cosas es lo que el próximo trimestre resolverá, y es bueno seguirla de cerca porque afecta directamente la cuenta de quien ejecuta inferencia en volumen.
La pregunta que queda no es qué modelo es mejor, sino quién pasa a decidir qué es una decisión y qué es una redacción. Mientras esa frontera era fija, el criterio de optimización era único, el precio por token. Con una clase que solo decide, el criterio pasa a ser doble, y cada flujo necesita decir cuántas decisiones baratas caben antes de una llamada carísima.
El Nexforce Router es la capa donde este criterio doble se convierte en regla ejecutable: más de 300 modelos detrás de una única API compatible con OpenAI, con enrutamiento por costo, rendimiento, latencia y contexto, failover automático entre proveedores, budget por clave y rastro de llamada auditable. Cuando una clase de modelo entra en el estante midiendo una unidad diferente, la política de ruta es lo que decide si la novedad se convierte en ahorro real o simplemente en otra integración sin dueño.
Leyenda: la misma carga evaluada en dos clases de llamada, decisión y generación. Diagrama técnico Nexforce, 17 de septiembre de 2026.

Acelera la eficienciaoperativa de tu negocio
Diseñamos tecnología de nivel global para impulsar escala del negocio
Hablar con un EspecialistaArtículos relacionados

Google lanza Gemini 3.8 Live y 3.8 Live Extended Thinking: razonamiento paralelo en voz
Google presenta Gemini 3.8 Live y 3.8 Live Extended Thinking con razonamiento paralelo y ejecución asíncrona de herramientas en conversaciones de voz continuas.
Read more
Anthropic pide frenar la IA; Trump y Pekín lo rechazan
El 14 de septiembre de 2026, Trump y Pekín rechazaron el plan de frenar la frontera de la IA. Sin coordinación, la ruta de modelos pasa a ser una elección de cumplimiento.
Read more
LLM de difusión: Mercury 2.5 y el enrutamiento de modelos
Mercury 2.5, el mayor LLM de difusión entrenado hasta la fecha, entrega 1.107 tokens por segundo a US$0,20 por millón de tokens de entrada y desplaza la decisión de ruta del costo por token al costo por tarea completada.
Read more