Tencent Hy4 preview: el nuevo 770B open-source y qué cambia en el costo de encaminar

49B activos de 770B totales es el número que usted paga
El 28 de agosto de 2026, Tencent abrió los pesos de Hy4 preview, un MoE con 770B de parámetros totales y solo 49B activos por token, licencia Apache 2.0 y contexto de 1M de tokens, según la fuente primaria en GitHub. La implicación para quien encamina cargas de trabajo de LLM: cada solicitud paga solo 49B de cómputo, no los 770B.
El número que decide la cuenta en la inferencia es el activo, no el total. El total es ficha; el activo es la cuenta. Un CTO que lee la ficha como "770B de parámetros, luego caro de servir" está mirando la métrica equivocada, y es exactamente eso lo que esta release cambia en la pauta de selección de modelo.
Qué ocurrió en el lanzamiento de Hy4 preview
Hy4 preview es el nuevo modelo insignia del Tencent Hy Team, anunciado oficialmente el 2026-08-28 en el README de GitHub, con ficha completa en Hugging Face. Es una arquitectura Mixture-of-Experts (MoE) cuya decisión de costo reside en la densidad de activación. Los datos publicados:
- 770B de parámetros totales, 49B activos por token.
- 78 capas: la primera densa, las 77 siguientes MoE, cada una con 256 expertos encaminados y 1 experto compartido. Cada token activa los top-8 expertos encaminados y el experto compartido.
- 1 capa nativa MTP (10B totales, 0.7B activados) para speculative decoding.
- Atención Gated DeepSeek Sparse Attention (Gated DSA) con IndexCache, arquitectura inspirada en DeepSeek y GLM.
- Contexto de 1M de tokens.
- Licencia Apache 2.0, con pesos abiertos.
- Disponibilidad en Hugging Face, ModelScope, GitCode y CNB, en dos variantes:
Hy4 previewyHy4 preview-FP8.
El despliegue usa las recetas oficiales de vLLM y SGLang, con imágenes prebuilt vllm/vllm-openai:hy4-preview y lmsysorg/sglang:hy4-preview. La API es compatible con OpenAI y Tencent publica parámetros recomendados: temperature=0.9, top_p=1.0, con modo de razonamiento por defecto "alto" (cadena de pensamiento profunda) y la opción no_think para respuestas directas.
Los beneficios que Tencent nombra son de productividad, no de toy benchmark: ingeniería de software en tareas de horizonte largo, office y análisis (artefactos, hojas de cálculo, modelos financieros), game development del prompt al prototipo e investigación científica.
En la evaluación ciega, Tencent usó 163 expertos internos en 203 tareas. Hy4 preview quedó ligeramente por delante de GLM 5.3 (2.99 vs 2.92, con 46,8% de victorias) y de Kimi K3 (2.99 vs 2.94, con 51,2% de victorias). Esos números pertenecen al proveedor y miden preferencia humana interna, no una marca objetiva de costo o latencia, así que la lectura correcta es de posicionamiento, no de veredicto.
Tencent declara limitaciones directas: es una versión temprana, con headroom real en pre y post-entrenamiento, y tendencia a sobre-razonar y sobre-verificar el propio trabajo en tareas complejas. Tenga presente el factor a la hora de medir en producción.
Por qué 49B activos importan para el costo de inferencia
En un MoE, cada solicitud solo ejecuta la tajada activada de parámetros. La cuenta de cómputo por token la deciden los 49B, no los 770B. Es por eso que la ficha de Hy4 preview rompe la intuición clásica: un modelo gigante no es necesariamente un modelo caro de servir cuando la densidad de activación es baja.
El número es la razón activaciones/total: 49B sobre 770B es cerca de 6,4%. En inferencia self-hosted, el costo incremental por token está fuertemente determinado por la capacidad activada por token, por la latencia de atención y por el hardware en que usted sirve. Los 770B aún deciden el tamaño de memoria para cargar los pesos y el costo de inicialización, pero es el 49B el que recorta el precio de cada request.
Esto reposiciona la decisión de encaminar. La pregunta deja de ser "¿cuál modelo es más barato en el catálogo?" y pasa a ser "¿cuál es el costo por token medido de este modelo para esta clase de tarea?". Un MoE open-weight de frontera como Hy4 preview coloca un costo por token de modelo pequeño sobre una calidad de modelo grande, y es esa combinación la que cambia la cuenta entre servir público y cerrar la puerta.
El comparativo en el eval ciego completa el panorama: 49B activos entregando resultado 2.99 en el test ciego del propio Tencent, por delante de dos modelos de peso en la misma medición. Para un CTO que encamina por costo y calidad, el dato es lo bastante concreto como para exigir una prueba de encaminamiento, no para asumir victoria.
Hay un límite que nombrar. La densidad de activación define el costo de FLOPs, pero el costo observado en producción depende de la concurrencia, del batching continuo, del KV-cache y del patrón de atención dispersa, que es nuevo. No se publicó ningún valor de costo por token en tráfico real. Pruebe en su carga de trabajo.
Qué cambia en la práctica para la selección de modelo
Hy4 preview no es un reemplazo automático. Es un candidato a encaminamiento que cambia cómo funcionaba antes la selección de modelo. La tabla siguiente compara el régimen fijo con la política de encaminamiento que un MoE de frontera a 49B activos habilita.
| Decisión | Régimen fijo de modelo | Política de encaminamiento tras el MoE de frontera |
|---|---|---|
| Lectura de la ficha del modelo | "770B de parámetros, luego caro y pesado" | "49B activos por token: costo de modelo medio con calidad de frontera" |
| Cómo entra una release nueva | Cambiar en el código y reintegrar la app | Entra como ruta candidata en una capa de gateway y demuestra su lugar |
| Criterio de decisión | Nombre del modelo o hábito | Costo medido por tarea, latencia, contexto y calidad |
| Open-weight vs cerrado | Frontera cerrada para tarea difícil | Ruta open-weight de frontera para horizonte largo, cerrado para el resto de la regla |
| Costo de experimentar | Alto, porque cada test es una integración | Bajo, porque el cambio es una regla, no un redeploy |
| Limitación (sobre-razonamiento) | Se vuelve bug de prompt | Se vuelve criterio de ruta: enviar a no_think donde la tarea es directa |
El precio de esta lectura es una observación honesta: los benchmarks de Tencent, el costo teórico de FLOPs y la densidad de activación son señales, no son el costo de su tráfico. La parte que solo su operación responde es el costo por tarea medido, con su muestra de requests.
Qué hacer ahora: medir la ruta, no adivinar el resultado
Hy4 preview entra como ruta candidata, en prueba controlada, con la misma disciplina que cualquier otro modelo de frontera, y no como un cambio automático en la aplicación. El costo y la calidad medidos en su carga de trabajo deciden la promoción. Las acciones siguientes resuelven la secuencia en la práctica.
-
Medir el costo por tarea, no por modelo. Registre el costo observado de cada clase de request (corto, largo, razonamiento, tool use) con Hy4 preview servido en su infraestructura, y compárelo con la ruta actual. El dato que decide la cuenta es el suyo, no la densidad publicada.
-
Evaluar la calidad con criterio definido antes. Use una rúbrica atada al trabajo, en la tarea que justifica la ruta. No convierta el eval ciego de Tencent (2.99 vs GLM 5.3 y Kimi K3) en validación independiente de producción; trátelo como posicionamiento del proveedor y mida en su caso de uso.
-
Probar el modo de razonamiento por clase de tarea. Hy4 preview sobre-razona y sobre-verifica por defecto. Para respuesta directa, el
no_thinkcorta la cadena de pensamiento. Defina en qué clase entra cada modo, o pagará latencia y output en exceso. -
Agregar Hy4 preview como ruta en un gateway, no en el código de la app. Una capa de encaminamiento centraliza la elección por costo, desempeño, latencia y contexto, como documenta el Nexforce Router, y permite probar la ruta sin reintegrar ninguna aplicación. El roundtrip de un test deja de ser un proyecto.
-
Definir el criterio de promoción y el fallback. Solo promueva la ruta cuando costo, latencia, contexto y calidad cumplan los límites de la tarea, con disponibilidad confirmada. Mientras la evidencia no cierre la cuenta, mantener Hy4 preview en evaluación es la decisión correcta, y el fallback protege la aplicación.
FAQ sobre Hy4 preview y el costo de encaminar
¿Hy4 preview es un modelo de 770B, entonces es caro de servir?
No necesariamente. Son 770B de parámetros totales, pero solo 49B activos por token, porque es un MoE que solo ejecuta los top-8 de 256 expertos en cada solicitud. El costo incremental por token en inferencia depende de la capacidad activada, no del número total, aunque los 770B aún definan la memoria para cargar los pesos y el costo de inicialización.
¿Qué significa "49B activos por token" para quien encamina?
Significa que la métrica que importa para la cuenta de cada request es la activación, no el tamaño total. Para un CTO, el cambio es de mentalidad: en lugar de juzgar el modelo por el número grande de la ficha, medir el costo por tarea en la ruta. Un modelo de frontera con densidad de activación baja cambia la cuenta entre open-weight y la frontera cerrada.
¿El eval de 2.99 prueba que Hy4 preview es mejor que GLM 5.3 y Kimi K3?
No lo prueba. La evaluación es ciega e interna, hecha por 163 expertos de Tencent en 203 tareas, y los números pertenecen al proveedor. Sirven para posicionar el modelo en el mapa, no como validación independiente de calidad, costo o latencia en su tráfico. La decisión de producción sale de un test en su carga de trabajo.
¿Hy4 preview debe reemplazar la frontera cerrada?
No como regla. Entra como ruta candidata para tareas de horizonte largo en las que la calidad open-weight ahora compite con la frontera cerrada, a un costo por token de modelo con 49B activos. Para la regla restante, la frontera cerrada sigue estando justificada. Quien decide por clase de tarea es la política de encaminamiento, no la noticia del lanzamiento.
¿Ya puedo servir Hy4 preview en producción?
Se puede servir hoy mediante vLLM o SGLang, con imágenes y recetas oficiales, y los pesos bajo Apache 2.0. Haga una prueba controlada antes de la promoción. Tencent declara limitaciones conocidas, incluidos el sobre-razonamiento y la sobre-verificación, y el costo real en producción aún no es público, así que la recomendación es medir por tarea antes de prometer cualquier ganancia.
Referencias y Lectura Complementaria
La fuente primaria del lanzamiento es el README oficial de Hy4 preview en GitHub, que publica arquitectura, specs, deploy, eval ciego y limitaciones, con la ficha en Hugging Face sustentando los datos del modelo. El anuncio se hizo el 2026-08-28.
Este análisis continúa el hilo que abrió Qwen3.8-Flash-Next y la decisión de encaminamiento días antes: un MoE open-weight con activación baja cambia la pregunta de "cuál modelo es más grande" a "cuál costo por tarea". También se apoya en la cobertura de GLM-5.3-Flash, otro open-weight de frontera con costo bajo, y en la lectura del encaminamiento por complejidad, que decide la ruta por la tarea en lugar del modelo más caro.
La próxima release va a confirmar o refutar la regla
El corto plazo es de prueba, no de veredicto. Hy4 preview abre un camino concreto: servir un modelo de frontera open-weight con la cuenta de una tajada activa de 49B, y eso le da al comprador una opción que antes no existía. Tencent nombró el headroom y las limitaciones; la expectativa realista es iteración rápida en las próximas semanas.
La decisión de ruta queda con el dato de la operación. La prueba decide. Quien sirve por gateway de modelo puede colocar Hy4 preview como ruta candidata, medir costo, latencia y calidad por tarea y promover solo lo que cierra la cuenta. Lo que esta release cambia es la regla: de aquí en adelante, el "modelo grande y caro" y el "modelo pequeño y barato" dejan de leerse por el número total en la ficha, y pasan a decidirse por lo que cada solicitud realmente activa.

Acelera la eficienciaoperativa de tu negocio
Diseñamos tecnología de nivel global para impulsar escala del negocio
Hablar con un EspecialistaArtículos relacionados

GPT-6 Astra: precio, benchmarks y seguridad de OpenAI
OpenAI lanzó el GPT-6 Astra a US$ 10/US$ 50 por millón de tokens, con calificación Critical en ciberseguridad y monitorabilidad peor que la de su antecesor. La pieza muestra qué cambia esa combinación en la decisión de enrutamiento de quien consume la API en producción.
Read more
ChatGPT Ads alcanza US$ 1.000M de run rate y abre autoservicio global
OpenAI alcanza el hito de US$ 1.000 millones en ingresos anualizados por publicidad en ChatGPT en 200 días y habilita la compra global de anuncios en autoservicio.
Read more
Quasar 438B: el modelo europeo de 438B entra en el marcador de enrutamiento
Multiverse Computing lanzó el Quasar 438B, un modelo de razonamiento de clase 438B en inglés y español que marca 43 en el Intelligence Index v4.1.1 y responde 500 tokens con thinking en 15,3 segundos. Para quien enruta modelos, Europa gana una ruta de razonamiento con latencia de flash y contexto largo cerca de la frontera.
Read more