Hogar
Tsinghua y Tencent Hunyuan ganan el MoE Inference Challenge de MLSys2026 con una aceleración de 4,1 veces en la NPU
El Laboratorio de Almacenamiento de la Universidad de Tsinghua y el equipo de infraestructura de IA MegEngine de Tencent se han proclamado recientemente campeones mundiales en el «MoE Model Inference Optimization Challenge» celebrado en MLSys2026, una de las principales conferencias sobre sistemas de aprendizaje automático.

Para abordar los cuellos de botella en el rendimiento de la inferencia en la arquitectura «mezcla de expertos» (MoE), con parámetros a escala de billones que se ejecutan en chips NPU heterogéneos, el equipo conjunto diseñó una solución de optimización de cadena completa para el modelo oficial y el hardware NPU. Mediante el empleo de la estrategia E-Shard para la partición de tareas a nivel de experto, la lectura por lotes de tensores 3D PSUM, la ruta GEMV que distribuye las salidas entre múltiples bancos para lograr la concurrencia, y el uso de motores escalares para reducir la latencia inicial en la transferencia de datos, lograron resolver con éxito la baja eficiencia en la transferencia de datos y las transferencias repetidas de activación a nivel de operador.
Paralelamente, el equipo reorganizó la disposición de los datos en el chip para el módulo de atención e integró los operadores Transformer básicos, logrando una alineación de alta precisión a nivel de bits.

Figura 3: Diagrama de la arquitectura de optimización MoE, que incluye la partición experta E-Shard, DMA continuo, concurrencia PSUM/GEMV, canal de arranque en frío y control de precarga.
Además, el equipo desarrolló un optimizador de operadores de inferencia basado en agentes denominado «Knight». Mediante un proceso automatizado de bucle cerrado que incluye propuesta, implementación de código e iteración, amplió drásticamente el espacio de búsqueda de optimización. Como resultado, el tiempo de inferencia de extremo a extremo se redujo de 14,91 segundos a 3,56 segundos, lo que supone una aceleración de 4,1 veces; la latencia de decodificación en un solo paso se redujo de 12,63 ms a 5,45 ms, y la utilización del motor DMA durante la carga de pesos ascendió a alrededor del 80 %.
Al superar a equipos de universidades líderes a nivel mundial, como Stanford y el MIT, este logro pone de relieve la profunda experiencia de los equipos chinos a la hora de adaptar modelos de gran tamaño a los sistemas subyacentes y optimizar los operadores. Además, proporciona un valioso modelo de ingeniería para el despliegue de modelos MoE con billones de parámetros en futuras plataformas informáticas de supernodos.
Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
El Laboratorio de Almacenamiento de la Universidad de Tsinghua y el equipo de infraestructura de IA MegEngine de Tencent se han proclamado recientemente campeones mundiales en el «MoE Model Inference Optimization Challenge» celebrado en MLSys2026, una de las principales conferencias sobre sistemas de aprendizaje automático.

Para abordar los cuellos de botella en el rendimiento de la inferencia en la arquitectura «mezcla de expertos» (MoE), con parámetros a escala de billones que se ejecutan en chips NPU heterogéneos, el equipo conjunto diseñó una solución de optimización de cadena completa para el modelo oficial y el hardware NPU. Mediante el empleo de la estrategia E-Shard para la partición de tareas a nivel de experto, la lectura por lotes de tensores 3D PSUM, la ruta GEMV que distribuye las salidas entre múltiples bancos para lograr la concurrencia, y el uso de motores escalares para reducir la latencia inicial en la transferencia de datos, lograron resolver con éxito la baja eficiencia en la transferencia de datos y las transferencias repetidas de activación a nivel de operador.
Paralelamente, el equipo reorganizó la disposición de los datos en el chip para el módulo de atención e integró los operadores Transformer básicos, logrando una alineación de alta precisión a nivel de bits.

Figura 3: Diagrama de la arquitectura de optimización MoE, que incluye la partición experta E-Shard, DMA continuo, concurrencia PSUM/GEMV, canal de arranque en frío y control de precarga.
Además, el equipo desarrolló un optimizador de operadores de inferencia basado en agentes denominado «Knight». Mediante un proceso automatizado de bucle cerrado que incluye propuesta, implementación de código e iteración, amplió drásticamente el espacio de búsqueda de optimización. Como resultado, el tiempo de inferencia de extremo a extremo se redujo de 14,91 segundos a 3,56 segundos, lo que supone una aceleración de 4,1 veces; la latencia de decodificación en un solo paso se redujo de 12,63 ms a 5,45 ms, y la utilización del motor DMA durante la carga de pesos ascendió a alrededor del 80 %.
Al superar a equipos de universidades líderes a nivel mundial, como Stanford y el MIT, este logro pone de relieve la profunda experiencia de los equipos chinos a la hora de adaptar modelos de gran tamaño a los sistemas subyacentes y optimizar los operadores. Además, proporciona un valioso modelo de ingeniería para el despliegue de modelos MoE con billones de parámetros en futuras plataformas informáticas de supernodos.
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











