Дом
Университет Цинхуа и компания Tencent Hunyuan победили в конкурсе MoE Inference Challenge в рамках конференции MLSys2026, продемонстрировав 4,1-кратное ускорение работы NPU
Лаборатория систем хранения данных Университета Цинхуа и команда MegEngine AI Infra компании Tencent недавно завоевали титул мировых чемпионов в конкурсе по оптимизации инференса моделей MoE в рамках MLSys2026 — ведущей конференции по системам машинного обучения.

Чтобы устранить узкие места в производительности инференса в архитектуре «смеси экспертов» (MoE) с триллионным масштабом параметров, работающей на гетерогенных чипах NPU, совместная команда разработала решение по оптимизации всего цепочки для официальной модели и аппаратного обеспечения NPU. Благодаря применению стратегии E-Shard для разбиения задач на уровне экспертов, пакетного считывания 3D-тензоров PSUM, алгоритма GEMV, распределяющего выходные данные по нескольким банкам для обеспечения параллелизма, а также использования скалярных движков для сокращения задержки при первоначальной передаче данных, команде удалось успешно устранить низкую эффективность передачи данных и повторяющиеся передачи активаций на уровне операторов.
Параллельно с этим команда реорганизовала расположение данных на кристалле для модуля внимания и интегрировала основные операторы Transformer, обеспечив высокоточное выравнивание на битовом уровне.

Рисунок 3: Схема архитектуры оптимизации MoE, включающей экспертное разбиение E-Shard, непрерывный DMA, параллелизм PSUM/GEMV, конвейер «холодного запуска» и управление предварительной выборкой.
Кроме того, команда разработала агент-ориентированный оптимизатор операторов инференса под названием «Knight». Благодаря автоматизированному процессу с обратной связью, включающему выдвижение предложений, реализацию кода и итерации, удалось значительно расширить пространство поиска оптимизаций. В результате время сквозного вывода сократилось с 14,91 секунды до 3,56 секунды, что соответствует 4,1-кратному ускорению; задержка одношагового декодирования сократилась с 12,63 мс до 5,45 мс, а загрузка DMA-движка при загрузке весов выросла примерно до 80 %.
Превзойдя команды из ведущих мировых университетов, таких как Стэнфорд и Массачусетский технологический институт (MIT), это достижение подчеркивает глубокую экспертизу китайских команд в адаптации крупных моделей к базовым системам и оптимизации операторов. Оно также предоставляет ценный инженерный план для развертывания моделей MoE с триллионами параметров на будущих вычислительных платформах на базе суперузлов.
Связанная статья
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Рекомендации по связанным специальным темам
Комментарии (1)
Лаборатория систем хранения данных Университета Цинхуа и команда MegEngine AI Infra компании Tencent недавно завоевали титул мировых чемпионов в конкурсе по оптимизации инференса моделей MoE в рамках MLSys2026 — ведущей конференции по системам машинного обучения.

Чтобы устранить узкие места в производительности инференса в архитектуре «смеси экспертов» (MoE) с триллионным масштабом параметров, работающей на гетерогенных чипах NPU, совместная команда разработала решение по оптимизации всего цепочки для официальной модели и аппаратного обеспечения NPU. Благодаря применению стратегии E-Shard для разбиения задач на уровне экспертов, пакетного считывания 3D-тензоров PSUM, алгоритма GEMV, распределяющего выходные данные по нескольким банкам для обеспечения параллелизма, а также использования скалярных движков для сокращения задержки при первоначальной передаче данных, команде удалось успешно устранить низкую эффективность передачи данных и повторяющиеся передачи активаций на уровне операторов.
Параллельно с этим команда реорганизовала расположение данных на кристалле для модуля внимания и интегрировала основные операторы Transformer, обеспечив высокоточное выравнивание на битовом уровне.

Рисунок 3: Схема архитектуры оптимизации MoE, включающей экспертное разбиение E-Shard, непрерывный DMA, параллелизм PSUM/GEMV, конвейер «холодного запуска» и управление предварительной выборкой.
Кроме того, команда разработала агент-ориентированный оптимизатор операторов инференса под названием «Knight». Благодаря автоматизированному процессу с обратной связью, включающему выдвижение предложений, реализацию кода и итерации, удалось значительно расширить пространство поиска оптимизаций. В результате время сквозного вывода сократилось с 14,91 секунды до 3,56 секунды, что соответствует 4,1-кратному ускорению; задержка одношагового декодирования сократилась с 12,63 мс до 5,45 мс, а загрузка DMA-движка при загрузке весов выросла примерно до 80 %.
Превзойдя команды из ведущих мировых университетов, таких как Стэнфорд и Массачусетский технологический институт (MIT), это достижение подчеркивает глубокую экспертизу китайских команд в адаптации крупных моделей к базовым системам и оптимизации операторов. Оно также предоставляет ценный инженерный план для развертывания моделей MoE с триллионами параметров на будущих вычислительных платформах на базе суперузлов.
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три











