Lar
Tsinghua e Tencent Hunyuan vencem o Desafio de Inferência MoE do MLSys2026 com um aumento de velocidade de 4,1x na NPU
O Laboratório de Armazenamento da Universidade de Tsinghua e a equipe de infraestrutura de IA MegEngine da Tencent conquistaram recentemente o título de campeões mundiais no Desafio de Otimização de Inferência de Modelos MoE (Mixture of Experts) na MLSys2026, uma das principais conferências sobre sistemas de aprendizado de máquina.

Para superar os gargalos de desempenho na inferência na arquitetura “mixture-of-experts” (MoE) com parâmetros na escala de trilhões executados em chips NPU heterogêneos, a equipe conjunta projetou uma solução de otimização de cadeia completa para o modelo oficial e o hardware NPU. Ao empregar a estratégia E-Shard para o particionamento de tarefas em nível de especialista, a leitura em lote de tensores 3D PSUM, o caminho GEMV que distribui saídas por vários bancos para garantir a concorrência e o uso de motores escalares para reduzir a latência inicial da transferência de dados, eles resolveram com sucesso a baixa eficiência na transferência de dados e as transferências repetidas de ativação no nível do operador.
Paralelamente, a equipe reorganizou o layout de dados no chip para o módulo de atenção e integrou os operadores principais do Transformer, alcançando um alinhamento de alta precisão no nível de bits.

Figura 3: Diagrama da arquitetura de otimização MoE, apresentando particionamento especializado E-Shard, DMA contínuo, concorrência PSUM/GEMV, pipeline de partida a frio e controle de pré-busca.
Além disso, a equipe desenvolveu um otimizador de operadores de inferência baseado em agentes chamado “Knight”. Por meio de um processo automatizado de ciclo fechado de proposta, implementação de código e iteração, ele ampliou drasticamente o espaço de busca de otimização. Como resultado, o tempo de inferência de ponta a ponta caiu de 14,91 segundos para 3,56 segundos, um aumento de velocidade de 4,1 vezes; a latência de decodificação em uma única etapa caiu de 12,63 ms para 5,45 ms, e a utilização do mecanismo DMA durante o carregamento de pesos subiu para cerca de 80%.
Superando equipes de universidades líderes globais, como Stanford e o MIT, essa conquista destaca a profunda expertise das equipes chinesas na adaptação de grandes modelos aos sistemas subjacentes e na otimização de operadores. Ela também fornece um valioso plano de engenharia para a implantação de modelos MoE com trilhões de parâmetros em futuras plataformas de computação com supernós.
Artigo relacionado
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
Recomendações de tópicos especiais relacionados
Comentários (1)
O Laboratório de Armazenamento da Universidade de Tsinghua e a equipe de infraestrutura de IA MegEngine da Tencent conquistaram recentemente o título de campeões mundiais no Desafio de Otimização de Inferência de Modelos MoE (Mixture of Experts) na MLSys2026, uma das principais conferências sobre sistemas de aprendizado de máquina.

Para superar os gargalos de desempenho na inferência na arquitetura “mixture-of-experts” (MoE) com parâmetros na escala de trilhões executados em chips NPU heterogêneos, a equipe conjunta projetou uma solução de otimização de cadeia completa para o modelo oficial e o hardware NPU. Ao empregar a estratégia E-Shard para o particionamento de tarefas em nível de especialista, a leitura em lote de tensores 3D PSUM, o caminho GEMV que distribui saídas por vários bancos para garantir a concorrência e o uso de motores escalares para reduzir a latência inicial da transferência de dados, eles resolveram com sucesso a baixa eficiência na transferência de dados e as transferências repetidas de ativação no nível do operador.
Paralelamente, a equipe reorganizou o layout de dados no chip para o módulo de atenção e integrou os operadores principais do Transformer, alcançando um alinhamento de alta precisão no nível de bits.

Figura 3: Diagrama da arquitetura de otimização MoE, apresentando particionamento especializado E-Shard, DMA contínuo, concorrência PSUM/GEMV, pipeline de partida a frio e controle de pré-busca.
Além disso, a equipe desenvolveu um otimizador de operadores de inferência baseado em agentes chamado “Knight”. Por meio de um processo automatizado de ciclo fechado de proposta, implementação de código e iteração, ele ampliou drasticamente o espaço de busca de otimização. Como resultado, o tempo de inferência de ponta a ponta caiu de 14,91 segundos para 3,56 segundos, um aumento de velocidade de 4,1 vezes; a latência de decodificação em uma única etapa caiu de 12,63 ms para 5,45 ms, e a utilização do mecanismo DMA durante o carregamento de pesos subiu para cerca de 80%.
Superando equipes de universidades líderes globais, como Stanford e o MIT, essa conquista destaca a profunda expertise das equipes chinesas na adaptação de grandes modelos aos sistemas subjacentes e na otimização de operadores. Ela também fornece um valioso plano de engenharia para a implantação de modelos MoE com trilhões de parâmetros em futuras plataformas de computação com supernós.
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











