칭화대와 텐센트 훈위안, NPU 속도 4.1배 향상으로 MLSys2026 MoE 추론 챌린지 우승
칭화대학교 스토리지 연구소와 텐센트의 MegEngine AI 인프라 팀은 최근, 선도적인 머신러닝 시스템 컨퍼런스인 MLSys2026에서 열린 ‘MoE 모델 추론 최적화 챌린지’에서 세계 챔피언에 올랐다.

이 공동 연구팀은 이종 NPU 칩에서 실행되는 1조 규모 매개변수를 가진 전문가 혼합(MoE) 아키텍처의 추론 성능 병목 현상을 해결하기 위해, 공식 모델과 NPU 하드웨어를 위한 풀체인 최적화 솔루션을 설계했습니다. 전문가 수준 작업 분할을 위한 E-Shard 전략, PSUM 3D 텐서 배치 판독, 동시 처리를 위해 여러 뱅크에 출력을 분산시키는 GEMV 경로, 초기 데이터 전송 지연 시간을 줄이기 위한 스칼라 엔진 등을 도입함으로써, 연산자 수준에서 낮은 데이터 전송 효율과 반복적인 활성화 전송 문제를 성공적으로 해결했습니다.
이와 동시에 연구팀은 어텐션 모듈을 위한 온칩 데이터 레이아웃을 재구성하고 핵심 트랜스포머 연산자를 통합하여 비트 수준의 고정밀 정렬을 달성했습니다.

그림 3: E-Shard 전문가 분할, 연속 DMA, PSUM/GEMV 동시성, 콜드 스타트 파이프라인 및 프리페치 제어를 특징으로 하는 MoE 최적화 아키텍처 다이어그램.
또한, 연구팀은 “Knight”라는 에이전트 기반 추론 연산자 최적화기를 개발했습니다. 제안, 코드 구현, 반복이라는 자동화된 폐쇄 루프 프로세스를 통해 최적화 탐색 공간을 획기적으로 확대했습니다. 그 결과, 종단 간 추론 시간이 14.91초에서 3.56초로 단축되어 4.1배의 속도 향상을 달성했으며, 단일 단계 디코딩 지연 시간은 12.63ms에서 5.45ms로 단축되었으며, 가중치 로딩 중 DMA 엔진 활용률은 약 80%까지 상승했습니다.
스탠퍼드와 MIT 등 세계 유수의 대학 팀들을 제친 이번 성과는, 대규모 모델을 기반 시스템에 적용하고 연산자를 최적화하는 데 있어 중국 팀들의 깊은 전문성을 입증합니다. 또한 향후 슈퍼노드 컴퓨팅 플랫폼에 1조 매개변수 규모의 MoE 모델을 배포하기 위한 귀중한 엔지니어링 청사진을 제시합니다.
관련 기사
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
관련 특별 주제 추천
의견 (1)
0/500
칭화대학교 스토리지 연구소와 텐센트의 MegEngine AI 인프라 팀은 최근, 선도적인 머신러닝 시스템 컨퍼런스인 MLSys2026에서 열린 ‘MoE 모델 추론 최적화 챌린지’에서 세계 챔피언에 올랐다.

이 공동 연구팀은 이종 NPU 칩에서 실행되는 1조 규모 매개변수를 가진 전문가 혼합(MoE) 아키텍처의 추론 성능 병목 현상을 해결하기 위해, 공식 모델과 NPU 하드웨어를 위한 풀체인 최적화 솔루션을 설계했습니다. 전문가 수준 작업 분할을 위한 E-Shard 전략, PSUM 3D 텐서 배치 판독, 동시 처리를 위해 여러 뱅크에 출력을 분산시키는 GEMV 경로, 초기 데이터 전송 지연 시간을 줄이기 위한 스칼라 엔진 등을 도입함으로써, 연산자 수준에서 낮은 데이터 전송 효율과 반복적인 활성화 전송 문제를 성공적으로 해결했습니다.
이와 동시에 연구팀은 어텐션 모듈을 위한 온칩 데이터 레이아웃을 재구성하고 핵심 트랜스포머 연산자를 통합하여 비트 수준의 고정밀 정렬을 달성했습니다.

그림 3: E-Shard 전문가 분할, 연속 DMA, PSUM/GEMV 동시성, 콜드 스타트 파이프라인 및 프리페치 제어를 특징으로 하는 MoE 최적화 아키텍처 다이어그램.
또한, 연구팀은 “Knight”라는 에이전트 기반 추론 연산자 최적화기를 개발했습니다. 제안, 코드 구현, 반복이라는 자동화된 폐쇄 루프 프로세스를 통해 최적화 탐색 공간을 획기적으로 확대했습니다. 그 결과, 종단 간 추론 시간이 14.91초에서 3.56초로 단축되어 4.1배의 속도 향상을 달성했으며, 단일 단계 디코딩 지연 시간은 12.63ms에서 5.45ms로 단축되었으며, 가중치 로딩 중 DMA 엔진 활용률은 약 80%까지 상승했습니다.
스탠퍼드와 MIT 등 세계 유수의 대학 팀들을 제친 이번 성과는, 대규모 모델을 기반 시스템에 적용하고 연산자를 최적화하는 데 있어 중국 팀들의 깊은 전문성을 입증합니다. 또한 향후 슈퍼노드 컴퓨팅 플랫폼에 1조 매개변수 규모의 MoE 모델을 배포하기 위한 귀중한 엔지니어링 청사진을 제시합니다.
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






