옵션
뉴스
샤오홍슈, ‘빅맥(BigMac)’ 공개: 다중 모달 훈련에서 메모리-속도 상충 관계 해소

샤오홍슈, ‘빅맥(BigMac)’ 공개: 다중 모달 훈련에서 메모리-속도 상충 관계 해소

2026년 8월 26일
65

다중 모달 대규모 언어 모델은 차세대 AI의 초석으로 부상하고 있지만, 그 훈련 인프라는 오랫동안 지속되어 온 상충 관계로 인해 제약을 받아 왔습니다. 즉, 속도를 최적화한 시스템은 메모리 제약으로 인해 어려움을 겪는 반면, 메모리 효율성을 우선시하는 시스템은 속도가 느려지는 경향이 있습니다. 샤오홍슈(Xiaohongshu)의 Dots Infra 팀은 이 병목 현상을 멀티모달 파이프라인 훈련의 파레토 프론티어로 규정하고, 이를 돌파해 냈다. 7월 22일, 이 팀은 네이티브 멀티모달 시나리오를 위해 특별히 설계된 새로운 파이프라인 병렬 훈련 패러다임인 ‘BigMac’을 오픈소스로 공개했습니다. 이 프로젝트는 현재 GitHub의 Dots-Infra 저장소에서 확인할 수 있습니다.

표준 트랜스포머와 달리, 다중 모달 모델은 본질적으로 복잡합니다. 일반적인 다중 모달 대규모 언어 모델(MLLM)은 이미지를 임베딩으로 변환하는 모달 인코더, 추론을 위한 LLM 백본, 그리고 LLM의 출력을 이미지나 음성 같은 대상 모달리티로 다시 매핑하는 생성기라는 세 가지 별개의 구성 요소로 이루어져 있습니다. 이러한 구성 요소들 간의 상당한 구조적 차이로 인해, 이를 단일 훈련 파이프라인에 통합할 때 큰 어려움이 발생합니다.

image.png

현재 업계의 솔루션은 일반적으로 두 가지 범주로 나뉩니다. 첫 번째 접근 방식은 인코더와 생성기를 LLM 파이프라인에서 분리하여 별도로 실행함으로써 계산 효율성을 우선시합니다. 이는 모달 모듈의 처리 시간 변동으로 인해 LLM 파이프라인에 ‘버블’이 발생하는 것을 방지하지만, 활성화 메모리가 마이크로배치 수에 비례하여 증가하므로 대규모 환경에서는 높은 비용이 발생합니다. 두 번째 접근 방식은 모든 모듈을 동일한 파이프라인 내에 유지함으로써 메모리 효율성에 중점을 두는데, 이는 활성화 수명 주기를 단축하고 메모리 사용량을 줄여줍니다. 그러나 인코더나 제너레이터 중 하나라도 속도가 느리면 전체 LLM 파이프라인이 정지되어 테일 버블이 발생합니다. 모델 규모가 커짐에 따라 두 설계 모두 치명적인 병목 현상을 드러냅니다.

BigMac은 간단하면서도 핵심적인 원칙을 통해 이 문제를 해결합니다. 바로 핵심 LLM 파이프라인을 최우선으로 유지한다는 것입니다. 대규모 LLM 훈련은 이미 1F1B나 인터리브드 1F1B와 같은 성숙한 스케줄링 전략에 의존하고 있으며, 이러한 전략은 프로덕션급 훈련 스택에 깊이 통합되어 있습니다. BigMac은 이러한 확립된 방법을 대체하기보다는 LLM 스케줄을 기본 타임라인으로 활용하며, 입력 데이터가 준비되었을 때 LLM의 실행 순서를 방해하지 않도록 인코더 및 제너레이터 연산을 전략적으로 삽입합니다. 연구팀은 이 아키텍처를 “준 의존성 안전 중첩 파이프라인(quasi-dependency-safe nested pipeline)”이라고 부릅니다.

이 설계는 두 가지 주요 이점을 제공합니다. 첫째, 인코더와 제너레이터 소요 시간의 변동이 더 이상 LLM 파이프라인 전반으로 전파되지 않아, LLM이 최적의 속도를 유지할 수 있습니다. 둘째, 모달 활성화에 필요한 메모리 요구량이 알고리즘 수준에서 O(1)로 감소합니다. 인코더는 더 이상 파이프라인이 종료될 때까지 모든 마이크로배치의 활성화 값을 유지할 필요가 없으며, 제너레이터는 긴 활성화 테일을 연장하는 것을 피할 수 있습니다. 본질적으로 BigMac은 성능을 위해 메모리를 희생하지 않습니다. 대신, 스케줄링 로직을 재구성하여 이 두 가지 목표가 상호 배타적이지 않고 양립할 수 있도록 합니다.

image.png

스케줄 설계와 실제 실행 간의 격차를 해소하는 데에는 시스템 통합, 인터페이스 정의, 성능 디버깅을 포함한 상당한 엔지니어링상의 난관이 수반됩니다. BigMac은 세 가지 핵심 기능을 제공함으로써 이러한 구체적인 과제를 해결하도록 설계되었습니다. 첫째, 글로벌 스케줄을 투명하게 만듭니다. 스케줄러는 런타임에 모든 파이프라인 랭크, 마이크로배치 및 모듈 유형을 포괄하는 종합적인 연산자 테이블을 생성합니다. 그런 다음 실행기는 이를 각 랭크별 로컬 시퀀스로 분배하며, Megatron Core와 같은 LLM 백엔드, 모달 런타임, 통신 계층과 원활하게 통합됩니다. 이러한 가시성 덕분에 점검과 백엔드 최적화가 더욱 용이해집니다.

둘째, BigMac은 알고리즘 엔지니어에게 노출되지 않는 파이프라인 병렬 인터페이스를 제공합니다. 사용자는 각 모듈이 무엇을 생성하고 소비하는지 정의하기만 하면 되며, 시스템이 내부적으로 단계 분할, 활성화 및 기울기 전달, 기기 간 통신을 처리합니다. 이를 통해 단일 GPU에서 검증된 다중 모달 실험을 파이프라인 병렬 처리로 자연스럽게 확장할 수 있습니다. 셋째, 프로파일링, 시뮬레이션 및 시각화 도구 모음을 제공합니다. 이러한 도구는 훈련 반복 과정을 연산자 수준으로 세분화하여, 각 시간 단계에서 각 랭크가 수행하는 작업을 정확히 드러내고, 유휴 기간을 식별하며, 의존성 병목 현상을 강조 표시합니다. 또한 이 시뮬레이터를 통해 팀은 본격적인 훈련에 착수하기 전에 다양한 PP 구성과 마이크로배치 조합을 테스트하여, 버블 및 처리량에 미치는 영향을 추정할 수 있습니다.

BigMac의 효과성은 두 가지 대표적인 워크로드를 통해 검증되었습니다. MLLM-Understanding 작업에서 Qwen3-30B-A3B를 백본으로 사용하고 13억 규모의 ViT 인코더를 적용했을 때, BigMac은 계산 효율이 높은 기준 모델인 Optimus에 비해 1.08배에서 1.1배의 속도 향상을, 메모리 효율이 높은 기준 모델인 Megatron-DistTrain에 비해 1.6배에서 1.9배의 속도 향상을 달성했습니다. 중요한 점은, GPU당 배치 크기가 증가함에 따라 메모리 사용량이 안정적으로 유지되는 반면, Optimus는 메모리 사용량이 급증하여 결국 더 큰 배치에서 메모리 부족(OOM) 오류가 발생한다는 것입니다. MLLM-Generation 작업은 20B MMDiT 생성기를 포함하는 등 더 복잡하며, 여기서 성능 격차는 더욱 벌어집니다. Optimus는 OOM으로 인해 테스트된 모든 배치 크기에서 실패하는 반면, BigMac은 생성기를 역방향으로 효율적으로 실행하고 활성화 값을 신속하게 해제함으로써 이를 피합니다. Megatron-DistTrain과 비교했을 때, BigMac은 안정적인 메모리 사용량으로 여전히 1.5배에서 1.9배의 속도 향상을 제공합니다. 이는 중첩 파이프라인의 주요 가치를 잘 보여줍니다. 즉, 과도한 활성화 값 유지나 상당한 유휴 시간 없이 인코더와 생성기의 의존성을 모두 처리한다는 점입니다.

BigMac은 현재 Dots의 다중 모달 모델 훈련 인프라의 핵심 구성 요소이며, 샤오홍슈(Xiaohongshu)의 운영 환경에서 가동되고 있습니다. 관련 논문인 “BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training”은 대화형 PP Profiler 추적 예시와 함께 arXiv에서 확인할 수 있습니다. 다중 모달 훈련에서 메모리와 속도 간의 상충 관계로 어려움을 겪고 있는 연구자 및 엔지니어들에게, 이 실제 운영 환경에서 검증된 오픈소스 프로젝트는 상당한 시간과 노력을 절약해 주는 실용적인 해결책을 제공합니다.

관련 기사
법적 분쟁 속에서 Suno의 워터마크 삽입 법적 분쟁 속에서 Suno의 워터마크 삽입 Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속 머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속 Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달 미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달 엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
SEO 검색 전략 수립을 위한 최고의 AI SERP 분석 도구
검색 전략 수립을 위한 최고의 AI SERP 분석 도구

2026년 검색 전략을 위한 최신 최고의 AI SERP 분석 도구는 XIX.AI가 엄격한 실전 테스트를 거쳐 엄선하고 매주 순위를 업데이트하여 제공합니다. 이 강력한 도구들을 활용하면 숨겨진 최적화 기회를 발굴하고, 콘텐츠 성과를 높이며, 검색 분야에서 경쟁 우위를 확보할 수 있습니다. 지금 바로 검색 전략을 한 단계 업그레이드해 줄 완벽한 도구를 찾아보세요. 지금 바로 확인해 보세요!

13 도구
xix.ai
데이터 분석 SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구
SaaS 및 이커머스 팀을 위한 KPI 모니터링용 최고의 AI 이상 감지 도구

2026년 최신 최고의 KPI 모니터링용 AI 이상 탐지 도구 SaaS 및 이커머스 팀을 위한 상위 평가 도구! XIX.AI는 엄격한 실제 테스트와 매주 업데이트되는 순위를 기반으로 강력한 게임 체인저 컬렉션을 선별했습니다. 생산성을 높이고 AI 경쟁력을 발휘할 수 있는 필수 솔루션을 식별하는 데 도움이 되는 상세한 무료 대 유료 비교 인사이트를 찾을 수 있습니다. 지금 탐색하세요!

10 도구
xix.ai
글쓰기 장문 SEO 기사용 최고의 AI 개요 생성기
장문 SEO 기사용 최고의 AI 개요 생성기

XIX.AI가 꼼꼼하게 선별한 2026년 최신 최고 평점을 받은 장문 SEO 기사용 AI 개요 생성기. 이 강력한 도구들은 고품질 콘텐츠를 신속하게 제작하는 데 획기적인 도움을 제공하여 글쓰기 효율을 크게 높여줍니다. 무료 버전과 유료 버전의 비교 정보와 실제 테스트 결과, 상세한 순위 정보를 확인하여 여러분의 필요에 딱 맞는, 꼭 사용해 봐야 할 옵션을 찾아보세요. 지금 바로 살펴보고 AI를 활용한 경쟁력을 확보하세요.

8 도구
xix.ai
교육 및 학습 숙제 및 시험 준비를 위한 AI 학습 도구
숙제 및 시험 준비를 위한 AI 학습 도구

2026년 숙제 및 시험 준비를 위한 최신 최고의 AI 학습 도구! XIX.AI는 학생들이 생산성을 높이고, 숙제 완료 과정을 효율화하며, 실제 시험을 통해 우수한 성적을 거둘 수 있도록 돕는 강력하고 혁신적인 도구들의 최고 평점 목록을 엄선했습니다. 무료와 유료 버전의 비교 정보, 상세한 순위, 꼭 사용해 봐야 할 옵션을 확인하고 AI의 힘을 최대한 활용하세요. 지금 바로 살펴보세요!

10 도구
xix.ai
음악 작곡 songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구
songwriter, 후크, 탑라인 및 다국어 초안 세션을 위한 AI 보컬 데모 도구

2026년 최신 최고의 AI 보컬 데모 도구: 작곡가, 후크 제작자 및 다국어 콘텐츠 팀을 위한! XIX.AI는 엄격한 실전 테스트를 거친 강력한 혁신 도구의 최고 평점 목록을 선별했습니다. 여기서는 무료 대 유료 비교 데이터, 종합 순위, 그리고 필수 추천 옵션을 확인할 수 있어 작사 효율성을 높이고 창의적 잠재력을 발휘하는 데 도움이 됩니다. 지금 탐색하여 모든 콘텐츠 요구에 맞는 완벽한 도구를 발견하세요!

9 도구
xix.ai
사업 중소기업을 위한 최고의 AI 경쟁사 분석 도구
중소기업을 위한 최고의 AI 경쟁사 분석 도구

2026년 중소기업을 위한 최신 최고 평점의 AI 경쟁 분석 도구! XIX.AI는 매주 엄격한 실제 테스트와 상세한 순위를 바탕으로 업데이트되는, 업계 판도를 바꿀 만큼 강력한 도구 모음을 엄선했습니다. 생산성을 높이고 경쟁 우위를 확보할 수 있는 ‘꼭 사용해 봐야 할’ 도구를 찾아보실 수 있도록, 무료 버전과 유료 버전의 포괄적인 비교 정보를 제공합니다. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아보세요!

9 도구
xix.ai
의견 (10)
0/500
JackMartinez
JackMartinez 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

¿BigMac? Suena a que viene con mucho contenido. 😂 Resolver la tensión entre memoria y velocidad es clave en IA actual. Si logran mantener la precisión sin consumir tantos recursos, será un hito importante. Ojalá los benchmarks sean sólidos.

AlbertThomas
AlbertThomas 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

O nome BigMac é hilário, mas a proposta é séria! Resolver o trade-off entre memória e velocidade é crucial para modelos multimodais. Se funcionar como prometem, facilita muito a vida de quem treina modelos grandes. Aguardando os resultados práticos!

BillyAnderson
BillyAnderson 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

Interessanter Ansatz! Die Balance zwischen Speicherbedarf und Trainingsgeschwindigkeit ist oft der Engpass. Wenn BigMac hier wirklich einen Unterschied macht, wäre das ein echter Fortschritt für die Community. Mal sehen, wie sich die Zahlen im Live-Betrieb verhalten.

WillieAnderson
WillieAnderson 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

빅맥이라는 이름이 참 신기하네요. 다중 모달 학습에서 메모리와 속도의 균형을 맞추는 건 정말 어려운 과제인데, Xiaohongshu가 해냈다면 큰 의미가 있을 것 같습니다. 성능 테스트 결과가 기대됩니다!

BillyYoung
BillyYoung 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

Наконец-то кто-то решает проблему памяти в мультимодальных моделях. BigMac звучит как мощное решение. Надеюсь, это не просто маркетинг, а реальный прорыв в инфраструктуре обучения. Ждем тестов! 🚀

JoseAdams
JoseAdams 2026년 9월 3일 오후 11시 0분 18초 GMT+09:00

C'est une avancée intéressante. Le compromis entre vitesse et mémoire est souvent un frein dans notre domaine. Si BigMac parvient à l'optimiser sans perdre en précision, ça pourrait démocratiser l'entraînement multimodal. À suivre de près !

OR