알리의 블랙 테크: 0.6B 모델이 5%의 활성 매개변수를 갖춘 17B MoE로 업그레이드되었으며, CPU에서 초당 30 토큰의 속도로 실행 중
알리 인터내셔널 디지털 커머스 팀은 ‘Marco-MoE’ 시리즈의 최신 모델인 ‘Marco-Mini-Instruct’를 공개하며, “작은 규모로도 큰 성과를 낼 수 있다”는 점을 보여주었습니다. 총 173억 개의 파라미터 중 활성 파라미터는 8억 6천만 개(약 5%)에 불과하여, 표준 CPU에서도 원활하게 작동할 수 있는 탁월한 추론 속도를 자랑합니다.

초경량: CPU 성능에 최적화
공식 데이터에 따르면, 8비트 양자화와 4개의 DDR4 2400 메모리 모듈을 사용했을 때 이 모델은 초당 약 30 토큰의 추론 속도를 달성합니다. 이러한 효율성 덕분에 Mixture-of-Experts(MoE) 아키텍처가 주류로 자리 잡을 가능성이 높아졌으며, 온프레미스 배포에 대한 장벽이 크게 낮아졌습니다.
핵심 혁신: 업사이클링 기술이 잠재력을 실현하다
Marco-Mini-Instruct의 가장 두드러진 특징은 크기와 속도가 아니라 독특한 생성 방식입니다. 이 모델은 처음부터 훈련된 것이 아니라, 업사이클링 기술을 활용해 Qwen3-0.6B-Base 모델에서 진화시킨 것입니다.

이 과정에는 덴스(Dense) 소형 모델의 구성 요소를 여러 전문가로 분할하거나 복사하고, 라우팅 메커니즘을 도입하는 것이 포함됩니다. 또한, 세분화된 부분 행렬 분할과 드롭-업사이클링(Drop-Upcycling) 전략을 통합하여, 훈련 중에 특정 전문가나 라우팅 경로를 무작위로 제거함으로써 정규화를 추가하고 견고성을 향상시킵니다. 이러한 접근 방식을 통해 순수한 Dense 모델을 MoE 아키텍처로 성공적으로 업그레이드함으로써, 업계에 MoE 훈련을 위한 새롭고 비용 효율적이며 효과적인 경로를 제시합니다.
컨텍스트 길이 및 훈련 설정
모델 구성에서는 max_position_embeddings를 32K로 확장하지만, 감독형 미세 조정(SFT) 단계에서는 8192 토큰의 컨텍스트를 사용합니다. 따라서 기본 컨텍스트 길이는 대부분의 실제 적용 시나리오에 적합합니다.
훈련 후의 획기적인 발전: 계단식 온-폴리시 증류
훈련 후 단계 역시 인상적입니다. 이 단계는 SFT 예열로 시작하여, 이어서 계단식 온-폴리시 증류(On-Policy Distillation ) 전략을 적용합니다. 초기 증류 단계에서는 Qwen3-30B-A3B-Instruct를 티처 모델로 사용하다가, 이후 더 강력한 Qwen3-Next-80B-A3B-Instruct로 전환합니다. 증류 데이터는 지시 사항 이행, 복잡한 추론, 정렬 보안 및 수학적 능력을 아우르며, 모델이 효율성을 유지하면서 전반적인 지능을 크게 향상시킬 수 있도록 보장합니다.
벤치마크 결과: 0.86B 활성 매개변수로 4B 밀집형 모델을 제치다
최종 Marco-Mini-Instruct 모델은 대부분의 주류 벤치마크에서 Qwen3-4B와 같은 많은 고밀도 모델보다 우수한 성능을 보입니다. 활성 매개변수가 8억 6천만 개에 불과함에도 불구하고, 이 모델은 “작지만 강력한” 성능을 제공하는 MoE 아키텍처의 막대한 잠재력을 완전히 입증합니다.
업계에 미치는 영향: 새로운 오픈소스 MoE 훈련 패러다임
AIbase는 이번 성과가 개발자들에게 새로운 기회를 열어준다는 점에 가장 큰 가치가 있다고 믿습니다. 이제 대규모 MoE 모델을 처음부터 훈련시킬 필요가 없으며, 대신 팀들은 적합한 소형 Dense 모델을 선택하고 논문에서 제시한 업사이클링(upcycling) 및 드롭-업사이클링(Drop-Upcycling) 과정을 엄격히 재현하기만 하면 됩니다. 전체 훈련 비용은 관리 가능한 수준을 유지합니다. SFT 단계에는 64개의 GPU가 24시간 동안 필요하고, 증류 단계에는 64개의 GPU가 110시간 동안 필요하므로, 중소 규모 팀이 MoE를 실험해 볼 수 있는 진입 장벽이 크게 낮아집니다.
알리바바의 이번 최신 “개량”은 모델 효율성에서의 획기적인 발전이 반드시 매개변수 스태킹에 의존하는 것은 아니며, 혁신적인 훈련 패러다임 또한 질적 도약을 이끌 수 있음을 다시 한번 입증합니다. Marco-Mini-Instruct의 출시는 의심할 여지 없이 엣지 디바이스 및 개인 개발자 시나리오에서 MoE 기술의 도입을 가속화할 것이며, 이는 업계 전체가 주목해야 할 핵심 발전이 될 것입니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
알리 인터내셔널 디지털 커머스 팀은 ‘Marco-MoE’ 시리즈의 최신 모델인 ‘Marco-Mini-Instruct’를 공개하며, “작은 규모로도 큰 성과를 낼 수 있다”는 점을 보여주었습니다. 총 173억 개의 파라미터 중 활성 파라미터는 8억 6천만 개(약 5%)에 불과하여, 표준 CPU에서도 원활하게 작동할 수 있는 탁월한 추론 속도를 자랑합니다.

초경량: CPU 성능에 최적화
공식 데이터에 따르면, 8비트 양자화와 4개의 DDR4 2400 메모리 모듈을 사용했을 때 이 모델은 초당 약 30 토큰의 추론 속도를 달성합니다. 이러한 효율성 덕분에 Mixture-of-Experts(MoE) 아키텍처가 주류로 자리 잡을 가능성이 높아졌으며, 온프레미스 배포에 대한 장벽이 크게 낮아졌습니다.
핵심 혁신: 업사이클링 기술이 잠재력을 실현하다
Marco-Mini-Instruct의 가장 두드러진 특징은 크기와 속도가 아니라 독특한 생성 방식입니다. 이 모델은 처음부터 훈련된 것이 아니라, 업사이클링 기술을 활용해 Qwen3-0.6B-Base 모델에서 진화시킨 것입니다.

이 과정에는 덴스(Dense) 소형 모델의 구성 요소를 여러 전문가로 분할하거나 복사하고, 라우팅 메커니즘을 도입하는 것이 포함됩니다. 또한, 세분화된 부분 행렬 분할과 드롭-업사이클링(Drop-Upcycling) 전략을 통합하여, 훈련 중에 특정 전문가나 라우팅 경로를 무작위로 제거함으로써 정규화를 추가하고 견고성을 향상시킵니다. 이러한 접근 방식을 통해 순수한 Dense 모델을 MoE 아키텍처로 성공적으로 업그레이드함으로써, 업계에 MoE 훈련을 위한 새롭고 비용 효율적이며 효과적인 경로를 제시합니다.
컨텍스트 길이 및 훈련 설정
모델 구성에서는 max_position_embeddings를 32K로 확장하지만, 감독형 미세 조정(SFT) 단계에서는 8192 토큰의 컨텍스트를 사용합니다. 따라서 기본 컨텍스트 길이는 대부분의 실제 적용 시나리오에 적합합니다.
훈련 후의 획기적인 발전: 계단식 온-폴리시 증류
훈련 후 단계 역시 인상적입니다. 이 단계는 SFT 예열로 시작하여, 이어서 계단식 온-폴리시 증류(On-Policy Distillation ) 전략을 적용합니다. 초기 증류 단계에서는 Qwen3-30B-A3B-Instruct를 티처 모델로 사용하다가, 이후 더 강력한 Qwen3-Next-80B-A3B-Instruct로 전환합니다. 증류 데이터는 지시 사항 이행, 복잡한 추론, 정렬 보안 및 수학적 능력을 아우르며, 모델이 효율성을 유지하면서 전반적인 지능을 크게 향상시킬 수 있도록 보장합니다.
벤치마크 결과: 0.86B 활성 매개변수로 4B 밀집형 모델을 제치다
최종 Marco-Mini-Instruct 모델은 대부분의 주류 벤치마크에서 Qwen3-4B와 같은 많은 고밀도 모델보다 우수한 성능을 보입니다. 활성 매개변수가 8억 6천만 개에 불과함에도 불구하고, 이 모델은 “작지만 강력한” 성능을 제공하는 MoE 아키텍처의 막대한 잠재력을 완전히 입증합니다.
업계에 미치는 영향: 새로운 오픈소스 MoE 훈련 패러다임
AIbase는 이번 성과가 개발자들에게 새로운 기회를 열어준다는 점에 가장 큰 가치가 있다고 믿습니다. 이제 대규모 MoE 모델을 처음부터 훈련시킬 필요가 없으며, 대신 팀들은 적합한 소형 Dense 모델을 선택하고 논문에서 제시한 업사이클링(upcycling) 및 드롭-업사이클링(Drop-Upcycling) 과정을 엄격히 재현하기만 하면 됩니다. 전체 훈련 비용은 관리 가능한 수준을 유지합니다. SFT 단계에는 64개의 GPU가 24시간 동안 필요하고, 증류 단계에는 64개의 GPU가 110시간 동안 필요하므로, 중소 규모 팀이 MoE를 실험해 볼 수 있는 진입 장벽이 크게 낮아집니다.
알리바바의 이번 최신 “개량”은 모델 효율성에서의 획기적인 발전이 반드시 매개변수 스태킹에 의존하는 것은 아니며, 혁신적인 훈련 패러다임 또한 질적 도약을 이끌 수 있음을 다시 한번 입증합니다. Marco-Mini-Instruct의 출시는 의심할 여지 없이 엣지 디바이스 및 개인 개발자 시나리오에서 MoE 기술의 도입을 가속화할 것이며, 이는 업계 전체가 주목해야 할 핵심 발전이 될 것입니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






