바이트댄스, 시각 및 언어 이해·생성을 위한 통합 모델 ‘Lance 3B’ 공개
바이트댄스 리서치(ByteDance Research)는 자사의 네이티브 통합 다중 모달 대규모 모델인 ‘Lance’를 공식적으로 오픈소스로 공개했습니다.
일반적으로 AI 업계는 수천억 또는 수조 개의 매개변수를 가진 모델이나 개별 구성 요소를 결합하여 조립한 모델에 의존하는 반면, ‘Lance’는 획기적인 돌파구를 마련했습니다. 이 모델은 3B(30억)라는 매우 경량화된 활성화 매개변수 수로도 완전한 기능을 제공함으로써, ‘이해 모델(VLM)’과 ‘생성 모델(DiT/Diffusion)’ 사이의 기술적 격차를 효과적으로 해소합니다.

주요 특징:
본질적으로 통합된 구조: 기존 모델을 단순히 이어붙인 것이 아니라 처음부터 새로 구축되어, 이미지 및 동영상 이해, 생성, 교차 모달 편집 기능을 단일 시스템에 통합했습니다.
포괄적인 성능: 단일 모델이 $X rightarrow T$(텍스트/영상 이해), $X rightarrow I$(이미지 생성/편집), $X rightarrow V$(영상 생성/편집) 등 세 가지 핵심 출력 작업을 원활하게 처리합니다.
오픈 소스 및 무료: 매우 자유로운 Apache 2.0 라이선스 하에 공개되었습니다. 가중치는 Hugging Face에서 완전히 제공되며, 전체 프로세스는 128개의 A100 GPU라는 적당한 예산으로도 실행할 수 있습니다.
기술적 분석: 상반된 요구 사항 간의 “동기화”는 어떻게 달성되는가?
기존 AI 아키텍처에서 “이해”와 “생성” 기능은 종종 상충되는 관계에 있었습니다. 이해 작업은 고수준의 의미적 특징을 추출하기 위해 노이즈를 필터링해야 하는 반면, 생성 작업은 저수준의 텍스처, 기하학적 구조 및 시간적 역학에 중점을 둡니다.
이러한 업계 전반의 과제를 해결하기 위해 Lance는 독창적인 “공유 컨텍스트 + 병렬 기능 분리” 설계를 채택했습니다:
1. 통합 인터리브 시퀀스 및 듀얼 스트림 전문가 아키텍처
모든 텍스트, 이미지, 동영상 입력은 먼저 토큰화되어 통합된 ‘인터리브 시퀀스’로 변환됩니다. 이 시퀀스는 이후 듀얼 스트림 MoE(Multi-Expert) 아키텍처에 의해 처리되며, 이를 통해 ‘이해’와 ‘생성’을 전담하는 전문가들이 독립적으로 작동함으로써 기능 간의 충돌을 효과적으로 해결합니다.
이해 측면: 텍스트 토큰과 시각적 입력은 Qwen2.5-VL의 임베딩 레이어와 ViT 인코더를 활용하여 고수준의 의미적 시각 토큰을 정확하게 추출합니다.
생성 측: 시각적 입력은 Wan2.2의 강력한 3D 인과적 VAE를 통해 압축되어 공간적 다운샘플링은 $16배$, 시간적 다운샘플링은 $4배$를 달성함으로써, 세부적이고 동적인 연속적 표현을 보존합니다.
2. MaPE (모달 인식 회전 위치 인코딩)
긴 시퀀스 내의 혼합 시각 토큰(이미지, 텍스트, 동영상)은 “경계 혼동” 환각을 유발할 수 있습니다. Lance는 서로 다른 모달 그룹에 고정된 시간 오프셋을 추가하는 MaPE 메커니즘을 도입합니다. 이 우아한 설계는 이미지와 동영상의 내부 구조 및 시간적 순서를 방해하지 않으면서도 강력한 공간적·시간적 경계 식별을 가능하게 합니다.
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
4단계 익스트림 트레이닝: 128개의 GPU를 활용한 “절약형 전투”
수천 대의 GPU를 사용하는 대기업들의 “무차별적인 접근 방식”과는 대조적으로, Lance의 훈련 과정은 높은 비용 효율성을 보여줍니다. 전체 라이프사이클은 최대 128대의 GPU라는 엄격한 예산 한도 내에서 진행되며, 긴밀하게 통합된 다음 네 단계로 구성됩니다:
1단계: 사전 훈련 (1.5T 토큰) —— 10억 개의 이미지-텍스트 쌍과 1억 4천만 개의 동영상-텍스트 쌍을 처리하여 다중 모달 이해를 위한 견고한 기반을 마련합니다.
2단계: 지속적 훈련 (300B 토큰) —— 편집, 주제 중심 생성, 다중 모달 이해 데이터를 통합하여 다중 작업 시너지를 활성화합니다.
3단계: 지도형 미세 조정 (72B 토큰) —— 인간의 지시를 광범위하게 도입하여, 지시 이행 및 시각적 정체성 일관성에 중점을 둡니다.
4단계: 강화 학습 (GRPO 알고리즘) —— 그룹 기반 상대 정책 최적화를 활용하며, 특히 PaddleOCR을 보상 모델로 채택하여 부정확한 텍스트 렌더링 및 텍스트와 이미지 간의 정렬 불일치와 같은 AI 문제를 구체적으로 해결합니다.
탁월한 성과: 3B 모델, 여러 분야에서 7B 거대 모델들을 제치다
크로스 태스크 데이터 협업(모델이 생성을 학습하면서 이해를 심화하고, 이해를 학습하면서 생성을 향상시키는 방식) 덕분에, 3B 규모의 Lance는 다양한 벤치마크에서 놀라운 성과를 거두었습니다:
영상 생성(VBench): 85.11점을 기록했습니다! 이는 TUNA(84.06)와 같은 유사한 올인원 모델을 능가했을 뿐만 아니라, HunyuanVideo(83.33) 및 Wan2.1-T2V(83.69)와 같은 전문 동영상 생성 모델보다도 우수한 성과를 보였습니다.
이미지 생성(GenEval): 0.90점을 기록하며, 전 세계 오픈소스 모델 중 확고한 선두 자리를 차지했습니다.
동영상 이해 (MVBench): 62.0점을 기록하여, Lance의 두 배 규모인 전용 이해 모델 Show-o2 (7B, 55.7점)를 크게 앞질렀습니다.
업계에 파장을 일으킬 전망: 다중 모달 애플리케이션의 배포 비용이 급격히 하락할 것
Lance의 오픈소스화는 특히 AI 단편 영화, 지능형 에이전트(Agent) 협업, 인터랙티브 미디어와 같은 급성장하는 분야에서 산업에 큰 파장을 일으킬 것입니다.
이전에는 대본을 이해하고, 스토리보드를 생성하며, 캐릭터의 일관성을 유지하면서 실시간으로 영상을 수정할 수 있는 AI 도구를 개발하려면 여러 개의 대규모 모델(VLM 의미론용 1개, 디퓨전 이미지 생성용 1개, 시간적 동영상용 1개)을 배포하고, 스케줄링하고, 결합해야 했습니다. 이는 시스템 지연 시간을 유발할 뿐만 아니라, 개발자들에게 파이프라인 정렬 작업을 악몽처럼 만들었습니다.
이제 Lance3B는 단일 모델로 “왼쪽 눈으로 보고, 오른쪽 눈으로 편집하며, 양손으로 창작하는” 것을 실현합니다.
관련 기사
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
관련 특별 주제 추천
의견 (0)
0/500
바이트댄스 리서치(ByteDance Research)는 자사의 네이티브 통합 다중 모달 대규모 모델인 ‘Lance’를 공식적으로 오픈소스로 공개했습니다.
일반적으로 AI 업계는 수천억 또는 수조 개의 매개변수를 가진 모델이나 개별 구성 요소를 결합하여 조립한 모델에 의존하는 반면, ‘Lance’는 획기적인 돌파구를 마련했습니다. 이 모델은 3B(30억)라는 매우 경량화된 활성화 매개변수 수로도 완전한 기능을 제공함으로써, ‘이해 모델(VLM)’과 ‘생성 모델(DiT/Diffusion)’ 사이의 기술적 격차를 효과적으로 해소합니다.

주요 특징:
본질적으로 통합된 구조: 기존 모델을 단순히 이어붙인 것이 아니라 처음부터 새로 구축되어, 이미지 및 동영상 이해, 생성, 교차 모달 편집 기능을 단일 시스템에 통합했습니다.
포괄적인 성능: 단일 모델이 $X rightarrow T$(텍스트/영상 이해), $X rightarrow I$(이미지 생성/편집), $X rightarrow V$(영상 생성/편집) 등 세 가지 핵심 출력 작업을 원활하게 처리합니다.
오픈 소스 및 무료: 매우 자유로운 Apache 2.0 라이선스 하에 공개되었습니다. 가중치는 Hugging Face에서 완전히 제공되며, 전체 프로세스는 128개의 A100 GPU라는 적당한 예산으로도 실행할 수 있습니다.
기술적 분석: 상반된 요구 사항 간의 “동기화”는 어떻게 달성되는가?
기존 AI 아키텍처에서 “이해”와 “생성” 기능은 종종 상충되는 관계에 있었습니다. 이해 작업은 고수준의 의미적 특징을 추출하기 위해 노이즈를 필터링해야 하는 반면, 생성 작업은 저수준의 텍스처, 기하학적 구조 및 시간적 역학에 중점을 둡니다.
이러한 업계 전반의 과제를 해결하기 위해 Lance는 독창적인 “공유 컨텍스트 + 병렬 기능 분리” 설계를 채택했습니다:
1. 통합 인터리브 시퀀스 및 듀얼 스트림 전문가 아키텍처
모든 텍스트, 이미지, 동영상 입력은 먼저 토큰화되어 통합된 ‘인터리브 시퀀스’로 변환됩니다. 이 시퀀스는 이후 듀얼 스트림 MoE(Multi-Expert) 아키텍처에 의해 처리되며, 이를 통해 ‘이해’와 ‘생성’을 전담하는 전문가들이 독립적으로 작동함으로써 기능 간의 충돌을 효과적으로 해결합니다.
이해 측면: 텍스트 토큰과 시각적 입력은 Qwen2.5-VL의 임베딩 레이어와 ViT 인코더를 활용하여 고수준의 의미적 시각 토큰을 정확하게 추출합니다.
생성 측: 시각적 입력은 Wan2.2의 강력한 3D 인과적 VAE를 통해 압축되어 공간적 다운샘플링은 $16배$, 시간적 다운샘플링은 $4배$를 달성함으로써, 세부적이고 동적인 연속적 표현을 보존합니다.
2. MaPE (모달 인식 회전 위치 인코딩)
긴 시퀀스 내의 혼합 시각 토큰(이미지, 텍스트, 동영상)은 “경계 혼동” 환각을 유발할 수 있습니다. Lance는 서로 다른 모달 그룹에 고정된 시간 오프셋을 추가하는 MaPE 메커니즘을 도입합니다. 이 우아한 설계는 이미지와 동영상의 내부 구조 및 시간적 순서를 방해하지 않으면서도 강력한 공간적·시간적 경계 식별을 가능하게 합니다.
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
4단계 익스트림 트레이닝: 128개의 GPU를 활용한 “절약형 전투”
수천 대의 GPU를 사용하는 대기업들의 “무차별적인 접근 방식”과는 대조적으로, Lance의 훈련 과정은 높은 비용 효율성을 보여줍니다. 전체 라이프사이클은 최대 128대의 GPU라는 엄격한 예산 한도 내에서 진행되며, 긴밀하게 통합된 다음 네 단계로 구성됩니다:
1단계: 사전 훈련 (1.5T 토큰) —— 10억 개의 이미지-텍스트 쌍과 1억 4천만 개의 동영상-텍스트 쌍을 처리하여 다중 모달 이해를 위한 견고한 기반을 마련합니다.
2단계: 지속적 훈련 (300B 토큰) —— 편집, 주제 중심 생성, 다중 모달 이해 데이터를 통합하여 다중 작업 시너지를 활성화합니다.
3단계: 지도형 미세 조정 (72B 토큰) —— 인간의 지시를 광범위하게 도입하여, 지시 이행 및 시각적 정체성 일관성에 중점을 둡니다.
4단계: 강화 학습 (GRPO 알고리즘) —— 그룹 기반 상대 정책 최적화를 활용하며, 특히 PaddleOCR을 보상 모델로 채택하여 부정확한 텍스트 렌더링 및 텍스트와 이미지 간의 정렬 불일치와 같은 AI 문제를 구체적으로 해결합니다.
탁월한 성과: 3B 모델, 여러 분야에서 7B 거대 모델들을 제치다
크로스 태스크 데이터 협업(모델이 생성을 학습하면서 이해를 심화하고, 이해를 학습하면서 생성을 향상시키는 방식) 덕분에, 3B 규모의 Lance는 다양한 벤치마크에서 놀라운 성과를 거두었습니다:
영상 생성(VBench): 85.11점을 기록했습니다! 이는 TUNA(84.06)와 같은 유사한 올인원 모델을 능가했을 뿐만 아니라, HunyuanVideo(83.33) 및 Wan2.1-T2V(83.69)와 같은 전문 동영상 생성 모델보다도 우수한 성과를 보였습니다.
이미지 생성(GenEval): 0.90점을 기록하며, 전 세계 오픈소스 모델 중 확고한 선두 자리를 차지했습니다.
동영상 이해 (MVBench): 62.0점을 기록하여, Lance의 두 배 규모인 전용 이해 모델 Show-o2 (7B, 55.7점)를 크게 앞질렀습니다.
업계에 파장을 일으킬 전망: 다중 모달 애플리케이션의 배포 비용이 급격히 하락할 것
Lance의 오픈소스화는 특히 AI 단편 영화, 지능형 에이전트(Agent) 협업, 인터랙티브 미디어와 같은 급성장하는 분야에서 산업에 큰 파장을 일으킬 것입니다.
이전에는 대본을 이해하고, 스토리보드를 생성하며, 캐릭터의 일관성을 유지하면서 실시간으로 영상을 수정할 수 있는 AI 도구를 개발하려면 여러 개의 대규모 모델(VLM 의미론용 1개, 디퓨전 이미지 생성용 1개, 시간적 동영상용 1개)을 배포하고, 스케줄링하고, 결합해야 했습니다. 이는 시스템 지연 시간을 유발할 뿐만 아니라, 개발자들에게 파이프라인 정렬 작업을 악몽처럼 만들었습니다.
이제 Lance3B는 단일 모델로 “왼쪽 눈으로 보고, 오른쪽 눈으로 편집하며, 양손으로 창작하는” 것을 실현합니다.
법적 분쟁 속에서 Suno의 워터마크 삽입
Suno는 사용자가 AI 생성 음악을 생성할 수 있게 하는 플랫폼으로, 플랫폼에서 생성된 트랙에 레이블을 지정하고 다운로드를 제한하며, 무단 복제를 억제하기 위해 커뮤니티 기준을 업데이트하는 새로운 기능을 공개했습니다. 이러한 업데이트는 Suno가 레이블 및 아티스트 조직으로부터 여러 소송에 직면하는 시점에 이루어집니다.공동 창립자이자 CEO인 Mikey Shulman은 블로그 게시물을 통해 핵심 원칙을 제시하며, 플랫폼이 광범위한 청중을 대
머스크, Grok 구축 과정에서 사용자 코드 유출 인정, 모든 과거 데이터 삭제 약속
Elon Musk는 Grok Build와 관련된 프라이버시 논란에 대해 직접적으로 언급하며, 사건의 타당성을 확인하기 위해 간단한 "True"로 답변했습니다. 그는 SpaceXAI에 이전에 업로드된 모든 사용자 데이터를 영구적으로 삭제하겠다고 약속하며, "바이트 하나도 남기지 않겠다"고 밝혔습니다. 이는 주요 기술 리더가 실수를 공개적으로 인정하고 사용자 데이터를 능동적으로 삭제한 AI 산업 최초의 사례입니다.안전 연구원의 '피싱' 테스트는
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금





집






