메이투안, ‘LongCat-Video-Avatar 1.5’ 오픈소스 공개… 주류 비공개 모델보다 우수한 성능 보여
메이투안의 LongCat 대형 모델 팀은 상용급 디지털 휴먼 영상 생성 모델인 ‘LongCat-Video-Avatar 1.5’를 공식적으로 오픈소스로 공개했습니다. 이번 버전은 오픈소스 최첨단 기술에서 실제 상용 배포로 완전히 전환된 것으로, 립싱크, 물리적 사실성, 장편 영상 안정성, 다인 상호작용 및 효율적인 추론 측면에서 크게 개선되었습니다.
상용화 과제를 극복하기 위한 세 가지 핵심 업그레이드
디지털 휴먼이 다양한 실제 애플리케이션에서 안정적으로 작동할 수 있도록, LongCat-Video-Avatar 1.5는 세 가지 포괄적인 개선을 통해 기존 디지털 휴먼 영상에서 지속적으로 발생하던 지터, 왜곡, 높은 지연 시간과 같은 문제를 해결합니다:
상용급 오디오 인코딩 업그레이드
모델의 오디오 특징 추출 인코더가 Wav2Vec2에서 Whisper-large로 업그레이드되었습니다. 더 많은 매개변수와 풍부한 다국어 선행 지식을 바탕으로, 이제 미묘한 음소 변이와 말의 리듬을 포착합니다. 이를 통해 긴 문장, 빠른 말투, 노래와 같은 복잡한 오디오에 대한 입술 동기화를 개선하는 동시에, 표정, 머리 움직임, 말소리 간의 자연스러운 조화를 가능하게 하여 긴 동영상에서 프레임 건너뛰기와 정체성 편차를 현저히 줄입니다.
다단계 데이터 강화를 통한 강력한 오픈 도메인 일반화
실제 사람, 가상 아이돌, 애니메이션 캐릭터, 동물 등 다양한 피사체에 걸쳐 안정적인 성능을 보장하기 위해, 연구팀은 오프라인 주석 부착 및 온라인 검증을 통합한 다단계 데이터 파이프라인을 개발하고, 다음 세 가지 유형의 강화된 데이터를 도입했습니다:
다인물 데이터: 능동적 화자 감지 기술을 활용하여 다인물 장면에서 시청각적 모호성을 제거하고, 화자와 청취자를 정확하게 구분합니다.
침묵 데이터: 음성이 없는 동영상을 선별함으로써, 모델은 침묵 상태에서의 자연스러운 미세 표정을 학습하여, 말하지 않는 캐릭터의 원치 않는 입 움직임을 방지합니다.
감정 데이터: 프레임 단위 감정 인식 필터링과 결합하여 감정적 변동을 반영함으로써, 모델이 말과 얼굴 표정 간의 깊은 연관성을 파악할 수 있도록 돕습니다.
GRPO를 활용한 손 정렬 및 시간적 연속성
손이 자주 노출되는 전자상거래 라이브 스트리밍이나 제품 시연과 같은 사용 사례를 위해, 이 모델은 GRPO(Human Preference Alignment)를 도입하여 보상 신호를 프레임 단위로 정교화하고 첫 번째 프레임 손 탐지 메커니즘을 추가합니다. 이를 통해 손의 왜곡, 국소적 구조 붕괴, 동작 불일치와 같은 일반적인 문제를 대폭 줄입니다.

15배 더 빠른 추론: 막대한 연산 요구 사항 제거
비용은 상용화에 있어 또 다른 중요한 요소입니다. LongCat-Video-Avatar 1.5는 DMD(Distributed Matching Distillation) 기술을 사용하여, 원래 50단계였던 생성 과정을 단 8단계로 압축했습니다. 또한 연구팀은 기존의 3개 모델 병렬 구성을 단일 공유 기본 모델과 여러 개의 LoRA 어댑터로 대체하여 VRAM 사용량을 획기적으로 줄였습니다.
실제 테스트에서 이 모델은 약 15배 더 빠른 추론 속도를 보여주며, 10초 분량의 동영상을 약 1분 만에 생성합니다.
벤치마크 평가: 업계 최고 모델들을 능가하는 성능
EvalTalker 벤치마크를 사용하여 770명의 평가자와 10명의 분야 전문가가 뉴스, 교육, 엔터테인먼트 등 복잡한 분야의 동영상에 대해 체계적인 품질 분석을 수행했습니다. 그 결과, LongCat-Video-Avatar 1.5는 다음과 같은 여러 주요 지표에서 뛰어난 성능을 보였습니다.
사용자 선호도 승률: Kling Avatar 2.0보다 65.9%, OmniHuman-1.5보다 61.1%, HeyGen보다 54.3% 높은 수치를 기록했습니다 .
단일 및 다인 시나리오 점수: 단일 시나리오 점수는 3.336을 기록하여 HeyGen과 같은 경쟁사들을 훨씬 상회했으며, 다인 시나리오 점수는 2.730으로 InfiniteTalk(2.339)보다 현저히 우수한 성과를 보였습니다.
영상 안정성: 피사체 왜곡률은 23.1%에 불과하며, 배경 왜곡률은 9.4%에 그쳤습니다.프레임 누락률은 0.8%로, 비교 대상 모델 중 가장낮은 수치를 기록했습니다.
영상-음성 동기화: 얼굴-신체 동기화 오류율은 5.1%로, 입모양 동기화 오류율은 29.8%로 떨어졌으며, 두 지표 모두 기존 상용 시스템을 능가했습니다.
Meituan LongCat 대형 모델 팀은 LongCat-Video-Avatar 1.5의 오픈소스 공개가 단순한 버전 업데이트를 넘어, 전 세계 개발자 및 크리에이터 커뮤니티에 보내는 초대라고 밝혔습니다. 이들은 이 모델이 검증 가능하고 개선 가능한 기술적 토대가 되어, 디지털 휴먼 비디오 애플리케이션의 실제 적용 범위를 넓히는 데 기여하기를 희망합니다.
오픈 소스 링크:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
기술 보고서: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
프로젝트 페이지: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
모델스코프: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
관련 기사
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과
관련 특별 주제 추천
의견 (0)
0/500
메이투안의 LongCat 대형 모델 팀은 상용급 디지털 휴먼 영상 생성 모델인 ‘LongCat-Video-Avatar 1.5’를 공식적으로 오픈소스로 공개했습니다. 이번 버전은 오픈소스 최첨단 기술에서 실제 상용 배포로 완전히 전환된 것으로, 립싱크, 물리적 사실성, 장편 영상 안정성, 다인 상호작용 및 효율적인 추론 측면에서 크게 개선되었습니다.
상용화 과제를 극복하기 위한 세 가지 핵심 업그레이드
디지털 휴먼이 다양한 실제 애플리케이션에서 안정적으로 작동할 수 있도록, LongCat-Video-Avatar 1.5는 세 가지 포괄적인 개선을 통해 기존 디지털 휴먼 영상에서 지속적으로 발생하던 지터, 왜곡, 높은 지연 시간과 같은 문제를 해결합니다:
상용급 오디오 인코딩 업그레이드
모델의 오디오 특징 추출 인코더가 Wav2Vec2에서 Whisper-large로 업그레이드되었습니다. 더 많은 매개변수와 풍부한 다국어 선행 지식을 바탕으로, 이제 미묘한 음소 변이와 말의 리듬을 포착합니다. 이를 통해 긴 문장, 빠른 말투, 노래와 같은 복잡한 오디오에 대한 입술 동기화를 개선하는 동시에, 표정, 머리 움직임, 말소리 간의 자연스러운 조화를 가능하게 하여 긴 동영상에서 프레임 건너뛰기와 정체성 편차를 현저히 줄입니다.
다단계 데이터 강화를 통한 강력한 오픈 도메인 일반화
실제 사람, 가상 아이돌, 애니메이션 캐릭터, 동물 등 다양한 피사체에 걸쳐 안정적인 성능을 보장하기 위해, 연구팀은 오프라인 주석 부착 및 온라인 검증을 통합한 다단계 데이터 파이프라인을 개발하고, 다음 세 가지 유형의 강화된 데이터를 도입했습니다:
다인물 데이터: 능동적 화자 감지 기술을 활용하여 다인물 장면에서 시청각적 모호성을 제거하고, 화자와 청취자를 정확하게 구분합니다.
침묵 데이터: 음성이 없는 동영상을 선별함으로써, 모델은 침묵 상태에서의 자연스러운 미세 표정을 학습하여, 말하지 않는 캐릭터의 원치 않는 입 움직임을 방지합니다.
감정 데이터: 프레임 단위 감정 인식 필터링과 결합하여 감정적 변동을 반영함으로써, 모델이 말과 얼굴 표정 간의 깊은 연관성을 파악할 수 있도록 돕습니다.
GRPO를 활용한 손 정렬 및 시간적 연속성
손이 자주 노출되는 전자상거래 라이브 스트리밍이나 제품 시연과 같은 사용 사례를 위해, 이 모델은 GRPO(Human Preference Alignment)를 도입하여 보상 신호를 프레임 단위로 정교화하고 첫 번째 프레임 손 탐지 메커니즘을 추가합니다. 이를 통해 손의 왜곡, 국소적 구조 붕괴, 동작 불일치와 같은 일반적인 문제를 대폭 줄입니다.

15배 더 빠른 추론: 막대한 연산 요구 사항 제거
비용은 상용화에 있어 또 다른 중요한 요소입니다. LongCat-Video-Avatar 1.5는 DMD(Distributed Matching Distillation) 기술을 사용하여, 원래 50단계였던 생성 과정을 단 8단계로 압축했습니다. 또한 연구팀은 기존의 3개 모델 병렬 구성을 단일 공유 기본 모델과 여러 개의 LoRA 어댑터로 대체하여 VRAM 사용량을 획기적으로 줄였습니다.
실제 테스트에서 이 모델은 약 15배 더 빠른 추론 속도를 보여주며, 10초 분량의 동영상을 약 1분 만에 생성합니다.
벤치마크 평가: 업계 최고 모델들을 능가하는 성능
EvalTalker 벤치마크를 사용하여 770명의 평가자와 10명의 분야 전문가가 뉴스, 교육, 엔터테인먼트 등 복잡한 분야의 동영상에 대해 체계적인 품질 분석을 수행했습니다. 그 결과, LongCat-Video-Avatar 1.5는 다음과 같은 여러 주요 지표에서 뛰어난 성능을 보였습니다.
사용자 선호도 승률: Kling Avatar 2.0보다 65.9%, OmniHuman-1.5보다 61.1%, HeyGen보다 54.3% 높은 수치를 기록했습니다 .
단일 및 다인 시나리오 점수: 단일 시나리오 점수는 3.336을 기록하여 HeyGen과 같은 경쟁사들을 훨씬 상회했으며, 다인 시나리오 점수는 2.730으로 InfiniteTalk(2.339)보다 현저히 우수한 성과를 보였습니다.
영상 안정성: 피사체 왜곡률은 23.1%에 불과하며, 배경 왜곡률은 9.4%에 그쳤습니다.프레임 누락률은 0.8%로, 비교 대상 모델 중 가장낮은 수치를 기록했습니다.
영상-음성 동기화: 얼굴-신체 동기화 오류율은 5.1%로, 입모양 동기화 오류율은 29.8%로 떨어졌으며, 두 지표 모두 기존 상용 시스템을 능가했습니다.
Meituan LongCat 대형 모델 팀은 LongCat-Video-Avatar 1.5의 오픈소스 공개가 단순한 버전 업데이트를 넘어, 전 세계 개발자 및 크리에이터 커뮤니티에 보내는 초대라고 밝혔습니다. 이들은 이 모델이 검증 가능하고 개선 가능한 기술적 토대가 되어, 디지털 휴먼 비디오 애플리케이션의 실제 적용 범위를 넓히는 데 기여하기를 희망합니다.
오픈 소스 링크:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
기술 보고서: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
프로젝트 페이지: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
모델스코프: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
AI 도구를 활용한 성적표 코멘트 작성 간소화서론성적표 코멘트 생성을 위한 AI 도구매직 스쿨(Magic School)알마낙 AI(Almanac AI)챗 GPT(Chat GPT)매직 스쿨을 사용하여 성적표 코멘트 생성하기매직 스쿨 로그인성적표 코멘트 도구 선택학생별 코멘트 맞춤 설정알마낙 AI를 사용하여 성적표 코멘트 생성하기과정 및 평가 체계 설정성적표 분량 및 학생 정보 구성알마낙 AI를 통한 코멘트 생성매직 스쿨과





집






