알리바바의 통이(Tongyi), ‘Fun-CineForge’ 공개: 영화급 음성 합성을 구현한 오픈소스 AI 모델
알리바바 통이 랩(Alibaba Tongyi Lab)은 3월 16일, 영화급 품질의 다중 시나리오 음성 합성 다중 모달 모델인 ‘Fun-CineForge’를 공식 출시하고 오픈소스로 공개했다. 이 모델은 입모양 동기화 불일치, 감정 표현 부족, 여러 캐릭터 간 음성 특성 불일치 등 AI 더빙의 핵심 과제를 해결한다. 또한 고품질 데이터셋 구축 방법도 제시한다.

기술적으로 Fun-CineForge는 '시간적 모달리티(temporal modality)' 개념을 최초로 도입했다. 텍스트나 영상 중 하나에만 집중하는 기존 모델과 달리, 이 모델은 정확한 타임스탬프 제어를 통해 음성 합성이 정밀한 시간 간격 내에서 이루어지도록 보장한다. 캐릭터가 가려지거나, 카메라 컷이 잦거나, 얼굴이 흐릿한 복잡한 영화 장면에서도 이 모델은 높은 수준의 영상-음성 동기화와 지시 사항 준수를 유지한다.
함께 공개된 오픈소스 CineDub 데이터셋 구축 파이프라인은 또 다른 핵심 혁신입니다. Tongyi Lab은 대규모 언어 모델의 연쇄적 사고 추론(chain-of-thought reasoning)을 활용하여 원본 영화 영상을 구조화된 데이터로 자동 변환함으로써, 수동 주석 작업의 필요성을 대폭 줄였습니다. 이 프로세스는 약 1%의 단어 오류율과 1.20%에 불과한 화자 식별 오류율을 달성하여, 대규모 모델을 위한 매우 경쟁력 있는 훈련 기반을 제공합니다.

Fun-CineForge는 현재 GitHub, HuggingFace 및 ModelScope 커뮤니티에서 이용 가능하며, 최대 30초 길이의 동영상 클립에 대한 추론을 지원합니다. 이 모델은 단일 화자의 독백뿐만 아니라 듀엣 및 다중 화자 대화 시나리오에 대해서도 전문가 수준의 지원을 제공합니다. 이러한 발전은 AI 음성 기술이 기본적인 고객 서비스 및 비서 역할에서 고품질의 애니메이션 및 영화 후반 제작 분야로 진화하고 있음을 시사합니다.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (1)
0/500
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
알리바바 통이 랩(Alibaba Tongyi Lab)은 3월 16일, 영화급 품질의 다중 시나리오 음성 합성 다중 모달 모델인 ‘Fun-CineForge’를 공식 출시하고 오픈소스로 공개했다. 이 모델은 입모양 동기화 불일치, 감정 표현 부족, 여러 캐릭터 간 음성 특성 불일치 등 AI 더빙의 핵심 과제를 해결한다. 또한 고품질 데이터셋 구축 방법도 제시한다.

기술적으로 Fun-CineForge는 '시간적 모달리티(temporal modality)' 개념을 최초로 도입했다. 텍스트나 영상 중 하나에만 집중하는 기존 모델과 달리, 이 모델은 정확한 타임스탬프 제어를 통해 음성 합성이 정밀한 시간 간격 내에서 이루어지도록 보장한다. 캐릭터가 가려지거나, 카메라 컷이 잦거나, 얼굴이 흐릿한 복잡한 영화 장면에서도 이 모델은 높은 수준의 영상-음성 동기화와 지시 사항 준수를 유지한다.
함께 공개된 오픈소스 CineDub 데이터셋 구축 파이프라인은 또 다른 핵심 혁신입니다. Tongyi Lab은 대규모 언어 모델의 연쇄적 사고 추론(chain-of-thought reasoning)을 활용하여 원본 영화 영상을 구조화된 데이터로 자동 변환함으로써, 수동 주석 작업의 필요성을 대폭 줄였습니다. 이 프로세스는 약 1%의 단어 오류율과 1.20%에 불과한 화자 식별 오류율을 달성하여, 대규모 모델을 위한 매우 경쟁력 있는 훈련 기반을 제공합니다.

Fun-CineForge는 현재 GitHub, HuggingFace 및 ModelScope 커뮤니티에서 이용 가능하며, 최대 30초 길이의 동영상 클립에 대한 추론을 지원합니다. 이 모델은 단일 화자의 독백뿐만 아니라 듀엣 및 다중 화자 대화 시나리오에 대해서도 전문가 수준의 지원을 제공합니다. 이러한 발전은 AI 음성 기술이 기본적인 고객 서비스 및 비서 역할에서 고품질의 애니메이션 및 영화 후반 제작 분야로 진화하고 있음을 시사합니다.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.





집






