샤오미의 오픈소스 TTS 모델 ‘OmniVoice’는 600개 이상의 언어에서 제로샷 복제를 지원한다
최근 샤오미의 차세대 Kaldi 팀(k2-fsa)은 600개 이상의 언어를 지원하는 대규모 다국어 제로샷 텍스트-투-스피치 모델인 ‘OmniVoice’를 공식적으로 오픈소스로 공개했습니다. 이 모델은 중국어, 영어 및 다국어 합성 분야의 여러 주요 벤치마크에서 최첨단 성능을 달성하며, 해당 분야에 획기적인 돌파구를 마련했습니다.
선도적인 성능: 중국어 WER 0.84% 달성, 다국어 테스트에서 주류 모델들 제치다
Seed-TTS 중국어 테스트 세트에서 OmniVoice는 0.84%라는 놀라울 정도로 낮은 단어 오류율(WER)을 기록했습니다. 다국어 평가에서는 유사도(SIM-o) 및 WER 점수가 ElevenLabs v2, MiniMax와 같은 유명 상용 모델들을 능가하며, 탁월한 음성 자연도와 명료성을 입증했습니다.

초고속 추론: RTF 0.025초로, 실시간보다 40배 빠름
OmniVoice는 0.025에 불과한 실시간 계수(RTF)를 자랑하며, 이는 합성 속도가 실시간 요구 사항을 훨씬 뛰어넘는다는 것을 의미합니다. 이러한 획기적인 효율성 향상으로 실제 응용 분야에서 긴 형식의 음성을 신속하게 생성할 수 있어 사용자 경험을 크게 향상시킵니다.
핵심 아키텍처 혁신: 확산 모델에서 영감을 받은 이산 비자기회귀 설계
OmniVoice는 확산 언어 모델에서 영감을 받은 새로운 이산 비자율 회귀 아키텍처를 채택했습니다. 이 모델은 기존의 중간 의미 토큰 단계를 생략하고 단일 단계에서 텍스트를 음성으로 직접 생성합니다. 이러한 간소화된 설계는 높은 출력 품질을 유지하면서도 파이프라인을 단순화합니다. 사전 훈련된 LLM 초기화와 결합된 전체 코드북 무작위 마스킹 전략은 훈련 효율을 더욱 높이고 최종 음성의 명료성과 이해도를 향상시킵니다.
유연한 음성 복제 및 맞춤 설정: 단 3~10초의 오디오만으로 작동
이 모델은 단 3~10초 분량의 참조 오디오만으로도 고품질의 제로샷 음성 복제를 지원합니다. 또한 사용자는 자연어 프롬프트를 통해 성별, 연령, 음높이, 억양, 방언은 물론 속삭임과 같은 특수 효과까지 지정하여 음성 속성을 맞춤 설정할 수 있습니다.
비언어적 기호 처리 및 세밀한 발음 제어
OmniVoice는 [웃음]과 같은 비언어적 기호를 처리할 수 있으며, 병음이나 발음 기호를 통한 발음 교정을 지원합니다. 이로 인해 중국어 및 다양한 방언의 정밀한 합성에 특히 적합합니다.
600개 이상의 언어 지원: 소수 언어 및 멸종 위기 언어의 디지털 보존 지원
OmniVoice의 주요 특징은 광범위한 언어 지원으로, 주요 언어와 수많은 저자원 언어를 모두 효율적으로 지원합니다. 소수 언어 및 멸종 위기 언어의 경우, 최소한의 데이터 샘플로도 고품질 음성을 생성할 수 있어 디지털 언어 보존 및 문화 보호에 큰 잠재력을 제공합니다.
OmniVoice의 소스 코드와 사전 훈련된 모델은 현재 GitHub 및 Hugging Face에 오픈소스로 공개되어 있어, 개발자들이 로컬에 배포하거나 애플리케이션에 통합할 수 있습니다. AIbase는 커뮤니티의 피드백과 실제 사용 사례를 지속적으로 모니터링할 예정입니다. 개발자 여러분의 경험 공유를 환영합니다.
프로젝트 링크: https://github.com/k2-fsa/OmniVoice
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
최근 샤오미의 차세대 Kaldi 팀(k2-fsa)은 600개 이상의 언어를 지원하는 대규모 다국어 제로샷 텍스트-투-스피치 모델인 ‘OmniVoice’를 공식적으로 오픈소스로 공개했습니다. 이 모델은 중국어, 영어 및 다국어 합성 분야의 여러 주요 벤치마크에서 최첨단 성능을 달성하며, 해당 분야에 획기적인 돌파구를 마련했습니다.
선도적인 성능: 중국어 WER 0.84% 달성, 다국어 테스트에서 주류 모델들 제치다
Seed-TTS 중국어 테스트 세트에서 OmniVoice는 0.84%라는 놀라울 정도로 낮은 단어 오류율(WER)을 기록했습니다. 다국어 평가에서는 유사도(SIM-o) 및 WER 점수가 ElevenLabs v2, MiniMax와 같은 유명 상용 모델들을 능가하며, 탁월한 음성 자연도와 명료성을 입증했습니다.

초고속 추론: RTF 0.025초로, 실시간보다 40배 빠름
OmniVoice는 0.025에 불과한 실시간 계수(RTF)를 자랑하며, 이는 합성 속도가 실시간 요구 사항을 훨씬 뛰어넘는다는 것을 의미합니다. 이러한 획기적인 효율성 향상으로 실제 응용 분야에서 긴 형식의 음성을 신속하게 생성할 수 있어 사용자 경험을 크게 향상시킵니다.
핵심 아키텍처 혁신: 확산 모델에서 영감을 받은 이산 비자기회귀 설계
OmniVoice는 확산 언어 모델에서 영감을 받은 새로운 이산 비자율 회귀 아키텍처를 채택했습니다. 이 모델은 기존의 중간 의미 토큰 단계를 생략하고 단일 단계에서 텍스트를 음성으로 직접 생성합니다. 이러한 간소화된 설계는 높은 출력 품질을 유지하면서도 파이프라인을 단순화합니다. 사전 훈련된 LLM 초기화와 결합된 전체 코드북 무작위 마스킹 전략은 훈련 효율을 더욱 높이고 최종 음성의 명료성과 이해도를 향상시킵니다.
유연한 음성 복제 및 맞춤 설정: 단 3~10초의 오디오만으로 작동
이 모델은 단 3~10초 분량의 참조 오디오만으로도 고품질의 제로샷 음성 복제를 지원합니다. 또한 사용자는 자연어 프롬프트를 통해 성별, 연령, 음높이, 억양, 방언은 물론 속삭임과 같은 특수 효과까지 지정하여 음성 속성을 맞춤 설정할 수 있습니다.
비언어적 기호 처리 및 세밀한 발음 제어
OmniVoice는 [웃음]과 같은 비언어적 기호를 처리할 수 있으며, 병음이나 발음 기호를 통한 발음 교정을 지원합니다. 이로 인해 중국어 및 다양한 방언의 정밀한 합성에 특히 적합합니다.
600개 이상의 언어 지원: 소수 언어 및 멸종 위기 언어의 디지털 보존 지원
OmniVoice의 주요 특징은 광범위한 언어 지원으로, 주요 언어와 수많은 저자원 언어를 모두 효율적으로 지원합니다. 소수 언어 및 멸종 위기 언어의 경우, 최소한의 데이터 샘플로도 고품질 음성을 생성할 수 있어 디지털 언어 보존 및 문화 보호에 큰 잠재력을 제공합니다.
OmniVoice의 소스 코드와 사전 훈련된 모델은 현재 GitHub 및 Hugging Face에 오픈소스로 공개되어 있어, 개발자들이 로컬에 배포하거나 애플리케이션에 통합할 수 있습니다. AIbase는 커뮤니티의 피드백과 실제 사용 사례를 지속적으로 모니터링할 예정입니다. 개발자 여러분의 경험 공유를 환영합니다.
프로젝트 링크: https://github.com/k2-fsa/OmniVoice
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






