小米的 OmniVoice 開源 TTS 模型實現了橫跨 600 多種語言的零樣本克隆
近日,小米的下一代 Kaldi 團隊(k2-fsa)正式開源了 OmniVoice,這是一款支援超過 600 種語言的大型多語言零樣本文字轉語音模型。該模型在中文、英文及多語言合成等多項關鍵基準測試中均取得業界領先的成績,標誌著該領域取得重大突破。
領先表現:中文 WER 低至 0.84%,多語言測試中超越主流模型
在 Seed-TTS 中文測試集上,OmniVoice 達到了僅 0.84% 的驚人低詞錯誤率 (WER)。在多語言評估中,其相似度 (SIM-o) 和 WER 分數超越了 ElevenLabs v2 和 MiniMax 等知名商用模型,展現出卓越的語音自然度與清晰度。

超高速推論:RTF 低至 0.025,速度比即時處理快 40 倍
OmniVoice 的即時因子 (RTF) 低至 0.025,意味著其合成速度遠超即時要求。這項巨大的效能提升,使系統能在實際應用中快速生成長篇語音,大幅提升使用者體驗。
核心架構創新:受擴散模型啟發的離散非自迴歸設計
OmniVoice 採用受擴散語言模型啟發的創新離散非自迴歸架構。它能透過單一步驟將文字轉化為語音,省略了傳統的中間語義標記。此精簡設計在維持高輸出品質的同時,也簡化了處理流程。結合預訓練大型語言模型(LLM)的初始化,以及完整的碼本隨機遮罩策略,進一步提升了訓練效率,並改善了最終語音的清晰度與可懂度。
靈活的聲音複製與自訂功能:僅需 3 至 10 秒的音訊即可運作
該模型僅需 3 至 10 秒的參考音訊,即可實現高品質的零樣本語音克隆。使用者還能透過自然語言提示自訂語音屬性,指定性別、年齡、音高、口音、方言,甚至包括耳語等特殊效果。
支援非語言符號與細緻發音控制
OmniVoice 能處理非語言符號(如 [笑聲]),並支援透過拼音或音標進行發音修正。這使其特別適合用於中文及各類方言的精準合成。
支援 600 多種語言:協助少數民族語言與瀕危語言的數位保存
OmniVoice 的關鍵亮點在於其廣泛的語言覆蓋範圍,能高效支援主要語言及眾多資源匱乏的語言。對於少數民族語言及瀕危語言,它僅需極少的數據樣本即可生成高品質語音,為數位語言保存與文化保護提供了巨大潛力。
OmniVoice 的原始碼與預訓練模型現已於 GitHub 和 Hugging Face 開源,開發者可自行部署或整合至應用程式中。AIbase 將持續關注社群回饋與實際應用案例,並鼓勵開發者分享使用經驗。
專案連結:https://github.com/k2-fsa/OmniVoice
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (0)
0/500
近日,小米的下一代 Kaldi 團隊(k2-fsa)正式開源了 OmniVoice,這是一款支援超過 600 種語言的大型多語言零樣本文字轉語音模型。該模型在中文、英文及多語言合成等多項關鍵基準測試中均取得業界領先的成績,標誌著該領域取得重大突破。
領先表現:中文 WER 低至 0.84%,多語言測試中超越主流模型
在 Seed-TTS 中文測試集上,OmniVoice 達到了僅 0.84% 的驚人低詞錯誤率 (WER)。在多語言評估中,其相似度 (SIM-o) 和 WER 分數超越了 ElevenLabs v2 和 MiniMax 等知名商用模型,展現出卓越的語音自然度與清晰度。

超高速推論:RTF 低至 0.025,速度比即時處理快 40 倍
OmniVoice 的即時因子 (RTF) 低至 0.025,意味著其合成速度遠超即時要求。這項巨大的效能提升,使系統能在實際應用中快速生成長篇語音,大幅提升使用者體驗。
核心架構創新:受擴散模型啟發的離散非自迴歸設計
OmniVoice 採用受擴散語言模型啟發的創新離散非自迴歸架構。它能透過單一步驟將文字轉化為語音,省略了傳統的中間語義標記。此精簡設計在維持高輸出品質的同時,也簡化了處理流程。結合預訓練大型語言模型(LLM)的初始化,以及完整的碼本隨機遮罩策略,進一步提升了訓練效率,並改善了最終語音的清晰度與可懂度。
靈活的聲音複製與自訂功能:僅需 3 至 10 秒的音訊即可運作
該模型僅需 3 至 10 秒的參考音訊,即可實現高品質的零樣本語音克隆。使用者還能透過自然語言提示自訂語音屬性,指定性別、年齡、音高、口音、方言,甚至包括耳語等特殊效果。
支援非語言符號與細緻發音控制
OmniVoice 能處理非語言符號(如 [笑聲]),並支援透過拼音或音標進行發音修正。這使其特別適合用於中文及各類方言的精準合成。
支援 600 多種語言:協助少數民族語言與瀕危語言的數位保存
OmniVoice 的關鍵亮點在於其廣泛的語言覆蓋範圍,能高效支援主要語言及眾多資源匱乏的語言。對於少數民族語言及瀕危語言,它僅需極少的數據樣本即可生成高品質語音,為數位語言保存與文化保護提供了巨大潛力。
OmniVoice 的原始碼與預訓練模型現已於 GitHub 和 Hugging Face 開源,開發者可自行部署或整合至應用程式中。AIbase 將持續關注社群回饋與實際應用案例,並鼓勵開發者分享使用經驗。
專案連結:https://github.com/k2-fsa/OmniVoice
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






