小米的OmniVoice开源语音合成模型支持600多种语言的零样本克隆
近日,小米下一代Kaldi团队(k2-fsa)正式开源了OmniVoice——一款支持600多种语言的大型多语言零样本文本转语音模型。该模型在中文、英语及多语言合成等多项关键基准测试中均取得了业界领先的成绩,标志着该领域取得重大突破。
领先性能:中文WER低至0.84%,多语言测试中超越主流模型
在Seed-TTS中文测试集上,OmniVoice实现了仅0.84%的极低词错误率(WER)。在多语言评估中,其相似度(SIM-o)和WER得分均超越了ElevenLabs v2和MiniMax等知名商用模型,展现出卓越的语音自然度和清晰度。

超快推理:RTF低至0.025,速度比实时快40倍
OmniVoice的实时因子(RTF)低至0.025,这意味着其合成速度远超实时要求。这一巨大的效率提升使得在实际应用中能够快速生成长篇语音,极大提升了用户体验。
核心架构创新:受扩散模型启发的离散非自回归设计
OmniVoice 采用受扩散语言模型启发的创新离散非自回归架构。它通过单一步骤将文本转换为语音,省去了传统的中间语义令牌处理环节。这种精简设计在保持高输出质量的同时简化了处理流程。结合预训练大语言模型(LLM)的初始化,全码本随机掩码策略进一步提升了训练效率,并改善了最终语音的清晰度和可懂度。
灵活的语音克隆与定制:仅需 3-10 秒音频即可实现
该模型仅需3-10秒的参考音频,即可实现高质量的零样本语音克隆。用户还可通过自然语言提示自定义语音属性,指定性别、年龄、音高、口音、方言,甚至包括耳语等特殊效果。
支持非语言符号与精细发音控制
OmniVoice 能处理 [笑声] 等非语言符号,并支持通过拼音或音标进行发音校正。这使其特别适合中文及各类方言的精准合成。
支持 600 多种语言:助力少数民族语言和濒危语言的数字保存
OmniVoice 的核心亮点在于其广泛的语言覆盖范围,既能高效支持主流语言,也能支持大量资源匮乏的语言。对于少数民族语言和濒危语言,它仅需极少的样本数据即可生成高质量语音,为数字语言保存和文化保护提供了巨大潜力。
OmniVoice的源代码和预训练模型现已开源至GitHub和Hugging Face,开发者可将其部署在本地或集成到应用程序中。AIbase将持续关注社区反馈和实际应用案例,并鼓励开发者分享使用体验。
项目链接:https://github.com/k2-fsa/OmniVoice
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500
近日,小米下一代Kaldi团队(k2-fsa)正式开源了OmniVoice——一款支持600多种语言的大型多语言零样本文本转语音模型。该模型在中文、英语及多语言合成等多项关键基准测试中均取得了业界领先的成绩,标志着该领域取得重大突破。
领先性能:中文WER低至0.84%,多语言测试中超越主流模型
在Seed-TTS中文测试集上,OmniVoice实现了仅0.84%的极低词错误率(WER)。在多语言评估中,其相似度(SIM-o)和WER得分均超越了ElevenLabs v2和MiniMax等知名商用模型,展现出卓越的语音自然度和清晰度。

超快推理:RTF低至0.025,速度比实时快40倍
OmniVoice的实时因子(RTF)低至0.025,这意味着其合成速度远超实时要求。这一巨大的效率提升使得在实际应用中能够快速生成长篇语音,极大提升了用户体验。
核心架构创新:受扩散模型启发的离散非自回归设计
OmniVoice 采用受扩散语言模型启发的创新离散非自回归架构。它通过单一步骤将文本转换为语音,省去了传统的中间语义令牌处理环节。这种精简设计在保持高输出质量的同时简化了处理流程。结合预训练大语言模型(LLM)的初始化,全码本随机掩码策略进一步提升了训练效率,并改善了最终语音的清晰度和可懂度。
灵活的语音克隆与定制:仅需 3-10 秒音频即可实现
该模型仅需3-10秒的参考音频,即可实现高质量的零样本语音克隆。用户还可通过自然语言提示自定义语音属性,指定性别、年龄、音高、口音、方言,甚至包括耳语等特殊效果。
支持非语言符号与精细发音控制
OmniVoice 能处理 [笑声] 等非语言符号,并支持通过拼音或音标进行发音校正。这使其特别适合中文及各类方言的精准合成。
支持 600 多种语言:助力少数民族语言和濒危语言的数字保存
OmniVoice 的核心亮点在于其广泛的语言覆盖范围,既能高效支持主流语言,也能支持大量资源匮乏的语言。对于少数民族语言和濒危语言,它仅需极少的样本数据即可生成高质量语音,为数字语言保存和文化保护提供了巨大潜力。
OmniVoice的源代码和预训练模型现已开源至GitHub和Hugging Face,开发者可将其部署在本地或集成到应用程序中。AIbase将持续关注社区反馈和实际应用案例,并鼓励开发者分享使用体验。
项目链接:https://github.com/k2-fsa/OmniVoice
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






