阿里巴巴 Tongyi 推出支持自由风格自然语言控制的语音模型
今日,阿里巴巴同译实验室语音团队发布了两款突破性语音生成模型:Fun-CosyVoice3.5与Fun-AudioGen-VD。其核心亮点在于支持"自由风格"指令——用户无需复杂参数调整,仅通过自然语言描述即可精准操控声线表现风格,或从零构建复杂音频场景。

两款模型各具专长:
Fun-CosyVoice3.5:多语言复现与精细化控制
作为CosyVoice的增强版,该模型在理解语音表达细微差异方面实现核心突破。
指令驱动生成:用户可输入"说话更自信"或"放慢语速并加入情感变化"等指令实现实时语音调整。
语言扩展:新增泰语、印尼语、葡萄牙语及越南语支持,在13种语言中保持行业领先的转写准确率(WER)与语音相似度。
罕见字符优化:专项训练将非常用字符错误率从15.2%降至5.3%。
性能提升:首包延迟降低35%,显著增强实时交互流畅度。
Fun-AudioGen-VD:全面声音设计
该模型作为"音频导演",生成融合"角色+环境"的整合音频。
声音定制:可指定性别、年龄、口音及"沙哑/低沉/低音调"等精细特征。
情感与角色扮演:模拟客服专员、播音员、儿童等角色,甚至能传达"表面平静内心紧张"等复杂状态。
沉浸式环境:添加背景音效(战场喧嚣、咖啡馆低语)与空间特效(教堂混响、水下声学),实现全空间模拟。
同益实验室指出,这些模型将推动高质量语音创作的普及化,为播客制作、游戏开发及影视后期提供强大的AI支持。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500
今日,阿里巴巴同译实验室语音团队发布了两款突破性语音生成模型:Fun-CosyVoice3.5与Fun-AudioGen-VD。其核心亮点在于支持"自由风格"指令——用户无需复杂参数调整,仅通过自然语言描述即可精准操控声线表现风格,或从零构建复杂音频场景。

两款模型各具专长:
Fun-CosyVoice3.5:多语言复现与精细化控制
作为CosyVoice的增强版,该模型在理解语音表达细微差异方面实现核心突破。
指令驱动生成:用户可输入"说话更自信"或"放慢语速并加入情感变化"等指令实现实时语音调整。
语言扩展:新增泰语、印尼语、葡萄牙语及越南语支持,在13种语言中保持行业领先的转写准确率(WER)与语音相似度。
罕见字符优化:专项训练将非常用字符错误率从15.2%降至5.3%。
性能提升:首包延迟降低35%,显著增强实时交互流畅度。
Fun-AudioGen-VD:全面声音设计
该模型作为"音频导演",生成融合"角色+环境"的整合音频。
声音定制:可指定性别、年龄、口音及"沙哑/低沉/低音调"等精细特征。
情感与角色扮演:模拟客服专员、播音员、儿童等角色,甚至能传达"表面平静内心紧张"等复杂状态。
沉浸式环境:添加背景音效(战场喧嚣、咖啡馆低语)与空间特效(教堂混响、水下声学),实现全空间模拟。
同益实验室指出,这些模型将推动高质量语音创作的普及化,为播客制作、游戏开发及影视后期提供强大的AI支持。
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






