“同易前文 Qwen-Audio-3.0-TTS”正式上线,首包延迟300毫秒,支持20种方言
阿里巴巴Qwen团队推出了全新的实时语音合成模型Qwen-Audio-3.0-TTS,将语音合成从基础生成提升至真正的情感表达。 其Plus版本目前在Artificial Analysis权威基准测试平台Speech Arena中位居全球榜首,表现优于Gemini 3.1 TTS、ElevenLabs v3及其他主流模型。

该模型提供两个版本:Flash版专注于实时交互,初始延迟约为300毫秒,非常适合智能助手及其他低延迟应用场景;Plus版则侧重高质量生成,在自然度和声音相似度方面均有显著提升。
核心能力方面实现了四大突破:
首先,多语言和方言支持已扩展至 16 种语言,其中 Plus 版本在全部 16 种语言中实现了 82.75% 的平均说话人相似度——这是业界最高水平。它还覆盖了 20 种中国方言,在生成过程中既能保持方言的真实特征,而非弱化其特色,从而实现更接近母语者的表达。
其次,灵活的自然语言指令支持用户通过“温和的客服语气”或“直播主持人风格”等提示生成精准语音,无需专业标注。
第三,精细的标签控制支持 [gasp] 和 [angry] 等结构化标签,可精准管理呼吸、笑声等非语言细节——适用于游戏、有声书及类似场景。
第四,强大的声学鲁棒性:即使参考音频中存在高噪音或混响,模型也能在保持语音质量的同时自动过滤背景噪音,确保合成输出稳定。
配套的高端语音库包含多种语音类型——包括指令语、方言及小语种——支持 48K 高清音频输出(预计于 7 月 24 日开放),每次合成会话最长可处理 3 分钟的长文本。 该模型现已在阿里云百联平台全面上线,开发者可访问并试用,为语音交互开辟新的可能性。

相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500
阿里巴巴Qwen团队推出了全新的实时语音合成模型Qwen-Audio-3.0-TTS,将语音合成从基础生成提升至真正的情感表达。 其Plus版本目前在Artificial Analysis权威基准测试平台Speech Arena中位居全球榜首,表现优于Gemini 3.1 TTS、ElevenLabs v3及其他主流模型。

该模型提供两个版本:Flash版专注于实时交互,初始延迟约为300毫秒,非常适合智能助手及其他低延迟应用场景;Plus版则侧重高质量生成,在自然度和声音相似度方面均有显著提升。
核心能力方面实现了四大突破:
首先,多语言和方言支持已扩展至 16 种语言,其中 Plus 版本在全部 16 种语言中实现了 82.75% 的平均说话人相似度——这是业界最高水平。它还覆盖了 20 种中国方言,在生成过程中既能保持方言的真实特征,而非弱化其特色,从而实现更接近母语者的表达。
其次,灵活的自然语言指令支持用户通过“温和的客服语气”或“直播主持人风格”等提示生成精准语音,无需专业标注。
第三,精细的标签控制支持 [gasp] 和 [angry] 等结构化标签,可精准管理呼吸、笑声等非语言细节——适用于游戏、有声书及类似场景。
第四,强大的声学鲁棒性:即使参考音频中存在高噪音或混响,模型也能在保持语音质量的同时自动过滤背景噪音,确保合成输出稳定。
配套的高端语音库包含多种语音类型——包括指令语、方言及小语种——支持 48K 高清音频输出(预计于 7 月 24 日开放),每次合成会话最长可处理 3 分钟的长文本。 该模型现已在阿里云百联平台全面上线,开发者可访问并试用,为语音交互开辟新的可能性。

Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






