Volcano Engine 推出 Doubao Audio 1.0 版本:一句台词即可生成电影级音频,10 分钟内容角色声音保持一致
昨日,Volc Engine 正式发布了“Doubao 音频生成模型 1.0”(Doubao-Seed-Audio 1.0),该模型支持文本或音频输入,能够端到端生成完整的音频作品。 其关键突破在于,单条提示词即可同时处理对话、音效和背景音乐,省去了手动多轨编辑的步骤。

将一句话变成音频导演——无需后期制作。
此前,制作高质量音频需要分别生成对话、音效和音乐,然后手动对齐和混音——这是一个依赖后期制作专业知识的复杂过程。 “Doubao 音频生成模型 1.0”将所有这些步骤整合到一个提示词中:用户可以在一条指令中定义多个角色的台词、语调和情感节奏,嵌入笑声、叹息、停顿和方言口音等细节,并同时生成背景音乐和环境音效,直接输出成品。 创作者只需输入描述,即可立即获得可直接发布的播客、有声书或品牌音频。
在长篇音频中保持角色声音的一致性,且不失真。
长音频创作的最大挑战在于一致性——确保角色在第 1 分钟和第 10 分钟听起来都一样。Doubao 音频生成模型 1.0 将文本转语音与参考音频深度整合,在长段落中保持一致的音质,因此创作者无需逐段对比和修改。 当前模型每次生成最多支持2分钟的音频,借助扩展功能,它还能在更长的输出内容中保持声音的一致性,适用于有声书、播客和长篇系列作品。
此外,该模型支持对声音和风格进行解耦控制,使同一声音能够适应各种情绪和语境——甚至能让单一声音以不同表现形式诠释多个角色。这极大地提升了角色配音和创意音频制作的灵活性。 目前,Volc Ark 已开放 API 测试,个人用户可在体验中心获得 30 分钟的生成配额。Doubao 语音生成模型 1.0 还将登陆 CapCut、Jiemod 和 Tomato 等产品。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (1)
0/500
昨日,Volc Engine 正式发布了“Doubao 音频生成模型 1.0”(Doubao-Seed-Audio 1.0),该模型支持文本或音频输入,能够端到端生成完整的音频作品。 其关键突破在于,单条提示词即可同时处理对话、音效和背景音乐,省去了手动多轨编辑的步骤。

将一句话变成音频导演——无需后期制作。
此前,制作高质量音频需要分别生成对话、音效和音乐,然后手动对齐和混音——这是一个依赖后期制作专业知识的复杂过程。 “Doubao 音频生成模型 1.0”将所有这些步骤整合到一个提示词中:用户可以在一条指令中定义多个角色的台词、语调和情感节奏,嵌入笑声、叹息、停顿和方言口音等细节,并同时生成背景音乐和环境音效,直接输出成品。 创作者只需输入描述,即可立即获得可直接发布的播客、有声书或品牌音频。
在长篇音频中保持角色声音的一致性,且不失真。
长音频创作的最大挑战在于一致性——确保角色在第 1 分钟和第 10 分钟听起来都一样。Doubao 音频生成模型 1.0 将文本转语音与参考音频深度整合,在长段落中保持一致的音质,因此创作者无需逐段对比和修改。 当前模型每次生成最多支持2分钟的音频,借助扩展功能,它还能在更长的输出内容中保持声音的一致性,适用于有声书、播客和长篇系列作品。
此外,该模型支持对声音和风格进行解耦控制,使同一声音能够适应各种情绪和语境——甚至能让单一声音以不同表现形式诠释多个角色。这极大地提升了角色配音和创意音频制作的灵活性。 目前,Volc Ark 已开放 API 测试,个人用户可在体验中心获得 30 分钟的生成配额。Doubao 语音生成模型 1.0 还将登陆 CapCut、Jiemod 和 Tomato 等产品。
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






