Volcano Engine 推出「Doubao Audio Model 1.0」:一句話即可生成電影級音效,10 分鐘內角色聲音始終如一
昨日,Volc Engine 正式推出「Doubao 音訊生成模型 1.0」(Doubao-Seed-Audio 1.0),該模型可接受文字或音訊輸入,並能端到端地生成完整的音訊作品。 其關鍵突破在於,單一提示詞即可同時處理對話、音效與背景音樂,省去了手動進行多軌編輯的步驟。

將一句話化為音訊導演——無需後期製作。
以往,要製作高品質的音訊,必須分別生成對白、音效和音樂,然後手動對齊並混音——這是一個複雜的過程,需要倚賴後期製作的專業知識。 「Doubao 音訊生成模型 1.0」將所有這些步驟整合到單一提示中:使用者只需透過一則指令,即可定義多位角色的台詞、語調和情感節奏,嵌入笑聲、嘆息、停頓和方言口音等細節,並同時生成背景音樂和環境音效,直接輸出成品。 創作者只需輸入描述文字,即可立即獲得可直接發布的播客、有聲書或品牌音頻。
在長篇音頻中保持角色聲音的一致性,且不失真。
長篇音訊創作的最大挑戰在於一致性——確保角色在第一分鐘和第十分鐘聽起來都一樣。Doubao 音訊生成模型 1.0 將文字轉音訊技術與參考音訊深度整合,在長篇段落中維持一致的音質,讓創作者無需逐段比較與修改。 當前模型每次生成最多支援 2 分鐘的音訊,並透過延伸功能,在更長的輸出內容中維持聲音的一致性,適用於有聲書、播客及長篇系列作品。
此外,該模型提供語音與風格的分離控制,讓同一聲音能適應各種情緒與情境——甚至能讓單一聲音以不同表情詮釋多個角色。這大大提升了角色配音與創意音頻製作的靈活性。 目前,Volc Ark 已開放 API 測試,個人用戶可在「體驗中心」獲得 30 分鐘的生成配額。「豆寶」語音生成模型 1.0 也將陸續在 CapCut、Jiemod 和 Tomato 等產品上推出。
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (1)
0/500
昨日,Volc Engine 正式推出「Doubao 音訊生成模型 1.0」(Doubao-Seed-Audio 1.0),該模型可接受文字或音訊輸入,並能端到端地生成完整的音訊作品。 其關鍵突破在於,單一提示詞即可同時處理對話、音效與背景音樂,省去了手動進行多軌編輯的步驟。

將一句話化為音訊導演——無需後期製作。
以往,要製作高品質的音訊,必須分別生成對白、音效和音樂,然後手動對齊並混音——這是一個複雜的過程,需要倚賴後期製作的專業知識。 「Doubao 音訊生成模型 1.0」將所有這些步驟整合到單一提示中:使用者只需透過一則指令,即可定義多位角色的台詞、語調和情感節奏,嵌入笑聲、嘆息、停頓和方言口音等細節,並同時生成背景音樂和環境音效,直接輸出成品。 創作者只需輸入描述文字,即可立即獲得可直接發布的播客、有聲書或品牌音頻。
在長篇音頻中保持角色聲音的一致性,且不失真。
長篇音訊創作的最大挑戰在於一致性——確保角色在第一分鐘和第十分鐘聽起來都一樣。Doubao 音訊生成模型 1.0 將文字轉音訊技術與參考音訊深度整合,在長篇段落中維持一致的音質,讓創作者無需逐段比較與修改。 當前模型每次生成最多支援 2 分鐘的音訊,並透過延伸功能,在更長的輸出內容中維持聲音的一致性,適用於有聲書、播客及長篇系列作品。
此外,該模型提供語音與風格的分離控制,讓同一聲音能適應各種情緒與情境——甚至能讓單一聲音以不同表情詮釋多個角色。這大大提升了角色配音與創意音頻製作的靈活性。 目前,Volc Ark 已開放 API 測試,個人用戶可在「體驗中心」獲得 30 分鐘的生成配額。「豆寶」語音生成模型 1.0 也將陸續在 CapCut、Jiemod 和 Tomato 等產品上推出。
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






