Hume AI 推出 TADA:開源行動語音合成系統,速度提升 5 倍且無幻聽現象

Hume AI 已將其最新的語音生成模型 TADA(Text-Acoustic Dual Alignment)開源。這個基於大型語言模型(LLM)的文字轉語音(TTS)系統,採用了針對文字與聲學特徵的創新雙重對齊架構。此方法顯著提升了生成效率與可靠性,並擴大了其實際應用的範圍。
根據官方詳述,TADA 在文字標記與聲學表徵之間建立了嚴格的 1:1 同步關係。此架構徹底解決了傳統基於大型語言模型(LLM)的 TTS 系統中常見的標記層級內容幻覺問題。在涵蓋超過 1,000 個測試樣本的評估中,該模型未出現任何內容幻覺案例。
在效能方面,TADA 的音訊生成速度比同級 LLM 語音合成系統快五倍以上。其資源利用效率亦極為出色,每秒音訊僅需 2 至 3 幀的運算資源。相較之下,傳統解決方案通常需要 12.5 至 75 幀。此高效能使模型能在智慧型手機和邊緣裝置等低功耗硬體上執行本地推論,無需仰賴雲端伺服器。
TADA 提供多語言支援,包含中文在內,其多語言版本基於 Llama3.23B 參數規模。 本次發布包含 1B(主要針對英語)及 3B 多語言預訓練模型。在 2048 個標記的上下文視窗下,該模型可於單次處理中生成約 700 秒的連續音訊。此能力遠超傳統解決方案,後者在相同標記限制下通常僅能處理約 70 秒。
其關鍵創新在於同步轉錄功能。在生成語音的同時,模型會同步輸出對應的文字轉錄。此流程省去了額外的自動語音辨識(ASR)步驟,使文字輸出零延遲。此功能對於即時字幕、語音互動系統及內容創作工具尤具價值。
在人類主觀評測中,TADA 在自然度與聲音相似度兩項指標上均名列第二。其表現超越了多個參數規模更大、訓練資料更龐大的系統,展現出極具競爭力的音質。
連結:https://huggingface.co/collections/HumeAI/tada
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (1)
0/500

Hume AI 已將其最新的語音生成模型 TADA(Text-Acoustic Dual Alignment)開源。這個基於大型語言模型(LLM)的文字轉語音(TTS)系統,採用了針對文字與聲學特徵的創新雙重對齊架構。此方法顯著提升了生成效率與可靠性,並擴大了其實際應用的範圍。
根據官方詳述,TADA 在文字標記與聲學表徵之間建立了嚴格的 1:1 同步關係。此架構徹底解決了傳統基於大型語言模型(LLM)的 TTS 系統中常見的標記層級內容幻覺問題。在涵蓋超過 1,000 個測試樣本的評估中,該模型未出現任何內容幻覺案例。
在效能方面,TADA 的音訊生成速度比同級 LLM 語音合成系統快五倍以上。其資源利用效率亦極為出色,每秒音訊僅需 2 至 3 幀的運算資源。相較之下,傳統解決方案通常需要 12.5 至 75 幀。此高效能使模型能在智慧型手機和邊緣裝置等低功耗硬體上執行本地推論,無需仰賴雲端伺服器。
TADA 提供多語言支援,包含中文在內,其多語言版本基於 Llama3.23B 參數規模。 本次發布包含 1B(主要針對英語)及 3B 多語言預訓練模型。在 2048 個標記的上下文視窗下,該模型可於單次處理中生成約 700 秒的連續音訊。此能力遠超傳統解決方案,後者在相同標記限制下通常僅能處理約 70 秒。
其關鍵創新在於同步轉錄功能。在生成語音的同時,模型會同步輸出對應的文字轉錄。此流程省去了額外的自動語音辨識(ASR)步驟,使文字輸出零延遲。此功能對於即時字幕、語音互動系統及內容創作工具尤具價值。
在人類主觀評測中,TADA 在自然度與聲音相似度兩項指標上均名列第二。其表現超越了多個參數規模更大、訓練資料更龐大的系統,展現出極具競爭力的音質。
連結:https://huggingface.co/collections/HumeAI/tada
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






