美團開源語音模型樹立了語音克隆的新標竿
音訊生成領域正經歷一場根本性的轉變,從多階段級聯架構轉向端到端模型。 為克服傳統 TTS 系統所採用的「梅爾頻譜圖」中間表示形式所固有的資訊損失與誤差累積問題,美團 LongCat 團隊已正式發布並開源 LongCat-AudioDiT(提供 10 億與 35 億參數版本)。該模型透過直接波形潛空間建模,成功突破了零樣本語音克隆的既有性能極限。

核心架構:突破梅爾頻譜圖的局限
LongCat-AudioDiT 摒棄了傳統的「聲學特徵預測 + 神經語音編碼器」多階段流程,轉而建立一套基於 Wav-VAE(波形變分自編碼器)與 DiT(擴散變換器)的簡化極簡架構。
高效 Wav-VAE:採用全卷積設計,將 24kHz 波形壓縮 2000 倍至 11.7Hz 幀率。透過非參數捷徑分支與多目標對抗式訓練,確保重建波形在維持精確時頻結構的同時,呈現極佳的自然聆聽品質。
語義增強型 DiT:該模型創新性地將 UMT5 文字編碼器的原始詞嵌入向量與其頂層隱藏狀態進行融合。此舉彌補了高階語義表示中遺失的語音細節,顯著提升了生成的語音可懂度。
推論優化:精準修正語音漂移
為進一步提升生成品質,研究團隊實施了兩項關鍵技術改進:
雙重約束機制:此技術能識別並修正流匹配 TTS 中長期存在的「訓練與推論不匹配」問題。透過在推論階段強制重置提示區的潛在變量,徹底解決了發音者聲音漂移與不穩定的問題。
自適應投影引導(APG):APG 取代了傳統的無分類器引導(CFG)。它能精準篩選引導訊號中的有益成分,同時抑制導致音質退化的成分,在避免引發頻譜「過飽和」的情況下,顯著提升語音自然度。
性能:SOTA 級別的克隆準確度
在 Seed 資料集的基準測試中,LongCat-AudioDiT 展現出領先的表現:
相似度 (SIM):該 35 億參數模型在 Seed-ZH 測試集上獲得 0.818 的分數,並在具挑戰性的 Seed-Hard 句子集上取得 0.797,表現優於 Seed-TTS、CosyVoice3.5 及 MiniMax-Speech 等知名模型。
準確度:在關鍵指標上名列業界頂尖,包括英語 WER 為 1.50%,以及中文難句 CER 為 6.04%。
值得注意的是,LongCat-AudioDiT 僅透過對預處理後的 ASR 轉錄資料進行單階段訓練,便能取得優於多階段訓練模型的卓越成果。相關研究論文、原始碼及模型權重現已全面開源,並可於 GitHub 和 HuggingFace 取得。
專案連結:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
相關專題推薦
評論 (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
音訊生成領域正經歷一場根本性的轉變,從多階段級聯架構轉向端到端模型。 為克服傳統 TTS 系統所採用的「梅爾頻譜圖」中間表示形式所固有的資訊損失與誤差累積問題,美團 LongCat 團隊已正式發布並開源 LongCat-AudioDiT(提供 10 億與 35 億參數版本)。該模型透過直接波形潛空間建模,成功突破了零樣本語音克隆的既有性能極限。

核心架構:突破梅爾頻譜圖的局限
LongCat-AudioDiT 摒棄了傳統的「聲學特徵預測 + 神經語音編碼器」多階段流程,轉而建立一套基於 Wav-VAE(波形變分自編碼器)與 DiT(擴散變換器)的簡化極簡架構。
高效 Wav-VAE:採用全卷積設計,將 24kHz 波形壓縮 2000 倍至 11.7Hz 幀率。透過非參數捷徑分支與多目標對抗式訓練,確保重建波形在維持精確時頻結構的同時,呈現極佳的自然聆聽品質。
語義增強型 DiT:該模型創新性地將 UMT5 文字編碼器的原始詞嵌入向量與其頂層隱藏狀態進行融合。此舉彌補了高階語義表示中遺失的語音細節,顯著提升了生成的語音可懂度。
推論優化:精準修正語音漂移
為進一步提升生成品質,研究團隊實施了兩項關鍵技術改進:
雙重約束機制:此技術能識別並修正流匹配 TTS 中長期存在的「訓練與推論不匹配」問題。透過在推論階段強制重置提示區的潛在變量,徹底解決了發音者聲音漂移與不穩定的問題。
自適應投影引導(APG):APG 取代了傳統的無分類器引導(CFG)。它能精準篩選引導訊號中的有益成分,同時抑制導致音質退化的成分,在避免引發頻譜「過飽和」的情況下,顯著提升語音自然度。
性能:SOTA 級別的克隆準確度
在 Seed 資料集的基準測試中,LongCat-AudioDiT 展現出領先的表現:
相似度 (SIM):該 35 億參數模型在 Seed-ZH 測試集上獲得 0.818 的分數,並在具挑戰性的 Seed-Hard 句子集上取得 0.797,表現優於 Seed-TTS、CosyVoice3.5 及 MiniMax-Speech 等知名模型。
準確度:在關鍵指標上名列業界頂尖,包括英語 WER 為 1.50%,以及中文難句 CER 為 6.04%。
值得注意的是,LongCat-AudioDiT 僅透過對預處理後的 ASR 轉錄資料進行單階段訓練,便能取得優於多階段訓練模型的卓越成果。相關研究論文、原始碼及模型權重現已全面開源,並可於 GitHub 和 HuggingFace 取得。
專案連結:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





首頁






