騰訊與清華大學推出第二代「SongGeneration」,錯誤率為 8.55%,對 Suno 的壓力進一步加劇
2026年初,AI音樂領域再次經歷了重大變革。3月9日,由騰訊與清華大學人機語音互動實驗室 共同研發的音樂基礎模型「SongGeneration2」正式發布。 該模型不僅在技術架構上實現了質的飛躍,更在多個核心維度上超越了當前主流的開源模型,其整體品質甚至可與頂尖的商用模型相媲美。

三大突破:告別「塑膠感」的人工智慧音樂
SongGeneration2 的核心優勢源自其底層架構的全面升級,解決了困擾早期 AI 音樂的三大痛點:
高音樂性:有別於基礎的旋律堆疊,該模型能處理複雜的多聲部編曲,並展現出令人驚豔的空間深度。
高歌詞準確度:發音模糊與音高錯亂的現象已成過去。其音素錯誤率(PER)低至 8.55%,顯著優於領先的商用模型 Suno v5 (12.4%),僅次於 MiniMax2.5 。
強大的可控性:無論透過文字描述或音訊提示,它都能精準遵循指示,實現風格與情感的深度客製化。

「雙核心」驅動:大型語言模型(LLM)與擴散模型的夢幻合作
在架構上,SongGeneration2 採用了創新的混合式 LLM-擴散模型架構:
創作大腦(LeLM):負責整體結構規劃與聲樂細節,解決「如何演唱」的難題。
高保真渲染器(Diffusion):在語言模型的引導下,合成極其複雜的聲學細節。
分層表示:首創採用混合與多軌表示的並行建模,在旋律穩定性與音質精細化之間取得平衡。
真正的開源、低門檻:普通電腦也能「寫歌」
最令開發者興奮的是騰訊展現的非凡開放性。擁有 40 億參數的 SongGeneration-v2-large 模型現已完全開源,支援包括中文和英文在內的多語言生成。令人驚嘆的是,它僅需 22GB VRAM 即可在消費級硬體上流暢運行,實現本地化且私密的音樂創作。
為了讓使用者能立即體驗,團隊還於 HuggingFace 上發布了 SongGeneration-v2-Fast 版本,以極微小的音質損失換取超高速生成能力——不到一分鐘即可產出一首完整的歌曲。
根據 SongGeneration2 的表現,AI 音樂已正式從「極客玩具」進化至「商用級應用」的領域。隨著支援 12GB VRAM 的 Medium 模型及自動化評估框架即將開源,人人皆可成為「作曲家」的時代或許終於來臨。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500
2026年初,AI音樂領域再次經歷了重大變革。3月9日,由

三大突破:告別「塑膠感」的人工智慧音樂
高音樂性:有別於基礎的旋律堆疊,該模型能處理複雜的多聲部編曲,並展現出令人驚豔的空間深度。
高歌詞準確度:發音模糊與音高錯亂的現象已成過去。其音素錯誤率(PER)低至 8.55%,顯著優於領先的商用模型
強大的可控性:無論透過文字描述或音訊提示,它都能精準遵循指示,實現風格與情感的深度客製化。

「雙核心」驅動:大型語言模型(LLM)與擴散模型的夢幻合作
在架構上,
創作大腦(LeLM):負責整體結構規劃與聲樂細節,解決「如何演唱」的難題。
高保真渲染器(Diffusion):在語言模型的引導下,合成極其複雜的聲學細節。
分層表示:首創採用混合與多軌表示的並行建模,在旋律穩定性與音質精細化之間取得平衡。
真正的開源、低門檻:普通電腦也能「寫歌」
最令開發者興奮的是騰訊展現的非凡開放性。擁有 40 億參數的 SongGeneration-v2-large 模型現已完全開源,支援包括中文和英文在內的多語言生成。令人驚嘆的是,它僅需 22GB VRAM 即可在消費級硬體上流暢運行,實現本地化且私密的音樂創作。
為了讓使用者能立即體驗,團隊還於 HuggingFace 上發布了 SongGeneration-v2-Fast 版本,以極微小的音質損失換取超高速生成能力——不到一分鐘即可產出一首完整的歌曲。
根據
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






