腾讯、清华大学联合推出误差率为8.55%的SongGeneration 2,给Suno带来更大压力
2026年初,AI音乐领域再次发生重大变革。3月9日,由腾讯与清华大学人机语音交互实验室 联合研发的音乐基础模型SongGeneration2正式发布。 该模型不仅在技术架构上实现了质的飞跃,还在多个核心维度上超越了当前主流的开源模型,其整体质量甚至可与顶尖商业模型相媲美。

三大突破:告别“塑料感”的人工智能音乐
SongGeneration2 的核心优势源于其底层架构的全面升级,解决了困扰早期AI音乐的三大痛点:
高音乐性:不同于简单的旋律堆叠,该模型能够处理具有惊人空间深度的复杂多轨编曲。
高歌词准确率:发音模糊和音高幻觉问题已成为历史。其音素错误率(PER)低至8.55%,显著优于领先的商用模型Suno v5 (12.4%),仅次于MiniMax2.5 。
强大的可控性:无论是通过文本描述还是音频提示,它都能精准遵循指令,实现风格与情感的深度定制。

“双核”驱动:大语言模型与扩散模型的梦幻组合
在架构上,SongGeneration2 采用了一种创新的混合 LLM-扩散架构:
创作大脑(LeLM):负责整体结构规划和声乐细节处理,解决了“如何演唱”这一难题。
高保真渲染器(Diffusion):在语言模型的引导下,合成极其复杂的声学细节。
分层表示:首创采用混合及多轨表示的并行建模,在旋律稳定性与音质优化之间取得平衡。
真正的开源,门槛极低:普通电脑也能“写歌”
最令开发者兴奋的是腾讯展现出的非凡开放性。拥有40亿参数的SongGeneration-v2-large模型现已完全开源,支持包括中文和英语在内的多语言生成。令人惊叹的是,它仅需22GB显存即可在消费级硬件上流畅运行,支持本地化、私密的音乐创作。
为了让用户能立即体验,团队还在HuggingFace上发布了SongGeneration-v2-Fast版本,该版本以音质微幅下降为代价,换取了超快的生成速度——不到一分钟即可生成一首完整的歌曲。
基于 SongGeneration2 的表现,AI 音乐已正式从“极客玩具”进化为“商用级应用”。随着支持 12GB 显存的 Medium 模型及自动化评估框架即将开源,人人皆可成为“作曲家”的时代或许终于来临。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
2026年初,AI音乐领域再次发生重大变革。3月9日,由

三大突破:告别“塑料感”的人工智能音乐
高音乐性:不同于简单的旋律堆叠,该模型能够处理具有惊人空间深度的复杂多轨编曲。
高歌词准确率:发音模糊和音高幻觉问题已成为历史。其音素错误率(PER)低至8.55%,显著优于领先的商用模型
强大的可控性:无论是通过文本描述还是音频提示,它都能精准遵循指令,实现风格与情感的深度定制。

“双核”驱动:大语言模型与扩散模型的梦幻组合
在架构上,
创作大脑(LeLM):负责整体结构规划和声乐细节处理,解决了“如何演唱”这一难题。
高保真渲染器(Diffusion):在语言模型的引导下,合成极其复杂的声学细节。
分层表示:首创采用混合及多轨表示的并行建模,在旋律稳定性与音质优化之间取得平衡。
真正的开源,门槛极低:普通电脑也能“写歌”
最令开发者兴奋的是腾讯展现出的非凡开放性。拥有40亿参数的SongGeneration-v2-large模型现已完全开源,支持包括中文和英语在内的多语言生成。令人惊叹的是,它仅需22GB显存即可在消费级硬件上流畅运行,支持本地化、私密的音乐创作。
为了让用户能立即体验,团队还在HuggingFace上发布了SongGeneration-v2-Fast版本,该版本以音质微幅下降为代价,换取了超快的生成速度——不到一分钟即可生成一首完整的歌曲。
基于
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






