美团开源语音模型创下语音克隆新标杆
语音生成领域正经历着从多级级联架构向端到端模型的根本性转变。 为克服传统TTS系统中“梅尔频谱图”中间表示形式固有的信息丢失和误差累积问题,美团LongCat团队正式发布了开源模型LongCat-AudioDiT(提供10亿和35亿参数版本)。该模型通过直接波形潜空间建模,成功突破了零样本语音克隆的既有性能瓶颈。

核心架构:突破梅尔频谱图的局限
LongCat-AudioDiT摒弃了“声学特征预测+神经声码器”的传统多阶段管道,转而构建基于Wav-VAE(波形变分自编码器)和DiT(扩散变换器)的精简最小架构。
高效 Wav-VAE:采用全卷积设计,将 24kHz 波形压缩 2000 倍至 11.7Hz 帧率。通过非参数捷径分支和多目标对抗训练,确保重建的波形在保持精确时频结构的同时,呈现出极佳的自然听感。
语义增强型 DiT:该模型创新性地将 UMT5 文本编码器的原始词嵌入与顶层隐藏状态进行融合。这弥补了高层次语义表示中丢失的语音细节,显著提升了生成的语音可懂度。
推理优化:精准校正语音漂移
为进一步提升生成质量,研究团队实现了两项关键的技术改进:
双约束机制:该技术识别并纠正了流匹配TTS中长期存在的“训练-推理不匹配”问题。通过在推理阶段强制重置提示区域的潜在变量,彻底解决了说话人声音漂移和不稳定的问题。
自适应投影引导(APG):APG取代了传统的无分类器引导(CFG)。它能够精确过滤引导信号中的有益成分,同时抑制导致音质退化的成分,从而显著提升语音自然度,且不会引发频谱“过度饱和”。
性能:SOTA级克隆准确率
在Seed数据集的基准测试中,LongCat-AudioDiT展现出领先的性能:
相似度(SIM):该35亿参数模型在Seed-ZH测试集上获得0.818的得分,在难度较高的Seed-Hard句子集上获得0.797的得分,表现优于Seed-TTS、CosyVoice3.5和MiniMax-Speech等知名模型。
准确率:在关键指标上均跻身业界顶尖水平,包括英语词错误率(WER)为1.50%,中文难句错误率(CER)为6.04%。
值得注意的是,LongCat-AudioDiT仅通过单阶段训练预处理后的ASR转录数据,便实现了优于多阶段训练模型的卓越效果。相关研究论文、源代码及模型权重现已完全开源,可在GitHub和HuggingFace上获取。
项目链接:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
相关文章
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
相关专题推荐
评论 (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
语音生成领域正经历着从多级级联架构向端到端模型的根本性转变。 为克服传统TTS系统中“梅尔频谱图”中间表示形式固有的信息丢失和误差累积问题,美团LongCat团队正式发布了开源模型LongCat-AudioDiT(提供10亿和35亿参数版本)。该模型通过直接波形潜空间建模,成功突破了零样本语音克隆的既有性能瓶颈。

核心架构:突破梅尔频谱图的局限
LongCat-AudioDiT摒弃了“声学特征预测+神经声码器”的传统多阶段管道,转而构建基于Wav-VAE(波形变分自编码器)和DiT(扩散变换器)的精简最小架构。
高效 Wav-VAE:采用全卷积设计,将 24kHz 波形压缩 2000 倍至 11.7Hz 帧率。通过非参数捷径分支和多目标对抗训练,确保重建的波形在保持精确时频结构的同时,呈现出极佳的自然听感。
语义增强型 DiT:该模型创新性地将 UMT5 文本编码器的原始词嵌入与顶层隐藏状态进行融合。这弥补了高层次语义表示中丢失的语音细节,显著提升了生成的语音可懂度。
推理优化:精准校正语音漂移
为进一步提升生成质量,研究团队实现了两项关键的技术改进:
双约束机制:该技术识别并纠正了流匹配TTS中长期存在的“训练-推理不匹配”问题。通过在推理阶段强制重置提示区域的潜在变量,彻底解决了说话人声音漂移和不稳定的问题。
自适应投影引导(APG):APG取代了传统的无分类器引导(CFG)。它能够精确过滤引导信号中的有益成分,同时抑制导致音质退化的成分,从而显著提升语音自然度,且不会引发频谱“过度饱和”。
性能:SOTA级克隆准确率
在Seed数据集的基准测试中,LongCat-AudioDiT展现出领先的性能:
相似度(SIM):该35亿参数模型在Seed-ZH测试集上获得0.818的得分,在难度较高的Seed-Hard句子集上获得0.797的得分,表现优于Seed-TTS、CosyVoice3.5和MiniMax-Speech等知名模型。
准确率:在关键指标上均跻身业界顶尖水平,包括英语词错误率(WER)为1.50%,中文难句错误率(CER)为6.04%。
值得注意的是,LongCat-AudioDiT仅通过单阶段训练预处理后的ASR转录数据,便实现了优于多阶段训练模型的卓越效果。相关研究论文、源代码及模型权重现已完全开源,可在GitHub和HuggingFace上获取。
项目链接:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





首页






