腾讯混元及其合作伙伴发布了MMAE评估标准,结果显示人工智能音频编辑技术的精确度低于5%。

人工智能在音频生成领域已取得显著进展,但编辑现有音频仍是一项重大挑战。近期,腾讯混元联合上海交通大学、南洋理工大学、天津大学、北京大学及复旦大学等顶尖研究机构,推出了MMAE(大规模多任务音频编辑基准测试)——这是首个专为通用指令驱动型音频编辑设计的大规模多任务基准测试。该基准的推出为人工智能音频编辑领域确立了系统的评估标准,同时也暴露出现有技术在实现精准修改方面的明显不足。
从“生成”到“编辑”:人工智能音频面临的真正挑战
传统的音频人工智能技术主要侧重于根据文本或提示词生成新内容。而MMAE基准测试的核心要求则是让模型理解现有的音频片段,并依据自然语言指令进行精准调整:仅修改需要改动的部分,其余部分保持不变。这种“编辑而非重构”的思路对音频的保真度、指令遵循能力以及上下文理解深度都有更高要求,因此更贴近播客后期制作、音乐混音和语音个性化等实际应用场景。
测试结果显示,当前主流模型的整体精确匹配率低于5%,这凸显出可靠音频编辑技术存在的巨大差距。这意味着在处理实际的编辑任务时,人工智能往往会出现过度修改、遗漏指令或降低原始音频质量等问题。
MMAE基准测试的亮点:针对真实场景的多维度评估
MMAE基准测试在设计上极为严谨周全,具备以下核心特点:
2,000个高保真样本:全部取自现实场景,确保评估具有实用性和多样性。17,741项细粒度评估指标:提供详尽的评分标准,便于进行客观量化。7种模态设置:涵盖声音、音乐、语音及其组合,可支持在复杂的音频环境中进行测试。6个任务复杂度等级:从基础修改到多步推理及多轮编辑不等,能够全面评估模型的能力。8类操作类型:支持不同粒度上的编辑任务,包括局部和全局操作,从而考验模型对细节的掌控能力。
AIbase评论:MMAE不仅仅是一个技术评估工具,更是推动音频人工智能从“生成型”向“可编辑型”转变的重要里程碑。它为研究人员和开发者提供了统一的评估标准,有望加速下一代音频编辑模型的发展。
未来展望:音频编辑或将成为人工智能多模态系统的核心能力
随着多模态大模型快速发展,精准的音频编辑将在内容创作、电影后期制作以及无障碍工具等领域发挥关键作用。腾讯混元与其他机构近期的合作体现了中国在音频人工智能研究领域的领先地位。业内预计未来会有更多开源资源及后续模型出现,共同填补这一技术空白。
相关文章
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
相关专题推荐
评论 (0)
0/500

人工智能在音频生成领域已取得显著进展,但编辑现有音频仍是一项重大挑战。近期,腾讯混元联合上海交通大学、南洋理工大学、天津大学、北京大学及复旦大学等顶尖研究机构,推出了MMAE(大规模多任务音频编辑基准测试)——这是首个专为通用指令驱动型音频编辑设计的大规模多任务基准测试。该基准的推出为人工智能音频编辑领域确立了系统的评估标准,同时也暴露出现有技术在实现精准修改方面的明显不足。
从“生成”到“编辑”:人工智能音频面临的真正挑战
传统的音频人工智能技术主要侧重于根据文本或提示词生成新内容。而MMAE基准测试的核心要求则是让模型理解现有的音频片段,并依据自然语言指令进行精准调整:仅修改需要改动的部分,其余部分保持不变。这种“编辑而非重构”的思路对音频的保真度、指令遵循能力以及上下文理解深度都有更高要求,因此更贴近播客后期制作、音乐混音和语音个性化等实际应用场景。
测试结果显示,当前主流模型的整体精确匹配率低于5%,这凸显出可靠音频编辑技术存在的巨大差距。这意味着在处理实际的编辑任务时,人工智能往往会出现过度修改、遗漏指令或降低原始音频质量等问题。
MMAE基准测试的亮点:针对真实场景的多维度评估
MMAE基准测试在设计上极为严谨周全,具备以下核心特点:
2,000个高保真样本:全部取自现实场景,确保评估具有实用性和多样性。17,741项细粒度评估指标:提供详尽的评分标准,便于进行客观量化。7种模态设置:涵盖声音、音乐、语音及其组合,可支持在复杂的音频环境中进行测试。6个任务复杂度等级:从基础修改到多步推理及多轮编辑不等,能够全面评估模型的能力。8类操作类型:支持不同粒度上的编辑任务,包括局部和全局操作,从而考验模型对细节的掌控能力。
AIbase评论:MMAE不仅仅是一个技术评估工具,更是推动音频人工智能从“生成型”向“可编辑型”转变的重要里程碑。它为研究人员和开发者提供了统一的评估标准,有望加速下一代音频编辑模型的发展。
未来展望:音频编辑或将成为人工智能多模态系统的核心能力
随着多模态大模型快速发展,精准的音频编辑将在内容创作、电影后期制作以及无障碍工具等领域发挥关键作用。腾讯混元与其他机构近期的合作体现了中国在音频人工智能研究领域的领先地位。业内预计未来会有更多开源资源及后续模型出现,共同填补这一技术空白。
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






