美团开源 LongCat-Video-Avatar 1.5,性能优于主流闭源模型
美团LongCat大模型团队正式开源了商业级数字人视频生成模型LongCat-Video-Avatar 1.5。该版本标志着模型已从开源最先进技术全面转向实际商业部署,在口型同步、物理真实感、长视频稳定性、多人互动以及高效推理等方面均有重大提升。
三大关键升级,攻克商业化难关
为了使数字人能够在各种实际应用场景中稳定运行,LongCat-Video-Avatar 1.5 通过三项全面改进,解决了传统数字人视频中存在的抖动、失真和高延迟等顽固问题:
商用级音频编码升级
该模型的音频特征提取编码器已从 Wav2Vec2 升级至Whisper-large。 凭借更多的参数和更丰富的多语言先验知识,它现在能够捕捉细微的音素变化和语调节奏。这不仅提升了长句、快速语速和演唱等复杂音频的唇形同步效果,还实现了面部表情、头部动作与语音之间的自然协调——从而显著减少了长视频中的帧跳过和身份漂移现象。
通过多阶段数据增强实现强大的开放域泛化能力
为确保在真实人物、虚拟偶像、动漫角色和动物等不同主体上都能保持稳定的性能,研究团队开发了一条集离线标注和在线验证于一体的多阶段数据处理管道,并引入了三种针对性的增强数据类型:
多人物数据:利用主动说话人检测技术,消除多人物场景中的视听歧义,准确区分说话人与听众。
静默数据:通过筛选无语音的视频,模型可学习静默状态下的自然微表情,从而避免非说话角色出现不必要的嘴部动作。
情绪数据:结合帧级情绪识别过滤,该数据整合了情绪变化,帮助模型把握言语与面部表情之间的深层关联。
基于 GRPO 的手部对齐与时间连续性
针对电商直播和产品演示等双手频繁入镜的应用场景,该模型引入了GRPO(Human Preference Alignment),该技术将奖励信号细化至帧级别,并增加了首帧手部检测机制。这大大减少了手部变形、局部结构坍塌和动作不一致等常见问题。

推理速度提升15倍:消除高昂的计算需求
成本是商业部署的另一个关键因素。LongCat-Video-Avatar 1.5 采用了DMD(分布式匹配蒸馏)技术,将原本 50 步的生成过程压缩至仅8 步。 此外,团队将传统的三模型并行架构替换为单个共享基础模型加多个 LoRA 适配器,从而大幅降低了 VRAM 占用量。
在实际测试中,该模型的推理速度提升了约15倍 ,仅需约一分钟即可生成一段10秒的视频。
基准评估:超越业界顶尖模型
通过 EvalTalker 基准测试,770 名评估员和 10 名领域专家对来自新闻、教育和娱乐等复杂领域的视频进行了结构化质量分析。结果表明,LongCat-Video-Avatar 1.5 在多项关键指标上表现卓越:
用户偏好胜率:其胜率比Kling Avatar2.0高出65.9%,比OmniHuman-1.5高出61. 1%,比HeyGen高出54.3%。
单人及多人场景评分:单人场景评分达到3.336,远高于HeyGen等竞争对手;多人场景评分为2.730,显著优于InfiniteTalk(2.339)。
视频稳定性:主体变形率仅为23.1%,背景变形率仅为9.4%;帧丢失率低至0.8%,在所有对比模型中表现最佳。
音视频协调性:面部与身体不同步率降至5.1%,口型不同步率降至29.8%,两项指标均超越了传统商用系统。
美团LongCat大模型团队表示,开源LongCat-Video-Avatar 1.5不仅仅是一次版本更新,更是向全球开发者和创作者社区发出的邀请。 他们希望该模型能成为一个可验证、可改进的技术基础,助力推动数字人视频应用在现实世界中的边界拓展。
开源链接:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技术报告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
项目页面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
美团LongCat大模型团队正式开源了商业级数字人视频生成模型LongCat-Video-Avatar 1.5。该版本标志着模型已从开源最先进技术全面转向实际商业部署,在口型同步、物理真实感、长视频稳定性、多人互动以及高效推理等方面均有重大提升。
三大关键升级,攻克商业化难关
为了使数字人能够在各种实际应用场景中稳定运行,LongCat-Video-Avatar 1.5 通过三项全面改进,解决了传统数字人视频中存在的抖动、失真和高延迟等顽固问题:
商用级音频编码升级
该模型的音频特征提取编码器已从 Wav2Vec2 升级至Whisper-large。 凭借更多的参数和更丰富的多语言先验知识,它现在能够捕捉细微的音素变化和语调节奏。这不仅提升了长句、快速语速和演唱等复杂音频的唇形同步效果,还实现了面部表情、头部动作与语音之间的自然协调——从而显著减少了长视频中的帧跳过和身份漂移现象。
通过多阶段数据增强实现强大的开放域泛化能力
为确保在真实人物、虚拟偶像、动漫角色和动物等不同主体上都能保持稳定的性能,研究团队开发了一条集离线标注和在线验证于一体的多阶段数据处理管道,并引入了三种针对性的增强数据类型:
多人物数据:利用主动说话人检测技术,消除多人物场景中的视听歧义,准确区分说话人与听众。
静默数据:通过筛选无语音的视频,模型可学习静默状态下的自然微表情,从而避免非说话角色出现不必要的嘴部动作。
情绪数据:结合帧级情绪识别过滤,该数据整合了情绪变化,帮助模型把握言语与面部表情之间的深层关联。
基于 GRPO 的手部对齐与时间连续性
针对电商直播和产品演示等双手频繁入镜的应用场景,该模型引入了GRPO(Human Preference Alignment),该技术将奖励信号细化至帧级别,并增加了首帧手部检测机制。这大大减少了手部变形、局部结构坍塌和动作不一致等常见问题。

推理速度提升15倍:消除高昂的计算需求
成本是商业部署的另一个关键因素。LongCat-Video-Avatar 1.5 采用了DMD(分布式匹配蒸馏)技术,将原本 50 步的生成过程压缩至仅8 步。 此外,团队将传统的三模型并行架构替换为单个共享基础模型加多个 LoRA 适配器,从而大幅降低了 VRAM 占用量。
在实际测试中,该模型的推理速度提升了约15倍 ,仅需约一分钟即可生成一段10秒的视频。
基准评估:超越业界顶尖模型
通过 EvalTalker 基准测试,770 名评估员和 10 名领域专家对来自新闻、教育和娱乐等复杂领域的视频进行了结构化质量分析。结果表明,LongCat-Video-Avatar 1.5 在多项关键指标上表现卓越:
用户偏好胜率:其胜率比Kling Avatar2.0高出65.9%,比OmniHuman-1.5高出61. 1%,比HeyGen高出54.3%。
单人及多人场景评分:单人场景评分达到3.336,远高于HeyGen等竞争对手;多人场景评分为2.730,显著优于InfiniteTalk(2.339)。
视频稳定性:主体变形率仅为23.1%,背景变形率仅为9.4%;帧丢失率低至0.8%,在所有对比模型中表现最佳。
音视频协调性:面部与身体不同步率降至5.1%,口型不同步率降至29.8%,两项指标均超越了传统商用系统。
美团LongCat大模型团队表示,开源LongCat-Video-Avatar 1.5不仅仅是一次版本更新,更是向全球开发者和创作者社区发出的邀请。 他们希望该模型能成为一个可验证、可改进的技术基础,助力推动数字人视频应用在现实世界中的边界拓展。
开源链接:
Github:https://github.com/meituan-longcat/LongCat-Video
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技术报告:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
项目页面:https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






