字节跳动发布Lance 3B:一款集视觉与语言理解及生成于一体的统一模型
字节跳动研究院已正式将旗下原生统一多模态大模型“Lance”开源。
尽管人工智能行业通常依赖于拥有数千亿甚至数万亿参数的模型,或是由独立组件组合而成的模型,但Lance却代表了一项重大突破。 它在仅拥有3B(30亿)个激活参数这一极其轻量级的规模下,仍能提供完整的功能,有效弥合了“理解模型(VLM)”与“生成模型(DiT/Diffusion)”之间的技术鸿沟。

主要亮点:
原生统一:该模型并非拼凑而成,而是从零开始构建,将图像和视频的理解、生成以及跨模态编辑整合到单一系统中。
全面性能:单一模型可无缝处理 $X rightarrow T$(文本/视频理解)、$X rightarrow I$(图像生成/编辑)和 $X rightarrow V$(视频生成/编辑)这三项核心输出任务。
开源且免费:采用许可范围极广的Apache 2.0许可证发布。权重模型已在Hugging Face上完全开放,整个流程仅需128块A100 GPU即可运行,成本适中。
技术解析:它如何在相互矛盾的需求之间实现“同步”?
在传统的人工智能架构中,“理解”与“生成”能力往往存在矛盾:理解任务需要过滤噪声以提取高级语义特征,而生成任务则侧重于低级纹理、几何结构和时间动态。
为解决这一行业性挑战,Lance 采用了巧妙的“共享上下文 + 并行能力解耦”设计:
1. 统一交织序列与双流专家架构
所有文本、图像和视频输入首先被分词并转换为统一的“交错序列”。随后,该序列由双流 MoE(多专家)架构进行处理,使专门负责“理解”和“生成”的专家模块能够独立运行,从而有效解决了能力冲突。
理解侧:文本令牌和视觉输入利用 Qwen2.5-VL 的嵌入层和 ViT 编码器,准确提取高级语义视觉令牌。
生成侧:视觉输入通过 Wan2.2 强大的 3D 因果 VAE 进行压缩,实现 $16 倍$ 的空间下采样和 $4 倍$ 的时间下采样,从而保留了详细的动态连续表示。
2. MaPE(模态感知旋转位置编码)
长序列中混合的视觉令牌(图像、文本和视频)可能导致“边界混淆”幻觉。Lance 引入了 MaPE 机制,该机制为不同的模态组添加了固定的时间偏移量。这种优雅的设计能够在不破坏图像和视频内部结构及时间顺序的前提下,实现强大的空间和时间边界识别。
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
四阶段极限训练:128张GPU的“精简之战”
与大型企业动用数千块GPU的“蛮力美学”形成鲜明对比,Lance的训练过程展现了极高的资金利用效率。整个生命周期严格限制在最多128块GPU的预算内,并经历四个紧密衔接的阶段:
第一阶段:预训练(1.5T 令牌)——处理 10 亿张图像-文本对和 1.4 亿个视频-文本对,为多模态理解奠定坚实基础。
第二阶段:连续训练(3000亿令牌)——整合编辑、主题驱动生成及多模态理解数据,以激发多任务协同效应。
第三阶段:监督式微调(720亿令牌)——大规模注入人类指令,重点关注指令遵循与视觉身份一致性。
第四阶段:强化学习(GRPO算法)——利用基于群组的相对策略优化,并特别采用PaddleOCR作为奖励模型,专门解决文本渲染不准确以及文本与图像对齐错误等AI问题。
卓越成果:3B模型在多个领域击败7B巨头
得益于跨任务数据协同(模型在学习生成时深化理解,在学习理解时提升生成能力),3B规模的Lance在各项基准测试中均表现卓越:
视频生成(VBench):得分85.11分! 它超越了TUNA(84.06)等同类全能型模型,并优于HunyuanVideo(83.33)和Wan2.1-T2V(83.69)等专业视频生成模型。
图像生成(GenEval):得分0.90,稳居全球开源模型前列。
视频理解(MVBench):得分62.0分,显著超过了专用理解模型Show-o2(7B,55.7分),而该模型的规模是Lance的两倍。
行业震动:多模态应用的部署成本将大幅下降
Lance的开源发布将对行业产生重大颠覆,特别是对于AI短片、智能代理(Agent)协作和交互式媒体等蓬勃发展的领域。
此前,要开发一款既能理解剧本、生成分镜,又能实时修改视觉效果并保持角色一致性的AI工具,必须部署、调度并拼接多个大型模型(分别用于VLM语义处理、Diffusion图像生成和时序视频处理)。 这不仅导致系统延迟,更让开发人员在管道对齐方面头疼不已。
如今,Lance3B 仅凭单一模型便实现了“左眼观察、右眼编辑、双手创作”的效果
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
字节跳动研究院已正式将旗下原生统一多模态大模型“Lance”开源。
尽管人工智能行业通常依赖于拥有数千亿甚至数万亿参数的模型,或是由独立组件组合而成的模型,但Lance却代表了一项重大突破。 它在仅拥有3B(30亿)个激活参数这一极其轻量级的规模下,仍能提供完整的功能,有效弥合了“理解模型(VLM)”与“生成模型(DiT/Diffusion)”之间的技术鸿沟。

主要亮点:
原生统一:该模型并非拼凑而成,而是从零开始构建,将图像和视频的理解、生成以及跨模态编辑整合到单一系统中。
全面性能:单一模型可无缝处理 $X rightarrow T$(文本/视频理解)、$X rightarrow I$(图像生成/编辑)和 $X rightarrow V$(视频生成/编辑)这三项核心输出任务。
开源且免费:采用许可范围极广的Apache 2.0许可证发布。权重模型已在Hugging Face上完全开放,整个流程仅需128块A100 GPU即可运行,成本适中。
技术解析:它如何在相互矛盾的需求之间实现“同步”?
在传统的人工智能架构中,“理解”与“生成”能力往往存在矛盾:理解任务需要过滤噪声以提取高级语义特征,而生成任务则侧重于低级纹理、几何结构和时间动态。
为解决这一行业性挑战,Lance 采用了巧妙的“共享上下文 + 并行能力解耦”设计:
1. 统一交织序列与双流专家架构
所有文本、图像和视频输入首先被分词并转换为统一的“交错序列”。随后,该序列由双流 MoE(多专家)架构进行处理,使专门负责“理解”和“生成”的专家模块能够独立运行,从而有效解决了能力冲突。
理解侧:文本令牌和视觉输入利用 Qwen2.5-VL 的嵌入层和 ViT 编码器,准确提取高级语义视觉令牌。
生成侧:视觉输入通过 Wan2.2 强大的 3D 因果 VAE 进行压缩,实现 $16 倍$ 的空间下采样和 $4 倍$ 的时间下采样,从而保留了详细的动态连续表示。
2. MaPE(模态感知旋转位置编码)
长序列中混合的视觉令牌(图像、文本和视频)可能导致“边界混淆”幻觉。Lance 引入了 MaPE 机制,该机制为不同的模态组添加了固定的时间偏移量。这种优雅的设计能够在不破坏图像和视频内部结构及时间顺序的前提下,实现强大的空间和时间边界识别。
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
四阶段极限训练:128张GPU的“精简之战”
与大型企业动用数千块GPU的“蛮力美学”形成鲜明对比,Lance的训练过程展现了极高的资金利用效率。整个生命周期严格限制在最多128块GPU的预算内,并经历四个紧密衔接的阶段:
第一阶段:预训练(1.5T 令牌)——处理 10 亿张图像-文本对和 1.4 亿个视频-文本对,为多模态理解奠定坚实基础。
第二阶段:连续训练(3000亿令牌)——整合编辑、主题驱动生成及多模态理解数据,以激发多任务协同效应。
第三阶段:监督式微调(720亿令牌)——大规模注入人类指令,重点关注指令遵循与视觉身份一致性。
第四阶段:强化学习(GRPO算法)——利用基于群组的相对策略优化,并特别采用PaddleOCR作为奖励模型,专门解决文本渲染不准确以及文本与图像对齐错误等AI问题。
卓越成果:3B模型在多个领域击败7B巨头
得益于跨任务数据协同(模型在学习生成时深化理解,在学习理解时提升生成能力),3B规模的Lance在各项基准测试中均表现卓越:
视频生成(VBench):得分85.11分! 它超越了TUNA(84.06)等同类全能型模型,并优于HunyuanVideo(83.33)和Wan2.1-T2V(83.69)等专业视频生成模型。
图像生成(GenEval):得分0.90,稳居全球开源模型前列。
视频理解(MVBench):得分62.0分,显著超过了专用理解模型Show-o2(7B,55.7分),而该模型的规模是Lance的两倍。
行业震动:多模态应用的部署成本将大幅下降
Lance的开源发布将对行业产生重大颠覆,特别是对于AI短片、智能代理(Agent)协作和交互式媒体等蓬勃发展的领域。
此前,要开发一款既能理解剧本、生成分镜,又能实时修改视觉效果并保持角色一致性的AI工具,必须部署、调度并拼接多个大型模型(分别用于VLM语义处理、Diffusion图像生成和时序视频处理)。 这不仅导致系统延迟,更让开发人员在管道对齐方面头疼不已。
如今,Lance3B 仅凭单一模型便实现了“左眼观察、右眼编辑、双手创作”的效果
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






