字節跳動推出 Lance 3B:一款用於視覺與語言理解及生成的一體化模型
字節跳動研究院已正式將其原生統一多模態大模型「Lance」開源。
儘管人工智慧產業通常依賴參數達數千億或數兆的模型,或是透過組合獨立元件所組建的模型,Lance 卻代表了一項重大突破。 它在僅擁有 3B(30 億)這個極為輕量化的激發參數數量下,仍能提供完整功能,有效彌合了「理解型模型(VLM)」與「生成型模型(DiT/Diffusion)」之間的技術鴻溝。

主要亮點:
原生統一:並非拼湊而成,而是從零開始建構,將圖像與影片的理解、生成及跨模態編輯整合至單一系統中。
全面性能:單一模型可無縫處理 $X rightarrow T$(文字/影片理解)、$X rightarrow I$(影像生成/編輯)以及 $X rightarrow V$(影片生成/編輯)這三項核心輸出任務。
開源且免費:採用高度開放的 Apache 2.0 授權釋出。權重模型已完整上傳至 Hugging Face,且整個流程僅需 128 張 A100 GPU 的中等預算即可運行。
技術解析:它如何在相互矛盾的需求之間實現「同步」?
在傳統的 AI 架構中,「理解」與「生成」能力往往相互衝突:理解任務需要過濾雜訊以提取高階語義特徵,而生成任務則著重於低階紋理、幾何結構和時間動態。
為解決這項業界普遍面臨的挑戰,Lance 採用了一種巧妙的「共享上下文+並行能力解耦」設計:
1. 統一交錯序列與雙流專家架構
所有文字、圖像和影片輸入首先被分詞,並轉換為統一的「交錯序列」。該序列隨後由雙流 MoE(多專家)架構進行處理,使專注於「理解」與「生成」的專家模組能獨立運作,有效解決能力衝突。
理解側:文字標記與視覺輸入利用 Qwen2.5-VL 的嵌入層及 ViT 編碼器,精準提取高階語義視覺標記。
生成側:視覺輸入透過 Wan2.2 強大的 3D 因果 VAE 進行壓縮,實現 $16 倍$ 的空間下採樣與 $4 倍$ 的時間下採樣,從而保留詳細的動態連續表徵。
2. MaPE(模態感知旋轉位置編碼)
長序列中混合的視覺標記(圖像、文字和影片)可能導致「邊界混淆」的幻覺。Lance 引入了 MaPE 機制,該機制為不同的模態群組添加固定的時間偏移量。此精巧的設計能在不破壞圖像與影片內部結構及時間順序的前提下,實現強大的空間與時間邊界識別能力。
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
四階段極限訓練:僅用 128 張 GPU 展開的「精簡之戰」
相較於大型企業動用數千張 GPU 的「蠻力美學」,Lance 的訓練流程展現出極高的成本效益。整個生命週期嚴格限制在 128 張 GPU 的最高預算內,並歷經四個緊密整合的階段:
第一階段:預訓練(1.5T 令牌)—— 處理 10 億組圖像-文字對與 1.4 億組影片-文字對,為多模態理解奠定穩固基礎。
第二階段:持續訓練(3,000 億個標記)—— 整合編輯、主題驅動生成及多模態理解資料,以激發多任務協同效應。
第三階段:監督式微調(720億個標記)—— 大量注入人類指令,著重於指令遵循與視覺身分一致性。
第四階段:強化學習(GRPO 演算法)—— 採用基於群組的相對策略優化,並特別運用 PaddleOCR 作為獎勵模型,以針對性地解決 AI 常見問題,例如文字渲染不準確及文字與圖像對齊錯誤等。
卓越成果:3B 模型在多領域中擊敗 7B 巨頭
得益於跨任務數據協作(模型在學習生成時深化理解,在學習理解時提升生成能力),這款 3B 規模的 Lance 模型在各項基準測試中均展現出卓越表現:
影片生成(VBench):獲得 85.11 分! 其表現不僅超越了 TUNA(84.06)等同類全能型模型,更優於 HunyuanVideo(83.33)和 Wan2.1-T2V(83.69)等專用影片生成模型。
影像生成(GenEval):得分 0.90,穩居全球開源模型前列。
影片理解(MVBench):得分 62.0 分,顯著超越專用理解模型 Show-o2(7B,55.7 分),而該模型的規模是 Lance 的兩倍。
產業震撼:多模態應用的部署成本將大幅驟降
Lance 的開源釋出將對產業造成重大顛覆,特別是對 AI 短片、智能代理(Agent)協作以及互動媒體等蓬勃發展的領域而言。
過去,若要開發一款能理解劇本、生成分鏡腳本,並在維持角色一致性的同時即時修改視覺效果的人工智慧工具,必須部署、調度並整合多個大型模型(分別用於 VLM 語義、Diffusion 影像生成以及時序影片處理)。 這不僅導致系統延遲,更讓開發者將工作流程的協調視為一場噩夢。
如今,Lance3B 僅憑單一模型,便實現了「左眼觀察、右眼編輯、雙手創作」的目標
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500
字節跳動研究院已正式將其原生統一多模態大模型「Lance」開源。
儘管人工智慧產業通常依賴參數達數千億或數兆的模型,或是透過組合獨立元件所組建的模型,Lance 卻代表了一項重大突破。 它在僅擁有 3B(30 億)這個極為輕量化的激發參數數量下,仍能提供完整功能,有效彌合了「理解型模型(VLM)」與「生成型模型(DiT/Diffusion)」之間的技術鴻溝。

主要亮點:
原生統一:並非拼湊而成,而是從零開始建構,將圖像與影片的理解、生成及跨模態編輯整合至單一系統中。
全面性能:單一模型可無縫處理 $X rightarrow T$(文字/影片理解)、$X rightarrow I$(影像生成/編輯)以及 $X rightarrow V$(影片生成/編輯)這三項核心輸出任務。
開源且免費:採用高度開放的 Apache 2.0 授權釋出。權重模型已完整上傳至 Hugging Face,且整個流程僅需 128 張 A100 GPU 的中等預算即可運行。
技術解析:它如何在相互矛盾的需求之間實現「同步」?
在傳統的 AI 架構中,「理解」與「生成」能力往往相互衝突:理解任務需要過濾雜訊以提取高階語義特徵,而生成任務則著重於低階紋理、幾何結構和時間動態。
為解決這項業界普遍面臨的挑戰,Lance 採用了一種巧妙的「共享上下文+並行能力解耦」設計:
1. 統一交錯序列與雙流專家架構
所有文字、圖像和影片輸入首先被分詞,並轉換為統一的「交錯序列」。該序列隨後由雙流 MoE(多專家)架構進行處理,使專注於「理解」與「生成」的專家模組能獨立運作,有效解決能力衝突。
理解側:文字標記與視覺輸入利用 Qwen2.5-VL 的嵌入層及 ViT 編碼器,精準提取高階語義視覺標記。
生成側:視覺輸入透過 Wan2.2 強大的 3D 因果 VAE 進行壓縮,實現 $16 倍$ 的空間下採樣與 $4 倍$ 的時間下採樣,從而保留詳細的動態連續表徵。
2. MaPE(模態感知旋轉位置編碼)
長序列中混合的視覺標記(圖像、文字和影片)可能導致「邊界混淆」的幻覺。Lance 引入了 MaPE 機制,該機制為不同的模態群組添加固定的時間偏移量。此精巧的設計能在不破壞圖像與影片內部結構及時間順序的前提下,實現強大的空間與時間邊界識別能力。
[Unified Interleaved Sequence] ──► [MaPE Modal Boundary Isolation] ──► [Dual-Stream Expert Architecture (MoE)]
四階段極限訓練:僅用 128 張 GPU 展開的「精簡之戰」
相較於大型企業動用數千張 GPU 的「蠻力美學」,Lance 的訓練流程展現出極高的成本效益。整個生命週期嚴格限制在 128 張 GPU 的最高預算內,並歷經四個緊密整合的階段:
第一階段:預訓練(1.5T 令牌)—— 處理 10 億組圖像-文字對與 1.4 億組影片-文字對,為多模態理解奠定穩固基礎。
第二階段:持續訓練(3,000 億個標記)—— 整合編輯、主題驅動生成及多模態理解資料,以激發多任務協同效應。
第三階段:監督式微調(720億個標記)—— 大量注入人類指令,著重於指令遵循與視覺身分一致性。
第四階段:強化學習(GRPO 演算法)—— 採用基於群組的相對策略優化,並特別運用 PaddleOCR 作為獎勵模型,以針對性地解決 AI 常見問題,例如文字渲染不準確及文字與圖像對齊錯誤等。
卓越成果:3B 模型在多領域中擊敗 7B 巨頭
得益於跨任務數據協作(模型在學習生成時深化理解,在學習理解時提升生成能力),這款 3B 規模的 Lance 模型在各項基準測試中均展現出卓越表現:
影片生成(VBench):獲得 85.11 分! 其表現不僅超越了 TUNA(84.06)等同類全能型模型,更優於 HunyuanVideo(83.33)和 Wan2.1-T2V(83.69)等專用影片生成模型。
影像生成(GenEval):得分 0.90,穩居全球開源模型前列。
影片理解(MVBench):得分 62.0 分,顯著超越專用理解模型 Show-o2(7B,55.7 分),而該模型的規模是 Lance 的兩倍。
產業震撼:多模態應用的部署成本將大幅驟降
Lance 的開源釋出將對產業造成重大顛覆,特別是對 AI 短片、智能代理(Agent)協作以及互動媒體等蓬勃發展的領域而言。
過去,若要開發一款能理解劇本、生成分鏡腳本,並在維持角色一致性的同時即時修改視覺效果的人工智慧工具,必須部署、調度並整合多個大型模型(分別用於 VLM 語義、Diffusion 影像生成以及時序影片處理)。 這不僅導致系統延遲,更讓開發者將工作流程的協調視為一場噩夢。
如今,Lance3B 僅憑單一模型,便實現了「左眼觀察、右眼編輯、雙手創作」的目標
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






