螞蟻集團將 LingBot-Vision 開源,賦予機器人空間感知能力
在具身智慧領域中,讓機器人能以類人級的精準度感知實體空間,仍是項根本性的挑戰。 螞蟻集團旗下專注於具身人工智慧的子公司 Robbyant,已正式將 LingBot-Vision 模型系列開源。這套自監督視覺 Transformer 模型透過創新的「邊界建模」策略,在密集空間感知方面取得了卓越成果,儘管參數較少,但在多個基準測試中表現仍優於參數更龐大的模型。
當前多數視覺基礎模型優先考量「物件識別」,著重於辨識影像中的內容,卻往往忽略了物件邊界、輪廓及深度等關鍵的物理互動線索。 LingBot-Vision 顛覆了這種做法,將「邊界」視為主要的預訓練訊號。透過運用遮罩邊界建模,該模型能識別影像中資訊最密集的區域,並將訓練重點集中於此。此方法使模型在獲得語義理解的同時,也能發展出穩健的幾何空間感知能力。

在性能方面,旗艦級 LingBot-Vision 模型 ViT-g/16 僅含 11 億個參數,卻在深度估計任務(包括 NYU-Depth v2)中取得最先進的成果。 其表現超越了擁有 70 億參數的 DINOv3,且僅使用約三分之一規模的訓練資料集。針對資源受限的部署情境,該系列提供從 30 億參數起,逐步縮減至更小規模的蒸餾版本,確保在各種硬體配置下皆能展現頂級的密集預測效能。
為展現該技術的實際價值,開發團隊還將深度補全系統升級至 LingBot-Depth 2.0。測試顯示,在處理透明物體(傳統感知中的盲點)時,準確度有顯著提升。 隨著數據量的增加,LingBot-Vision 的效能持續擴展,且未出現傳統模型常見的效能飽和現象,進一步驗證了其「邊界為中心」的空間感知架構在複雜真實世界環境中的潛力。
LingBot-Vision 現已於 Hugging Face 平台以 Apache-2.0 授權條款全面開源,包含從大到小四種模型尺寸的權重與推論程式碼。這項技術使開發者能夠以更低的運算成本,為機器人配備更靈敏的物理感知能力,為具身智能領域中更精準且互動性更強的未來鋪平道路。
相關文章
GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。頂級模型對比在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試
馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic
SpaceXAI 執行長伊隆·馬斯克預測,該公司將在六個月內在人工智慧領域取得主導地位,並將利用運算硬體來縮小與競爭對手的差距。SpaceXAI 執行長伊隆·馬斯克近日在 X 平台上表示,他的公司目標是在約六個月內引領前沿人工智慧領域。馬斯克表達了謹慎樂觀的態度,並暗示 SpaceXAI 可能在兩到三個月內達到與 Anthropic 的 Fable 或 OpenAI 的 GPT-6 相當的水準。S
WeRide 推出 WITT,一款實體 AI 大型模型
自動駕駛技術正以驚人的速度發展。7月17日,領先的自動駕駛公司 WeRide 正式發表了其自主研發的物理人工智慧認知基礎模型「WeRide WITT」。此次發布標誌著人工智慧在理解與處理複雜的真實世界資料能力方面,邁出了重要的一步。WeRide WITT 的核心概念在於「最小物理事實單位」。 該框架旨在協助人工智慧解讀多模態輸入(例如影片、圖像和文字),將動態的真實世界情境分解為核心事實元素。透過
相關專題推薦
評論 (0)
0/500
在具身智慧領域中,讓機器人能以類人級的精準度感知實體空間,仍是項根本性的挑戰。 螞蟻集團旗下專注於具身人工智慧的子公司 Robbyant,已正式將 LingBot-Vision 模型系列開源。這套自監督視覺 Transformer 模型透過創新的「邊界建模」策略,在密集空間感知方面取得了卓越成果,儘管參數較少,但在多個基準測試中表現仍優於參數更龐大的模型。
當前多數視覺基礎模型優先考量「物件識別」,著重於辨識影像中的內容,卻往往忽略了物件邊界、輪廓及深度等關鍵的物理互動線索。 LingBot-Vision 顛覆了這種做法,將「邊界」視為主要的預訓練訊號。透過運用遮罩邊界建模,該模型能識別影像中資訊最密集的區域,並將訓練重點集中於此。此方法使模型在獲得語義理解的同時,也能發展出穩健的幾何空間感知能力。

在性能方面,旗艦級 LingBot-Vision 模型 ViT-g/16 僅含 11 億個參數,卻在深度估計任務(包括 NYU-Depth v2)中取得最先進的成果。 其表現超越了擁有 70 億參數的 DINOv3,且僅使用約三分之一規模的訓練資料集。針對資源受限的部署情境,該系列提供從 30 億參數起,逐步縮減至更小規模的蒸餾版本,確保在各種硬體配置下皆能展現頂級的密集預測效能。
為展現該技術的實際價值,開發團隊還將深度補全系統升級至 LingBot-Depth 2.0。測試顯示,在處理透明物體(傳統感知中的盲點)時,準確度有顯著提升。 隨著數據量的增加,LingBot-Vision 的效能持續擴展,且未出現傳統模型常見的效能飽和現象,進一步驗證了其「邊界為中心」的空間感知架構在複雜真實世界環境中的潛力。
LingBot-Vision 現已於 Hugging Face 平台以 Apache-2.0 授權條款全面開源,包含從大到小四種模型尺寸的權重與推論程式碼。這項技術使開發者能夠以更低的運算成本,為機器人配備更靈敏的物理感知能力,為具身智能領域中更精準且互動性更強的未來鋪平道路。
GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。頂級模型對比在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試
馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic
SpaceXAI 執行長伊隆·馬斯克預測,該公司將在六個月內在人工智慧領域取得主導地位,並將利用運算硬體來縮小與競爭對手的差距。SpaceXAI 執行長伊隆·馬斯克近日在 X 平台上表示,他的公司目標是在約六個月內引領前沿人工智慧領域。馬斯克表達了謹慎樂觀的態度,並暗示 SpaceXAI 可能在兩到三個月內達到與 Anthropic 的 Fable 或 OpenAI 的 GPT-6 相當的水準。S
WeRide 推出 WITT,一款實體 AI 大型模型
自動駕駛技術正以驚人的速度發展。7月17日,領先的自動駕駛公司 WeRide 正式發表了其自主研發的物理人工智慧認知基礎模型「WeRide WITT」。此次發布標誌著人工智慧在理解與處理複雜的真實世界資料能力方面,邁出了重要的一步。WeRide WITT 的核心概念在於「最小物理事實單位」。 該框架旨在協助人工智慧解讀多模態輸入(例如影片、圖像和文字),將動態的真實世界情境分解為核心事實元素。透過





首頁






