蚂蚁集团开源LingBot-Vision,赋予机器人空间感知能力
在具身智能领域,让机器人能够以接近人类的精度感知物理空间,仍然是一项根本性挑战。 蚂蚁集团旗下专注于具身人工智能的子公司Robbyant已正式开源LingBot-Vision模型系列。这一套自监督视觉Transformer模型通过创新的“边界建模”策略,在密集空间感知方面取得了卓越成果,尽管参数数量较少,但在多个基准测试中表现均优于更大规模的模型。
当前大多数视觉基础模型优先考虑“物体识别”,侧重于识别图像中的内容,却往往忽视了物体边界、轮廓和深度等关键的物理交互线索。 LingBot-Vision 颠覆了这一思路,将“边界”作为主要的预训练信号。通过利用遮罩边界建模,该模型能够识别图像中信息最密集的区域,并以此为核心进行训练。这种方法使模型在获得语义理解的同时,也能发展出强大的几何空间感知能力。

在性能方面,旗舰模型 LingBot-Vision(ViT-g/16)仅包含 11 亿个参数,却在深度估计任务(包括 NYU-Depth v2)中取得了最先进的结果。 它超越了拥有70亿参数的DINOv3,而其使用的训练数据集规模仅为后者的三分之一左右。针对资源受限的部署场景,该系列提供了从30亿参数到更小规模的蒸馏版本,确保在各种硬件配置下都能实现顶级的密集预测性能。
为展示该技术的实际价值,开发团队还将深度补全系统升级为 LingBot-Depth 2.0。测试表明,在处理透明物体(这一传统的感知盲点)时,其准确率有了显著提升。 随着数据量的增加,LingBot-Vision 的性能持续提升,且不会出现传统模型典型的饱和现象,这进一步验证了其以边界为中心空间感知架构在复杂真实世界环境中的潜力。
LingBot-Vision 现已在 Hugging Face 上完全开源,采用 Apache-2.0 许可证,包含从大到小四种模型规格的权重和推理代码。该技术使开发者能够以更低的计算成本为机器人配备更灵敏的物理感知能力,为具身智能领域更精准、更具交互性的未来铺平道路。
相关文章
GPT 5.5 领跑 AI 安全竞赛,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人员,最近发布了一份重要报告,详细阐述了对主要大型语言模型的安全推理能力进行的实际测试。他通过构建一个故意存在漏洞的书评应用程序实现了这一目标。在该场景中,模拟了现实世界中的漏洞,Rahjerdi 在应用程序文件中嵌入了 Google 移动后端服务的凭据。这些模型的任务是解压并识别这些凭据,从而直接访问数据库。顶级模型对比在严格的两小时时间限制和 10 美元预算约束下,各模型的表现水平各不相同。GPT-5.5 成为表现最强的模型,成功完成了 10 次尝试
马斯克称,SpaceX的人工智能可能在半年内超越Anthropic
SpaceXAI首席执行官埃隆·马斯克预测,公司将在六个月内主导人工智能领域,并借助计算硬件来缩小与竞争对手的差距。SpaceXAI首席执行官埃隆·马斯克近日在X平台上表示,其公司计划在约六个月内引领前沿人工智能领域。马斯克表达了谨慎乐观的态度,暗示SpaceXAI有望在两到三个月内达到Anthropic的Fable或OpenAI的GPT-6的水平。SpaceXAI目前提供17种模型,每种模型在智
WeRide 发布 WITT——一款物理人工智能大模型
自动驾驶技术正以惊人的速度发展。7月17日,领先的自动驾驶公司威瑞德(WeRide)发布了其自主研发的物理AI认知基础模型——WeRide WITT。此次发布标志着AI在理解和处理复杂的现实世界数据能力方面迈出了重要一步。WeRide WITT的核心理念是“最小物理事实单元”。 该框架旨在帮助人工智能解读视频、图像和文本等多模态输入,将动态的现实世界场景分解为核心事实要素。通过识别和验证这些单元,
相关专题推荐
评论 (0)
0/500
在具身智能领域,让机器人能够以接近人类的精度感知物理空间,仍然是一项根本性挑战。 蚂蚁集团旗下专注于具身人工智能的子公司Robbyant已正式开源LingBot-Vision模型系列。这一套自监督视觉Transformer模型通过创新的“边界建模”策略,在密集空间感知方面取得了卓越成果,尽管参数数量较少,但在多个基准测试中表现均优于更大规模的模型。
当前大多数视觉基础模型优先考虑“物体识别”,侧重于识别图像中的内容,却往往忽视了物体边界、轮廓和深度等关键的物理交互线索。 LingBot-Vision 颠覆了这一思路,将“边界”作为主要的预训练信号。通过利用遮罩边界建模,该模型能够识别图像中信息最密集的区域,并以此为核心进行训练。这种方法使模型在获得语义理解的同时,也能发展出强大的几何空间感知能力。

在性能方面,旗舰模型 LingBot-Vision(ViT-g/16)仅包含 11 亿个参数,却在深度估计任务(包括 NYU-Depth v2)中取得了最先进的结果。 它超越了拥有70亿参数的DINOv3,而其使用的训练数据集规模仅为后者的三分之一左右。针对资源受限的部署场景,该系列提供了从30亿参数到更小规模的蒸馏版本,确保在各种硬件配置下都能实现顶级的密集预测性能。
为展示该技术的实际价值,开发团队还将深度补全系统升级为 LingBot-Depth 2.0。测试表明,在处理透明物体(这一传统的感知盲点)时,其准确率有了显著提升。 随着数据量的增加,LingBot-Vision 的性能持续提升,且不会出现传统模型典型的饱和现象,这进一步验证了其以边界为中心空间感知架构在复杂真实世界环境中的潜力。
LingBot-Vision 现已在 Hugging Face 上完全开源,采用 Apache-2.0 许可证,包含从大到小四种模型规格的权重和推理代码。该技术使开发者能够以更低的计算成本为机器人配备更灵敏的物理感知能力,为具身智能领域更精准、更具交互性的未来铺平道路。
GPT 5.5 领跑 AI 安全竞赛,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人员,最近发布了一份重要报告,详细阐述了对主要大型语言模型的安全推理能力进行的实际测试。他通过构建一个故意存在漏洞的书评应用程序实现了这一目标。在该场景中,模拟了现实世界中的漏洞,Rahjerdi 在应用程序文件中嵌入了 Google 移动后端服务的凭据。这些模型的任务是解压并识别这些凭据,从而直接访问数据库。顶级模型对比在严格的两小时时间限制和 10 美元预算约束下,各模型的表现水平各不相同。GPT-5.5 成为表现最强的模型,成功完成了 10 次尝试
马斯克称,SpaceX的人工智能可能在半年内超越Anthropic
SpaceXAI首席执行官埃隆·马斯克预测,公司将在六个月内主导人工智能领域,并借助计算硬件来缩小与竞争对手的差距。SpaceXAI首席执行官埃隆·马斯克近日在X平台上表示,其公司计划在约六个月内引领前沿人工智能领域。马斯克表达了谨慎乐观的态度,暗示SpaceXAI有望在两到三个月内达到Anthropic的Fable或OpenAI的GPT-6的水平。SpaceXAI目前提供17种模型,每种模型在智
WeRide 发布 WITT——一款物理人工智能大模型
自动驾驶技术正以惊人的速度发展。7月17日,领先的自动驾驶公司威瑞德(WeRide)发布了其自主研发的物理AI认知基础模型——WeRide WITT。此次发布标志着AI在理解和处理复杂的现实世界数据能力方面迈出了重要一步。WeRide WITT的核心理念是“最小物理事实单元”。 该框架旨在帮助人工智能解读视频、图像和文本等多模态输入,将动态的现实世界场景分解为核心事实要素。通过识别和验证这些单元,





首页






