Дом
Ant Group открыла исходный код LingBot-Vision, что позволяет роботам ориентироваться в пространстве
В области воплощённого интеллекта одной из основных задач по-прежнему остаётся обеспечение роботам возможности воспринимать физическое пространство с точностью, сравнимой с человеческой. Robbyant, дочерняя компания Ant Group, специализирующаяся на воплощённом искусственном интеллекте, официально открыла исходный код семейства моделей LingBot-Vision. Этот набор самообучаемых трансформеров для обработки изображений достигает исключительных результатов в плотном пространственном восприятии благодаря инновационной стратегии «моделирования границ», превосходя по производительности более крупные модели по многим тестам, несмотря на меньшее количество параметров.
Большинство современных базовых моделей зрительного восприятия уделяют приоритетное внимание «распознаванию объектов», сосредоточиваясь на определении того, что изображено на снимке, при этом зачастую упуская из виду важнейшие признаки физического взаимодействия, такие как границы объектов, контуры и глубина. LingBot-Vision переворачивает этот подход, рассматривая «границы» в качестве основных сигналов для предварительного обучения. Используя моделирование границ с помощью масок, модель выявляет области изображения с наибольшей информационной плотностью и сосредотачивает на них своё обучение. Этот метод позволяет модели приобретать семантическое понимание и одновременно развивать надёжное геометрическое пространственное восприятие.

Что касается производительности, то флагманская модель LingBot-Vision, ViT-g/16, содержит всего 1,1 миллиарда параметров, но при этом достигает передовых результатов в задачах оценки глубины, включая NYU-Depth v2. Она превосходит DINOv3, имеющую 7 миллиардов параметров, при этом используя обучающий набор данных, размер которого составляет примерно одну треть от размера DINOv3. Для сценариев развертывания с ограниченными ресурсами серия предлагает дистиллированные версии с количеством параметров от 3 миллиардов до меньших значений, обеспечивая высочайшую производительность плотного прогнозирования на различных аппаратных конфигурациях.
Чтобы продемонстрировать практическую ценность технологии, команда разработчиков также модернизировала систему восстановления глубины до версии LingBot-Depth 2.0. Тесты показывают значительное повышение точности при обработке прозрачных объектов — традиционного «слепого пятна» систем восприятия. По мере увеличения объема данных производительность LingBot-Vision продолжает масштабироваться без насыщения, характерного для традиционных моделей, что еще раз подтверждает потенциал её архитектуры пространственного восприятия, ориентированной на границы, в сложных реальных средах.
LingBot-Vision теперь полностью доступен с открытым исходным кодом на Hugging Face по лицензии Apache-2.0, включая веса и код инференса для четырёх размеров моделей — от крупных до мелких. Эта технология позволяет разработчикам наделять роботов более чувствительными способностями физического восприятия при меньших вычислительных затратах, прокладывая путь к более точному и интерактивному будущему в области воплощённого интеллекта.
Связанная статья
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намер
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств
Рекомендации по связанным специальным темам
Комментарии (0)
В области воплощённого интеллекта одной из основных задач по-прежнему остаётся обеспечение роботам возможности воспринимать физическое пространство с точностью, сравнимой с человеческой. Robbyant, дочерняя компания Ant Group, специализирующаяся на воплощённом искусственном интеллекте, официально открыла исходный код семейства моделей LingBot-Vision. Этот набор самообучаемых трансформеров для обработки изображений достигает исключительных результатов в плотном пространственном восприятии благодаря инновационной стратегии «моделирования границ», превосходя по производительности более крупные модели по многим тестам, несмотря на меньшее количество параметров.
Большинство современных базовых моделей зрительного восприятия уделяют приоритетное внимание «распознаванию объектов», сосредоточиваясь на определении того, что изображено на снимке, при этом зачастую упуская из виду важнейшие признаки физического взаимодействия, такие как границы объектов, контуры и глубина. LingBot-Vision переворачивает этот подход, рассматривая «границы» в качестве основных сигналов для предварительного обучения. Используя моделирование границ с помощью масок, модель выявляет области изображения с наибольшей информационной плотностью и сосредотачивает на них своё обучение. Этот метод позволяет модели приобретать семантическое понимание и одновременно развивать надёжное геометрическое пространственное восприятие.

Что касается производительности, то флагманская модель LingBot-Vision, ViT-g/16, содержит всего 1,1 миллиарда параметров, но при этом достигает передовых результатов в задачах оценки глубины, включая NYU-Depth v2. Она превосходит DINOv3, имеющую 7 миллиардов параметров, при этом используя обучающий набор данных, размер которого составляет примерно одну треть от размера DINOv3. Для сценариев развертывания с ограниченными ресурсами серия предлагает дистиллированные версии с количеством параметров от 3 миллиардов до меньших значений, обеспечивая высочайшую производительность плотного прогнозирования на различных аппаратных конфигурациях.
Чтобы продемонстрировать практическую ценность технологии, команда разработчиков также модернизировала систему восстановления глубины до версии LingBot-Depth 2.0. Тесты показывают значительное повышение точности при обработке прозрачных объектов — традиционного «слепого пятна» систем восприятия. По мере увеличения объема данных производительность LingBot-Vision продолжает масштабироваться без насыщения, характерного для традиционных моделей, что еще раз подтверждает потенциал её архитектуры пространственного восприятия, ориентированной на границы, в сложных реальных средах.
LingBot-Vision теперь полностью доступен с открытым исходным кодом на Hugging Face по лицензии Apache-2.0, включая веса и код инференса для четырёх размеров моделей — от крупных до мелких. Эта технология позволяет разработчикам наделять роботов более чувствительными способностями физического восприятия при меньших вычислительных затратах, прокладывая путь к более точному и интерактивному будущему в области воплощённого интеллекта.
GPT 5.5 лидирует в гонке за безопасность ИИ, DeepSeek превосходит по эффективности затрат
Касра Раджерди, исследователь безопасности, недавно опубликовал значимый отчет, в котором подробно описываются практические тесты на способность к логическому рассуждению в вопросах безопасности крупных языковых моделей. Он достиг этого, создав намер
ИИ SpaceX может обогнать Anthropic уже через полгода, заявляет Маск
Генеральный директор SpaceXAI Илон Маск прогнозирует, что его компания займет лидирующие позиции в сфере ИИ в течение шести месяцев, используя вычислительное оборудование для сокращения отставания от
WeRide представляет WITT — физическую крупномасштабную модель искусственного интеллекта
Технологии автономного вождения развиваются с поразительной скоростью. 17 июля WeRide, ведущая компания в области автономного вождения, представила свою собственную когнитивную базовую модель искусств











