ESI-Bench Ли Фэйфэй: ИИ эволюционирует от наблюдателя к участнику
В последнее время значительное внимание привлек тестовый набор ESI-Bench (Embodied Spatial Intelligence Benchmark), выпущенный командой Фэй-Фэй Ли. Этот тестовый набор, который называют «ImageNet воплощённого интеллекта», выявляет серьёзные недостатки ведущих крупных моделей при взаимодействии с физическим пространством.

Почему ESI-Bench устанавливает новый стандарт для воплощённого интеллекта
Ранее оценки пространственного интеллекта ИИ в основном опирались на «пассивное восприятие»: модели подавали несколько изображений с оптимальным ракурсом, и она должна была логически выводить выводы. Такой подход по сути проверяет «зрение» модели, а не её «пространственное познание».
Основной прорыв ESI-Bench заключается в обеспечении цикла «восприятие-действие».
Наблюдатели становятся действующими лицами: в ESI-Bench модель не может оставаться неподвижной и выносить суждения на основе предоставленных изображений; она должна активно решать, куда идти, на что смотреть, какие объекты поднимать и какие механические конструкции приводить в действие, раскрывая скрытую пространственную информацию посредством серии интерактивных действий.
Основа проектирования: тестовый набор основан на «системе базовых знаний человеческих младенцев», разработанной когнитивным психологом Элизабет Спелке, которая охватывает четыре измерения: представление объектов, расположение и геометрия, представление количества и целенаправленное действие.
Масштаб и платформа: он включает 10 категорий, 29 подкатегорий и 3 081 экземпляр задачи, построенных на симуляционной платформе OmniGibson с использованием материалов из библиотеки сцен BEHAVIOR-1K.
Три основные выводы, сделанные в ходе оценки
Исследовательская группа провела углублённые тесты передовых мультимодальных моделей, таких как GPT-5 и серия Gemini. Результаты заставляют задуматься:
1. Узким местом является не восприятие, а стратегия действий
При наличии оптимального ракурса модели часто дают точные ответы — точность может подскочить с 14,6 % до 95,1 %. Но когда им приходится активно искать нужный ракурс, точность резко падает.
«Слепота действий»: моделям не хватает стратегий навигации и манипуляции; неверные действия приводят к некачественным представлениям, что вызывает цепную реакцию ошибок в последующих суждениях.
2. Несовершенная 3D-реконструкция вводит в заблуждение больше, чем 2D-изображения
Исследование опровергает предположение о том, что «3D-карты являются универсальным решением».
При подаче идеальных 3D-данных с видом сверху, эффективность вывода превосходна. Однако использование современных передовых методов VGGT для реконструкции в реальном времени приводит к появлению геометрических артефактов, ошибок окклюзии и отклонений по глубине — по сути, в модель вывода подаются «токсичные» данные, что приводит к худшей производительности, чем при простом просмотре 2D-изображений.

3. Метакогнитивный дефицит: ИИ не осознает, что «не видел достаточно»
Это самый большой когнитивный разрыв между людьми и ИИ:
Разница в когнитивной осторожности: люди активно ищут опровергающие точки зрения, когда информация неоднозначна, и снижают степень уверенности в условиях неопределённости.
Галлюцинации модели: модели часто слишком рано прекращают поиск, даже при крайне ограниченной информации, и с уверенностью выдают неверные выводы. Команда называет это «метакогнитивным дефицитом» — модели не хватает внутреннего механизма сомнения, и она не может оценить, достаточна ли имеющаяся информация.
Куда движется воплощённый интеллект
ESI-Bench сигнализирует о смене парадигмы в оценке воплощенного интеллекта — от «статического сопоставления изображений и текста» к «реальному физическому взаимодействию». Как отмечает команда Фэй-Фэй Ли, для достижения подлинного пространственного интеллекта требуется нечто большее, чем просто наслоение визуальных кодировщиков или увеличение вычислительной мощности.
Будущие исследования в области воплощённого интеллекта должны сосредоточиться на наделении моделей:
способности принимать решения о последовательности активного исследования, а не простого распознавания изображений;
большей устойчивости, позволяющей сохранять логическое суждение даже при неполных наблюдениях за сценой;
встроенный метакогнитивный цикл, благодаря которому ИИ будет учиться исследовать ситуацию при отсутствии ответов, а не генерировать ложные галлюцинации.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
В последнее время значительное внимание привлек тестовый набор ESI-Bench (Embodied Spatial Intelligence Benchmark), выпущенный командой Фэй-Фэй Ли. Этот тестовый набор, который называют «ImageNet воплощённого интеллекта», выявляет серьёзные недостатки ведущих крупных моделей при взаимодействии с физическим пространством.

Почему ESI-Bench устанавливает новый стандарт для воплощённого интеллекта
Ранее оценки пространственного интеллекта ИИ в основном опирались на «пассивное восприятие»: модели подавали несколько изображений с оптимальным ракурсом, и она должна была логически выводить выводы. Такой подход по сути проверяет «зрение» модели, а не её «пространственное познание».
Основной прорыв ESI-Bench заключается в обеспечении цикла «восприятие-действие».
Наблюдатели становятся действующими лицами: в ESI-Bench модель не может оставаться неподвижной и выносить суждения на основе предоставленных изображений; она должна активно решать, куда идти, на что смотреть, какие объекты поднимать и какие механические конструкции приводить в действие, раскрывая скрытую пространственную информацию посредством серии интерактивных действий.
Основа проектирования: тестовый набор основан на «системе базовых знаний человеческих младенцев», разработанной когнитивным психологом Элизабет Спелке, которая охватывает четыре измерения: представление объектов, расположение и геометрия, представление количества и целенаправленное действие.
Масштаб и платформа: он включает 10 категорий, 29 подкатегорий и 3 081 экземпляр задачи, построенных на симуляционной платформе OmniGibson с использованием материалов из библиотеки сцен BEHAVIOR-1K.
Три основные выводы, сделанные в ходе оценки
Исследовательская группа провела углублённые тесты передовых мультимодальных моделей, таких как GPT-5 и серия Gemini. Результаты заставляют задуматься:
1. Узким местом является не восприятие, а стратегия действий
При наличии оптимального ракурса модели часто дают точные ответы — точность может подскочить с 14,6 % до 95,1 %. Но когда им приходится активно искать нужный ракурс, точность резко падает.
«Слепота действий»: моделям не хватает стратегий навигации и манипуляции; неверные действия приводят к некачественным представлениям, что вызывает цепную реакцию ошибок в последующих суждениях.
2. Несовершенная 3D-реконструкция вводит в заблуждение больше, чем 2D-изображения
Исследование опровергает предположение о том, что «3D-карты являются универсальным решением».
При подаче идеальных 3D-данных с видом сверху, эффективность вывода превосходна. Однако использование современных передовых методов VGGT для реконструкции в реальном времени приводит к появлению геометрических артефактов, ошибок окклюзии и отклонений по глубине — по сути, в модель вывода подаются «токсичные» данные, что приводит к худшей производительности, чем при простом просмотре 2D-изображений.

3. Метакогнитивный дефицит: ИИ не осознает, что «не видел достаточно»
Это самый большой когнитивный разрыв между людьми и ИИ:
Разница в когнитивной осторожности: люди активно ищут опровергающие точки зрения, когда информация неоднозначна, и снижают степень уверенности в условиях неопределённости.
Галлюцинации модели: модели часто слишком рано прекращают поиск, даже при крайне ограниченной информации, и с уверенностью выдают неверные выводы. Команда называет это «метакогнитивным дефицитом» — модели не хватает внутреннего механизма сомнения, и она не может оценить, достаточна ли имеющаяся информация.
Куда движется воплощённый интеллект
ESI-Bench сигнализирует о смене парадигмы в оценке воплощенного интеллекта — от «статического сопоставления изображений и текста» к «реальному физическому взаимодействию». Как отмечает команда Фэй-Фэй Ли, для достижения подлинного пространственного интеллекта требуется нечто большее, чем просто наслоение визуальных кодировщиков или увеличение вычислительной мощности.
Будущие исследования в области воплощённого интеллекта должны сосредоточиться на наделении моделей:
способности принимать решения о последовательности активного исследования, а не простого распознавания изображений;
большей устойчивости, позволяющей сохранять логическое суждение даже при неполных наблюдениях за сценой;
встроенный метакогнитивный цикл, благодаря которому ИИ будет учиться исследовать ситуацию при отсутствии ответов, а не генерировать ложные галлюцинации.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её





Дом






