Дом
Первая в мире глобальная модель воплощенного интеллекта на уровне событий положит конец покадровому обучению роботов
29 мая команда Variable Robot представила WALL-WM — первую в мире модель окружающего мира с встроенным интеллектом, основанную на «прогнозировании на уровне событий». Эта модель отходит от традиционных крупных моделей с воплощенным интеллектом, которые обучаются действиям кадр за кадром с течением времени, и вместо этого переключает блок прогнозирования модели мира на семантические события. Это знаменует собой новый этап в том, как роботы понимают и выполняют задачи.

В современной индустрии воплощенного интеллекта основные модели «зрение-язык-действие» (VLA) обычно используют текущее изображение и инструкцию для прогнозирования блока действий фиксированной длины. Такой подход к обучению кадр за кадром часто приводит к тому, что роботы сосредотачиваются на незначительных физических движениях, теряя из виду конечную цель действия. Столкнувшись с такими сценариями, как смена чашек или столов, роботы часто терпят неудачу из-за отсутствия обобщения. Чтобы решить эту проблему отрасли, команда Variable указала в своей научной статье, что информация о тексте, зрении и действиях естественным образом существует в реальном мире в разных временных масштабах и многомерных геометриях. Принудительное объединение их в единое общее пространство может легко повредить предварительно обученную геометрическую априорную модель.
Чтобы решить эту проблему, модель мира WALL-WM вводит инновационный механизм обучения и выполнения, ориентированный на события. Она разбивает сложные задачи на семантически понятные событийные узлы, такие как достижение, захват и перемещение. В процессе работы модель больше не вычисляет следующий кадр изображения жестким образом. Вместо этого она сначала моделирует, как изменится мир в результате следующего события, а затем точно преобразует это визуальное изменение в траекторию движения роботизированной руки.

Чтобы обеспечить надежное внедрение этой новой архитектуры в физическом мире, команда Variable Robot провела серию серьезных инженерных доработок. Система поддерживает гибкое переключение между «режимом событий» (с выходом действий переменной длины) и «унифицированным режимом» (с управлением в реальном времени по замкнутому циклу) на основе одних и тех же базовых весов. Она также обеспечивает одностороннюю связь между видеомоделями и моделями действий, предотвращая преждевременное смещение ценных динамических априорных значений из интернет-видео данными о действиях. Для геометрического восприятия с помощью нескольких камер в модели введены маски в виде пирамидального среза и трубчатые маски, что заставляет ИИ развивать истинное трехмерное геометрическое соответствие между различными ракурсами. Для решения проблемы задержки принятия решений используется новая техника «ступенчатого декодирования цепочки мыслей», которая значительно сокращает задержку декодирования, сохраняя при этом логическую интерпретируемость.

Связанная статья
Южная Корея начала строительство национального центра вычислений на базе искусственного интеллекта, инвестируя 2,5 триллиона вон с целевым сроком завершения к 2028 году
Южнокорейское издание EtNews сообщает, что 3 августа в парке дата-центров Solar City в Сунане (провинция Чолла-Намдо) состоялась церемония закладки первого камня в основание Центра вычислений ИИ Кореи (KOACC). При общем объеме инвестиций в 2,5 трлн в
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Рекомендации по связанным специальным темам
Комментарии (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
29 мая команда Variable Robot представила WALL-WM — первую в мире модель окружающего мира с встроенным интеллектом, основанную на «прогнозировании на уровне событий». Эта модель отходит от традиционных крупных моделей с воплощенным интеллектом, которые обучаются действиям кадр за кадром с течением времени, и вместо этого переключает блок прогнозирования модели мира на семантические события. Это знаменует собой новый этап в том, как роботы понимают и выполняют задачи.

В современной индустрии воплощенного интеллекта основные модели «зрение-язык-действие» (VLA) обычно используют текущее изображение и инструкцию для прогнозирования блока действий фиксированной длины. Такой подход к обучению кадр за кадром часто приводит к тому, что роботы сосредотачиваются на незначительных физических движениях, теряя из виду конечную цель действия. Столкнувшись с такими сценариями, как смена чашек или столов, роботы часто терпят неудачу из-за отсутствия обобщения. Чтобы решить эту проблему отрасли, команда Variable указала в своей научной статье, что информация о тексте, зрении и действиях естественным образом существует в реальном мире в разных временных масштабах и многомерных геометриях. Принудительное объединение их в единое общее пространство может легко повредить предварительно обученную геометрическую априорную модель.
Чтобы решить эту проблему, модель мира WALL-WM вводит инновационный механизм обучения и выполнения, ориентированный на события. Она разбивает сложные задачи на семантически понятные событийные узлы, такие как достижение, захват и перемещение. В процессе работы модель больше не вычисляет следующий кадр изображения жестким образом. Вместо этого она сначала моделирует, как изменится мир в результате следующего события, а затем точно преобразует это визуальное изменение в траекторию движения роботизированной руки.

Чтобы обеспечить надежное внедрение этой новой архитектуры в физическом мире, команда Variable Robot провела серию серьезных инженерных доработок. Система поддерживает гибкое переключение между «режимом событий» (с выходом действий переменной длины) и «унифицированным режимом» (с управлением в реальном времени по замкнутому циклу) на основе одних и тех же базовых весов. Она также обеспечивает одностороннюю связь между видеомоделями и моделями действий, предотвращая преждевременное смещение ценных динамических априорных значений из интернет-видео данными о действиях. Для геометрического восприятия с помощью нескольких камер в модели введены маски в виде пирамидального среза и трубчатые маски, что заставляет ИИ развивать истинное трехмерное геометрическое соответствие между различными ракурсами. Для решения проблемы задержки принятия решений используется новая техника «ступенчатого декодирования цепочки мыслей», которая значительно сокращает задержку декодирования, сохраняя при этом логическую интерпретируемость.

Южная Корея начала строительство национального центра вычислений на базе искусственного интеллекта, инвестируя 2,5 триллиона вон с целевым сроком завершения к 2028 году
Южнокорейское издание EtNews сообщает, что 3 августа в парке дата-центров Solar City в Сунане (провинция Чолла-Намдо) состоялась церемония закладки первого камня в основание Центра вычислений ИИ Кореи (KOACC). При общем объеме инвестиций в 2,5 трлн в
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











