Дом
Лаборатории искусственного интеллекта платят XDOF за сбор неструктурированных данных для обучения роботов

Две недели назад компания OpenAI объявила о возобновлении программы по робототехнике, которую она закрыла в 2021 году — это очередной признак того, что крупные лаборатории в сфере ИИ соревнуются между собой, стремясь научить машины взаимодействовать с физическим миром. Однако для создания функциональных роботов требуется то, чего в индустрии ИИ пока не хватает: обучающие данные, сопоставимые с теми, что используются в языковых моделях.
Этот пробел стимулирует развитие нового вида инфраструктурного бизнеса. В отличие от больших языковых моделей (LLM), которые обучались на огромных объемах общедоступного текста, роботам нужны данные, отражающие физические взаимодействия — а таких данных практически не существует. Видео на YouTube и записи, сделанные фрилансерами, имеют низкое качество и их сложно соотнести с реальным миром.
Компания XDOF (произносится как «экс-доф»), сегодня вышедшая из режима секретности, считает, что следующим серьезным препятствием в развитии ИИ станут не модели или чипы, а цикл обратной связи с данными, необходимый для обучения роботов взаимодействию с физическим миром.
Стартап ставит перед собой цель создать конвейеры данных, инструменты сбора и системы аннотирования, которые передовые лаборатории и компании-робототехники не могут легко разработать самостоятельно — и для этого привлек 70 миллионов долларов от Thrive Capital, Spark Capital, a16z, Lux и WndrCo. Соучредитель и генеральный директор Филипп Ву (Philippe Wu) говорит, что XDOF, в которой работает около 60 человек, уже сотрудничает с 20 клиентами, включая несколько передовых лабораторий в области ИИ, хотя он не может назвать их.
«Все ведущие лаборатории пытаются заняться робототехникой, — сказал Ву. — Мы уже увидели некоторые минусы того, что немного отстали в гонке по созданию языковых моделей… Не хочется оказаться в ситуации, когда ты начинаешь осваивать эту технологию слишком поздно, а все остальные уже находятся в одной лодке, где физический ИИ становится следующей границей».
Ву столкнулся с этой проблемой на собственном опыте, будучи аспирантом в Калифорнийском университете в Беркли. Его работа была сосредоточена на том, чтобы дать роботам возможность осваивать навыки на основе крупномасштабных наборов данных. Но была одна проблема.
«У нас не было крупномасштабных наборов данных, с которыми можно было бы работать», — рассказал он TechCrunch. «Возникла проблема „курицы и яйца“: сначала нам нужно было фактически собрать данные, прежде чем мы могли бы даже задаться вопросом, как обучить базовую модель для робототехники».
Ву и его будущий соучредитель и технический директор XDOF Фред Шенту работали над проектом под названием GELLO — недорогой системой дистанционного управления, позволяющей оператору-человеку управлять роботизированной рукой для генерации обучающих данных. «В итоге эта работа стала очень влиятельной публикацией в области робототехники, поскольку у многих людей были схожие потребности и препятствия, и многие начали использовать устройства такого типа для сбора данных», — сказал Ву.
Увидев эту возможность, Ву, Шенту и третий соучредитель и главный операционный директор Немо Цзинь в октябре 2024 года запустили компанию XDOF, чтобы создать экосистему данных для компаний, занимающихся разработкой робототехнических моделей. Понимая, что предоставление одних только данных может оказаться тупиковым направлением бизнеса, компания также уделяет внимание очистке данных, разработке инструментов и аннотированию — создавая самоусиливающийся цикл обратной связи для разработчиков роботов.
В качестве отправной точки компания сотрудничает с лабораторией исследований в области искусственного интеллекта Калифорнийского университета в Беркли, чтобы выпустить, по её мнению, крупнейший сборник высококачественных данных для обучения роботов, когда-либо собранный, получивший название ABC. Он включает 130 000 траекторий данных о манипуляциях роботов, 300 часов симуляций и 100 часов оценок. Такого рода масштабные данные для предварительного обучения ранее никогда не были доступны научному сообществу.
«Мы видели в области обработки языка, генерации изображений и других областях, что когда модели и данные становятся общедоступными, сообщество достигает результатов, которых не всегда можно было ожидать», — рассказал TechCrunch Дэвид МакАллистер, аспирант из Беркли, который помогал организовать этот релиз.
Команда уже использовала эти данные для обучения роботов выполнению эталонных задач, таких как складывание футболок и расправление коробок, а также укладка AirPods в чехлы.
Неограниченные степени свободы
Компания планирует работать на трех уровнях «пирамиды данных». Наиболее ценным уровнем являются данные телеоперации, собираемые на реальном роботе, находящемся в эксплуатации; далее идут телеуправляемые роботы, собирающие более общие данные, как в случае с GELLO; и, наконец, «эгоцентрические» данные, собираемые людьми при выполнении повседневных задач, для чего XDOF планирует создать собственные носимые датчики.
«Ваш выбор камеры повлияет на качество данных, а это, в свою очередь, повлияет на эффективность работы алгоритма отслеживания движений рук», — сказал Ву. «Если с самого начала не правильно спроектировать аппаратное обеспечение, в собранных данных могут возникнуть очень специфические проблемы, которых вы не предвидели».
Компания планирует нанять и обучить по всему миру целые армии телеоператоров и операторов эгоцентрических данных — это трудоемкая модель, которая вызывает очевидный вопрос: почему крупные лаборатории не занимаются этой работой по сбору данных самостоятельно?
«Для этого потребуется склад площадью в сотни тысяч квадратных футов с сотнями роботов», — сказал Ву. «Необходимо обеспечивать техническое обслуживание этих роботов, калибровать их физические параметры и должным образом обучать операторов».
Это масштабное строительство, требующее сосредоточенности, капитала и операционных масштабов, которые большинство лабораторий ИИ предпочли бы передать на аутсорсинг — и именно на этот рынок делает ставку XDOF.
Название XDOF — это игра слов, основанная на термине из робототехники «степени свободы», который описывает количество независимых движений, которые может выполнять робот. Ваша рука, от плеча до запястья, имеет семь степеней свободы. Последний робот компании Figure.AI, занимающейся гуманоидной робототехникой, имеет 30 степеней свободы. Буква X в названии компании отражает её амбиции: «Произвольные степени свободы, неограниченные степени свободы», — говорит Ву.
Связанная статья
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Рекомендации по связанным специальным темам
Комментарии (0)

Две недели назад компания OpenAI объявила о возобновлении программы по робототехнике, которую она закрыла в 2021 году — это очередной признак того, что крупные лаборатории в сфере ИИ соревнуются между собой, стремясь научить машины взаимодействовать с физическим миром. Однако для создания функциональных роботов требуется то, чего в индустрии ИИ пока не хватает: обучающие данные, сопоставимые с теми, что используются в языковых моделях.
Этот пробел стимулирует развитие нового вида инфраструктурного бизнеса. В отличие от больших языковых моделей (LLM), которые обучались на огромных объемах общедоступного текста, роботам нужны данные, отражающие физические взаимодействия — а таких данных практически не существует. Видео на YouTube и записи, сделанные фрилансерами, имеют низкое качество и их сложно соотнести с реальным миром.
Компания XDOF (произносится как «экс-доф»), сегодня вышедшая из режима секретности, считает, что следующим серьезным препятствием в развитии ИИ станут не модели или чипы, а цикл обратной связи с данными, необходимый для обучения роботов взаимодействию с физическим миром.
Стартап ставит перед собой цель создать конвейеры данных, инструменты сбора и системы аннотирования, которые передовые лаборатории и компании-робототехники не могут легко разработать самостоятельно — и для этого привлек 70 миллионов долларов от Thrive Capital, Spark Capital, a16z, Lux и WndrCo. Соучредитель и генеральный директор Филипп Ву (Philippe Wu) говорит, что XDOF, в которой работает около 60 человек, уже сотрудничает с 20 клиентами, включая несколько передовых лабораторий в области ИИ, хотя он не может назвать их.
«Все ведущие лаборатории пытаются заняться робототехникой, — сказал Ву. — Мы уже увидели некоторые минусы того, что немного отстали в гонке по созданию языковых моделей… Не хочется оказаться в ситуации, когда ты начинаешь осваивать эту технологию слишком поздно, а все остальные уже находятся в одной лодке, где физический ИИ становится следующей границей».
Ву столкнулся с этой проблемой на собственном опыте, будучи аспирантом в Калифорнийском университете в Беркли. Его работа была сосредоточена на том, чтобы дать роботам возможность осваивать навыки на основе крупномасштабных наборов данных. Но была одна проблема.
«У нас не было крупномасштабных наборов данных, с которыми можно было бы работать», — рассказал он TechCrunch. «Возникла проблема „курицы и яйца“: сначала нам нужно было фактически собрать данные, прежде чем мы могли бы даже задаться вопросом, как обучить базовую модель для робототехники».
Ву и его будущий соучредитель и технический директор XDOF Фред Шенту работали над проектом под названием GELLO — недорогой системой дистанционного управления, позволяющей оператору-человеку управлять роботизированной рукой для генерации обучающих данных. «В итоге эта работа стала очень влиятельной публикацией в области робототехники, поскольку у многих людей были схожие потребности и препятствия, и многие начали использовать устройства такого типа для сбора данных», — сказал Ву.
Увидев эту возможность, Ву, Шенту и третий соучредитель и главный операционный директор Немо Цзинь в октябре 2024 года запустили компанию XDOF, чтобы создать экосистему данных для компаний, занимающихся разработкой робототехнических моделей. Понимая, что предоставление одних только данных может оказаться тупиковым направлением бизнеса, компания также уделяет внимание очистке данных, разработке инструментов и аннотированию — создавая самоусиливающийся цикл обратной связи для разработчиков роботов.
В качестве отправной точки компания сотрудничает с лабораторией исследований в области искусственного интеллекта Калифорнийского университета в Беркли, чтобы выпустить, по её мнению, крупнейший сборник высококачественных данных для обучения роботов, когда-либо собранный, получивший название ABC. Он включает 130 000 траекторий данных о манипуляциях роботов, 300 часов симуляций и 100 часов оценок. Такого рода масштабные данные для предварительного обучения ранее никогда не были доступны научному сообществу.
«Мы видели в области обработки языка, генерации изображений и других областях, что когда модели и данные становятся общедоступными, сообщество достигает результатов, которых не всегда можно было ожидать», — рассказал TechCrunch Дэвид МакАллистер, аспирант из Беркли, который помогал организовать этот релиз.
Команда уже использовала эти данные для обучения роботов выполнению эталонных задач, таких как складывание футболок и расправление коробок, а также укладка AirPods в чехлы.
Неограниченные степени свободы
Компания планирует работать на трех уровнях «пирамиды данных». Наиболее ценным уровнем являются данные телеоперации, собираемые на реальном роботе, находящемся в эксплуатации; далее идут телеуправляемые роботы, собирающие более общие данные, как в случае с GELLO; и, наконец, «эгоцентрические» данные, собираемые людьми при выполнении повседневных задач, для чего XDOF планирует создать собственные носимые датчики.
«Ваш выбор камеры повлияет на качество данных, а это, в свою очередь, повлияет на эффективность работы алгоритма отслеживания движений рук», — сказал Ву. «Если с самого начала не правильно спроектировать аппаратное обеспечение, в собранных данных могут возникнуть очень специфические проблемы, которых вы не предвидели».
Компания планирует нанять и обучить по всему миру целые армии телеоператоров и операторов эгоцентрических данных — это трудоемкая модель, которая вызывает очевидный вопрос: почему крупные лаборатории не занимаются этой работой по сбору данных самостоятельно?
«Для этого потребуется склад площадью в сотни тысяч квадратных футов с сотнями роботов», — сказал Ву. «Необходимо обеспечивать техническое обслуживание этих роботов, калибровать их физические параметры и должным образом обучать операторов».
Это масштабное строительство, требующее сосредоточенности, капитала и операционных масштабов, которые большинство лабораторий ИИ предпочли бы передать на аутсорсинг — и именно на этот рынок делает ставку XDOF.
Название XDOF — это игра слов, основанная на термине из робототехники «степени свободы», который описывает количество независимых движений, которые может выполнять робот. Ваша рука, от плеча до запястья, имеет семь степеней свободы. Последний робот компании Figure.AI, занимающейся гуманоидной робототехникой, имеет 30 степеней свободы. Буква X в названии компании отражает её амбиции: «Произвольные степени свободы, неограниченные степени свободы», — говорит Ву.
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны











