Дом
AReaL 2.0 с открытым исходным кодом: инфраструктура глубокого обучения для саморазвивающихся агентов на основе практического применения
2 июля проект AReaL — инфраструктура с открытым исходным кодом для обучения с подкреплением — официально выпустил версию 2.0. AReaL призван преодолеть разрыв между обучением базовых моделей и современными приложениями с использованием агентов, обеспечивая эффективную поддержку обучения с подкреплением для сценариев с участием агентов.
Недавно запущенная версия AReaL 2.0 ориентирована на агентов, работающих в реальных бизнес-средах, и предоставляет системную инфраструктуру, которая обеспечивает непрерывное обучение во время эксплуатации агентов. С помощью AReaL 2.0 процессы взаимодействия, генерируемые агентами при выполнении реальных задач, можно записывать, систематизировать и интегрировать в последующие циклы обучения. Эти процессы используются для непрерывного совершенствования базовых моделей, что позволяет агентам становиться более эффективными, оставаясь при этом безопасными и управляемыми.
В настоящее время агенты внедряются в реальные производственные среды — они пишут код, ищут информацию и запускают инструменты для выполнения все более сложных задач в рамках корпоративных систем. Однако возникла проблема: агенты работают каждый день, но редко извлекают уроки из своего опыта.
В реальных бизнес-сценариях агенты накапливают огромный объем ценного опыта: какие задачи были выполнены успешно, где произошли сбои при вызове инструментов, почему пользователи остались недовольны и было ли то или иное решение ошибочным. Однако эта информация в основном хранится в журналах, что затрудняет её стабильное и безопасное преобразование в следующий этап совершенствования возможностей.
AReaL 2.0 призван решить проблему дальнейшего развития агентов после их развертывания. Разработчикам не нужно заново разрабатывать агентов; им достаточно перенаправить запросы, которые агенты обычно отправляют в крупные модели, через унифицированный конечный пункт вывода AReaL 2.0 для интеграции в процесс онлайн-обучения с подкреплением.

Рисунок: Схема архитектуры онлайн-обучения с подкреплением (Online RL) AReaL 2.0
Возьмём в качестве примера агент Hermes. Hermes продолжает получать задачи, планировать шаги и вызывать модели, как обычно. AReaL 2.0 фиксирует ключевые процессы взаимодействия, когда Hermes выполняет задачи в фоновом режиме, и использует эти реальные траектории в сочетании с сигналами обратной связи или вознаграждения после завершения задачи для последующего обучения. Разработчики также могут заменить Hermes собственным агентом и средой задач, используя тот же подход для построения процесса онлайн-обучения с подкреплением для агентов.
Это означает, что повышение способностей агента больше не зависит исключительно от данных, сформированных вручную, офлайн-обучения и повторного развертывания. Многоходовые диалоги, вызовы инструментов, результаты выполнения и сигналы обратной связи от реальных задач — всё это может стать материалом для обучения моделей.
Этот момент особенно важен в корпоративных сценариях. Агенты в корпоративных рабочих процессах сталкиваются с реальными, сложными и постоянно меняющимися задачами: репозитории кода могут обновляться, бизнес-процессы могут изменяться, потребности пользователей могут меняться, а инструменты и системы также могут претерпевать изменения. Если возможности агента фиксируются после развертывания, ему будет сложно адаптироваться к реальной среде с течением времени. AReaL 2.0 призвана восполнить недостающее звено между «умением использовать инструменты» и «умением учиться на основе использования».
В то же время непрерывное обучение в реальных бизнес-сценариях не может сводиться просто к «сбору данных и переобучению». Агенты могут получать доступ к коду, информации о клиентах, корпоративным базам знаний и внутренним системам, поэтому конвейер обучения должен учитывать такие требования, как контроль доступа, анонимизация данных, изоляция и аудит. В архитектуре AReaL 2.0 реализован механизм прокси-обработки данных для трассировок агентов, что позволяет управлять реальными данными задач и использовать их более безопасным и контролируемым образом при их включении в процесс обучения.
Команда AReaL в своём техническом отчёте указала, что ключевым препятствием для саморазвивающихся агентов является не столько мощность модели или передовой характер алгоритма обучения с подкреплением, сколько отсутствие инфраструктуры онлайн-обучения с подкреплением, обслуживающей реальных агентов. AReaL 2.0 представляет собой архитектурное обновление, ориентированное на следующее поколение приложений с агентами: объединение сервисов агентов, реальных трассировок задач, управления данными и онлайн-обучения с подкреплением, что дает агентам практическую инженерную основу для продолжения обучения после развертывания.
В долгосрочной перспективе AReaL 2.0 указывает на парадигму эволюции приложений агентов следующего поколения: агенты больше не являются инструментами, которые проходят однократное обучение и развертываются, а постоянно получают обратную связь в реальных средах, преобразуя как успехи, так и неудачи в опыт и непрерывно совершенствуя свои возможности в безопасных пределах.
Проект AReaL был инициирован в 2024 году командами, в число которых вошли Ant Group, Университет Цинхуа и Гонконгский университет науки и технологий. В мае 2026 года AReaL официально вышел из инкубационной программы Ant InclusionAI и стал независимым сообществом с открытым исходным кодом, присоединившись к проекту PyTorch Foundation Ecosystem и ещё больше интегрировавшись в основную экосистему инфраструктуры обучения с подкреплением.
По мере самостоятельного развития сообщества AReaL продолжает получать поддержку и участие со стороны партнеров из отрасли и экосистемы открытого исходного кода, включая команду Huawei Cloud и MindLab. В будущем AReaL будет продолжать совершенствоваться в таких областях, как онлайн-обучение с подкреплением, автоматизированная оценка и обучение мультимодальных агентов, сотрудничая с сообществом для продвижения развития экосистем саморазвивающихся агентов.
В настоящее время технический отчёт и исходный код AReaL 2.0 были опубликованы в открытом доступе.
· Репозиторий GitHub: https://github.com/areal-project/AReaL
· Технический отчет: https://arxiv.org/abs/2607.01120
Связанная статья
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Рекомендации по связанным специальным темам
Комментарии (0)
2 июля проект AReaL — инфраструктура с открытым исходным кодом для обучения с подкреплением — официально выпустил версию 2.0. AReaL призван преодолеть разрыв между обучением базовых моделей и современными приложениями с использованием агентов, обеспечивая эффективную поддержку обучения с подкреплением для сценариев с участием агентов.
Недавно запущенная версия AReaL 2.0 ориентирована на агентов, работающих в реальных бизнес-средах, и предоставляет системную инфраструктуру, которая обеспечивает непрерывное обучение во время эксплуатации агентов. С помощью AReaL 2.0 процессы взаимодействия, генерируемые агентами при выполнении реальных задач, можно записывать, систематизировать и интегрировать в последующие циклы обучения. Эти процессы используются для непрерывного совершенствования базовых моделей, что позволяет агентам становиться более эффективными, оставаясь при этом безопасными и управляемыми.
В настоящее время агенты внедряются в реальные производственные среды — они пишут код, ищут информацию и запускают инструменты для выполнения все более сложных задач в рамках корпоративных систем. Однако возникла проблема: агенты работают каждый день, но редко извлекают уроки из своего опыта.
В реальных бизнес-сценариях агенты накапливают огромный объем ценного опыта: какие задачи были выполнены успешно, где произошли сбои при вызове инструментов, почему пользователи остались недовольны и было ли то или иное решение ошибочным. Однако эта информация в основном хранится в журналах, что затрудняет её стабильное и безопасное преобразование в следующий этап совершенствования возможностей.
AReaL 2.0 призван решить проблему дальнейшего развития агентов после их развертывания. Разработчикам не нужно заново разрабатывать агентов; им достаточно перенаправить запросы, которые агенты обычно отправляют в крупные модели, через унифицированный конечный пункт вывода AReaL 2.0 для интеграции в процесс онлайн-обучения с подкреплением.

Рисунок: Схема архитектуры онлайн-обучения с подкреплением (Online RL) AReaL 2.0
Возьмём в качестве примера агент Hermes. Hermes продолжает получать задачи, планировать шаги и вызывать модели, как обычно. AReaL 2.0 фиксирует ключевые процессы взаимодействия, когда Hermes выполняет задачи в фоновом режиме, и использует эти реальные траектории в сочетании с сигналами обратной связи или вознаграждения после завершения задачи для последующего обучения. Разработчики также могут заменить Hermes собственным агентом и средой задач, используя тот же подход для построения процесса онлайн-обучения с подкреплением для агентов.
Это означает, что повышение способностей агента больше не зависит исключительно от данных, сформированных вручную, офлайн-обучения и повторного развертывания. Многоходовые диалоги, вызовы инструментов, результаты выполнения и сигналы обратной связи от реальных задач — всё это может стать материалом для обучения моделей.
Этот момент особенно важен в корпоративных сценариях. Агенты в корпоративных рабочих процессах сталкиваются с реальными, сложными и постоянно меняющимися задачами: репозитории кода могут обновляться, бизнес-процессы могут изменяться, потребности пользователей могут меняться, а инструменты и системы также могут претерпевать изменения. Если возможности агента фиксируются после развертывания, ему будет сложно адаптироваться к реальной среде с течением времени. AReaL 2.0 призвана восполнить недостающее звено между «умением использовать инструменты» и «умением учиться на основе использования».
В то же время непрерывное обучение в реальных бизнес-сценариях не может сводиться просто к «сбору данных и переобучению». Агенты могут получать доступ к коду, информации о клиентах, корпоративным базам знаний и внутренним системам, поэтому конвейер обучения должен учитывать такие требования, как контроль доступа, анонимизация данных, изоляция и аудит. В архитектуре AReaL 2.0 реализован механизм прокси-обработки данных для трассировок агентов, что позволяет управлять реальными данными задач и использовать их более безопасным и контролируемым образом при их включении в процесс обучения.
Команда AReaL в своём техническом отчёте указала, что ключевым препятствием для саморазвивающихся агентов является не столько мощность модели или передовой характер алгоритма обучения с подкреплением, сколько отсутствие инфраструктуры онлайн-обучения с подкреплением, обслуживающей реальных агентов. AReaL 2.0 представляет собой архитектурное обновление, ориентированное на следующее поколение приложений с агентами: объединение сервисов агентов, реальных трассировок задач, управления данными и онлайн-обучения с подкреплением, что дает агентам практическую инженерную основу для продолжения обучения после развертывания.
В долгосрочной перспективе AReaL 2.0 указывает на парадигму эволюции приложений агентов следующего поколения: агенты больше не являются инструментами, которые проходят однократное обучение и развертываются, а постоянно получают обратную связь в реальных средах, преобразуя как успехи, так и неудачи в опыт и непрерывно совершенствуя свои возможности в безопасных пределах.
Проект AReaL был инициирован в 2024 году командами, в число которых вошли Ant Group, Университет Цинхуа и Гонконгский университет науки и технологий. В мае 2026 года AReaL официально вышел из инкубационной программы Ant InclusionAI и стал независимым сообществом с открытым исходным кодом, присоединившись к проекту PyTorch Foundation Ecosystem и ещё больше интегрировавшись в основную экосистему инфраструктуры обучения с подкреплением.
По мере самостоятельного развития сообщества AReaL продолжает получать поддержку и участие со стороны партнеров из отрасли и экосистемы открытого исходного кода, включая команду Huawei Cloud и MindLab. В будущем AReaL будет продолжать совершенствоваться в таких областях, как онлайн-обучение с подкреплением, автоматизированная оценка и обучение мультимодальных агентов, сотрудничая с сообществом для продвижения развития экосистем саморазвивающихся агентов.
В настоящее время технический отчёт и исходный код AReaL 2.0 были опубликованы в открытом доступе.
· Репозиторий GitHub: https://github.com/areal-project/AReaL
· Технический отчет: https://arxiv.org/abs/2607.01120
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











