вариант
Дом
Новости
Бывшие Deepseeker и Collaborators выпускают новый метод обучения надежных агентов искусственного интеллекта: Ragen

Бывшие Deepseeker и Collaborators выпускают новый метод обучения надежных агентов искусственного интеллекта: Ragen

4 мая 2025 г.
278

Бывшие Deepseeker и Collaborators выпускают новый метод обучения надежных агентов искусственного интеллекта: Ragen

Год агентов ИИ: Ближайший взгляд на ожидания и реальность 2025 года

2025 год многие эксперты объявили годом, когда агенты ИИ — специализированные системы ИИ, основанные на продвинутых больших языковых и мультимодальных моделях от компаний, таких как OpenAI, Anthropic, Google и DeepSeek, — наконец займут центральное место. Однако, согласно недавнему опросу VentureBeat на социальной сети X, большинство агентов ИИ всё ещё находятся на экспериментальных стадиях, застряв в своего рода корпоративном лимбе.

Но на горизонте появляется проблеск надежды. Совместные усилия исследователей из Северо-Западного университета, Microsoft, Стэнфорда и Вашингтонского университета, включая Зихана Вана, бывшего исследователя DeepSeek, ныне получающего докторскую степень в области компьютерных наук в Северо-Западном университете, представили RAGEN. Эта новая система направлена на обучение и оценку агентов ИИ, чтобы сделать их более надёжными и адаптируемыми для реального корпоративного использования.

RAGEN: Новый подход к обучению агентов ИИ

В отличие от статичных задач, таких как решение математических задач или генерация кода, RAGEN сосредотачивается на динамичных, многоходовых взаимодействиях, где агентам нужно адаптироваться, запоминать и рассуждать в условиях неопределённости. Система основана на специально разработанной структуре обучения с подкреплением (RL), названной StarPO (State-Thinking-Actions-Reward Policy Optimization), которая делает акцент на обучении через опыт, а не на механическом запоминании. StarPO рассматривает целые последовательности принятия решений, а не только одношаговые ответы.

StarPO работает в два этапа: этап развертывания, где LLM генерирует полные последовательности взаимодействий, руководствуясь рассуждениями, и этап обновления, где модель оптимизируется с использованием нормализованных кумулятивных наград. Этот подход обеспечивает более стабильный и интерпретируемый цикл обучения по сравнению с традиционными методами оптимизации политики.

Исследователи протестировали эту структуру, используя доработанные версии моделей Qwen от Alibaba, в частности Qwen 1.5 и Qwen 2.5, выбранные за их открытые веса и высокую способность следовать инструкциям. Этот выбор обеспечил воспроизводимость и согласованные базовые сравнения для символических задач.

Ловушка эха: Проблема в обучении с подкреплением

Зихан Ван в широко обсуждаемой ветке на X выделил критическую проблему в обучении RL: *Почему ваше обучение RL всегда рушится?* Команда обнаружила, что, хотя агенты LLM изначально дают хорошо продуманные ответы, системы RL часто вознаграждают упрощённые решения, что приводит к повторяющимся поведенческим шаблонам, ухудшающим производительность — явление, которое они назвали "ловушкой эха".

Эта регрессия подпитывается циклами обратной связи, где определённые фразы или стратегии получают высокие награды на ранних этапах, что побуждает к их чрезмерному использованию и подавляет исследование. Симптомы очевидны: резкое падение дисперсии наград, всплески градиентов и исчезновение следов рассуждений.

Тестовые среды RAGEN

Для изучения этих поведений в контролируемых условиях RAGEN оценивает агентов в трёх символических средах:

  • Bandit: Одноходовая стохастическая задача, тестирующая символическое рассуждение о риске и награде.
  • Sokoban: Многоходовая детерминированная головоломка, включающая необратимые решения.
  • Frozen Lake: Стохастическая многоходовая задача, требующая адаптивного планирования.

Каждая среда разработана так, чтобы минимизировать влияние реальных предпосылок и сосредоточиться исключительно на стратегиях принятия решений, разработанных во время обучения. Например, в среде Bandit агенты должны символически рассуждать о рычагах Дракона и Феникса, представляющих разные распределения наград, интерпретируя их как "силу" и "надежду" для прогнозирования исходов.

Стабилизация обучения с подкреплением с помощью StarPO-S

Для борьбы с коллапсом обучения исследователи представили StarPO-S, стабилизированную версию исходной структуры. StarPO-S включает три ключевых вмешательства:

  1. Фильтрация развертываний на основе неопределённости: Приоритет отдаётся развертываниям, где агент демонстрирует неопределённость исхода.
  2. Удаление штрафа KL: Позволяет модели свободнее отклоняться от исходной политики и исследовать новые поведения.
  3. Асимметричное обрезание PPO: Усиление высоконаградных траекторий больше, чем низконаградных, для ускорения обучения.

Эти изменения помогают задержать или устранить коллапс обучения и улучшить производительность во всех трёх задачах. Как сказал Ван, "StarPO-S… работает во всех 3 задачах. Устраняет коллапс. Лучшая награда".

Что делает хорошую агентную модель ИИ?

Успех обучения RL зависит не только от архитектуры, но и от качества данных, генерируемых агентами. Команда выделила три ключевых аспекта, существенно влияющих на обучение:

  • Разнообразие задач: Воздействие на модель широкого спектра начальных сценариев улучшает обобщение.
  • Гранулярность взаимодействия: Разрешение нескольких действий за ход позволяет проводить более осмысленное планирование.
  • Свежесть развертываний: Поддержание актуальности обучающих данных с текущей политикой модели предотвращает устаревание сигналов обучения.

Эти факторы способствуют более стабильному и эффективному процессу обучения. Интерактивный демонстрационный сайт на GitHub визуализирует развертывания агентов как полные диалоговые ходы, включая не только действия, но и пошаговый мыслительный процесс, предшествующий им. Например, при решении математической задачи агент может сначала "подумать" о выделении переменной, прежде чем дать ответ, такой как "x = 5". Эти промежуточные мысли видны и отслеживаемы, что добавляет прозрачности в процесс принятия решений агентами.

Когда рассуждения иссякают

Хотя явные рассуждения улучшают производительность в простых одноходовых задачах, таких как Bandit, они имеют тенденцию к ухудшению во время многоходового обучения. Несмотря на использование структурированных подсказок и токенов, следы рассуждений часто сокращаются или исчезают, если их не вознаграждать напрямую. Это подчёркивает ограничение в типичном дизайне наград: фокус на завершении задачи может игнорировать качество процесса, лежащего в основе. Команда экспериментировала с штрафами на основе формата для поощрения лучше структурированных рассуждений, но признаёт, что, вероятно, требуется более тонкое формирование наград.

Открытые инструменты и будущие направления

RAGEN, вместе со своими структурами StarPO и StarPO-S, теперь доступен как проект с открытым исходным кодом по адресу https://github.com/RAGEN-AI/RAGEN. Однако на момент написания в репозитории GitHub не указана явная лицензия, что может ограничить его использование или распространение другими.

Система предоставляет ценную основу для тех, кто заинтересован в разработке агентов ИИ, которые не только выполняют задачи, но и думают, планируют и развиваются. По мере того как ИИ движется к большей автономности, проекты, такие как RAGEN, помогают осветить, что требуется для обучения моделей, которые учатся на последствиях своих действий.

Нерешённые вопросы для внедрения в корпоративные среды

Хотя статья о RAGEN предлагает подробную техническую дорожную карту, остаётся несколько практических вопросов для тех, кто хочет применить эти методы в корпоративных условиях. Например, насколько переносим подход RAGEN за пределы стилизованных символических задач? Потребуется ли бизнесам разрабатывать совершенно новые среды и функции наград для использования этой системы в рабочих процессах, таких как обработка счетов или поддержка клиентов?

Ван в прямом сообщении VentureBeat на X предположил, что улучшение разнообразия задач может помочь, поскольку текущие игровые задачи имеют только схожие сеточные представления, но лишены семантической информации. Он также выразил оптимизм относительно того, что бизнесы смогут разрабатывать собственные обучающие упражнения для агентов ИИ с использованием RAGEN, отметив, что ссылка на GitHub предоставляет простое введение в добавление новых сред.

Ещё одна важная область — масштабируемость. Даже с улучшениями, предоставляемыми StarPO-S, в статье признаётся, что обучение всё же со временем рушится на длинных горизонтах. Это вызывает вопрос: существует ли теоретический или практический путь к поддержанию рассуждений в открытых или непрерывно развивающихся последовательностях задач?

На момент написания в репозитории или документации RAGEN не указана явная лицензия, что оставляет открытыми вопросы о правах использования. Тем не менее, RAGEN выделяется не только как технический вклад, но и как концептуальный шаг к более автономным агентам ИИ, способным к рассуждениям. Станет ли он частью корпоративного стека ИИ, ещё предстоит увидеть, но его понимание динамики обучения агентов уже помогает переопределить границы обучения LLM.

Связанная статья
Base44 представляет собственную модель искусственного интеллекта для усиления защищенности платформы для кодинга в стиле «vibe». Base44 представляет собственную модель искусственного интеллекта для усиления защищенности платформы для кодинга в стиле «vibe». Base44, платформа для «вайб-кодинга», приобретённая Wix за 80 миллионов долларов всего год назад — когда ей было всего шесть месяцев и в команде состояло восемь человек, — начала развертывание собственной модели искусственного интеллекта, чтобы помоч
Стартап PixVerse, занимающийся созданием видеоконтента, привлек 439 млн долларов, его оценка превысила 2 млрд долларов Стартап PixVerse, занимающийся созданием видеоконтента, привлек 439 млн долларов, его оценка превысила 2 млрд долларов PixVerse, сингапурский стартап, занимающийся генерацией видеоконтента, объявил сегодня о завершении расширенного раунда финансирования серии C, в ходе которого было привлечено в общей сложности 439 ми
Правила Китая в отношении искусственного интеллекта: настоящая цель Пекина Правила Китая в отношении искусственного интеллекта: настоящая цель Пекина Концепция ИИ-компаньона может показаться дистопической, однако она стала одной из постоянных тем в более широких дискуссиях о рисках генеративного ИИ. По сути, речь идет о диалоговом агенте, предназна
Рекомендации по связанным специальным темам
письмо Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO
Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO

2026 год: лучшие и самые высокооцененные генераторы конспектов на базе ИИ для длинных SEO-статей, тщательно отобранные XIX.AI. Эти мощные инструменты обеспечивают революционную помощь в быстром создании высококачественного контента, значительно повышая эффективность написания текстов. Ознакомьтесь со сравнением бесплатных и платных версий, а также с результатами реальных тестов и подробными рейтингами, которые помогут вам найти вариант, который обязательно стоит попробовать и который соответствует вашим потребностям. Изучите их прямо сейчас, чтобы раскрыть весь потенциал ИИ.

8 инструментов
xix.ai
Образование и обучение Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам
Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам

2026: лучшие современные инструменты на базе ИИ для выполнения домашних заданий и подготовки к экзаменам! XIX.AI подготовило рейтинг самых эффективных и революционных инструментов, которые помогают учащимся повысить продуктивность, оптимизировать выполнение домашних заданий и сдавать экзамены на «отлично», проходя проверку в реальных условиях. Получите сравнение бесплатных и платных версий, подробные рейтинги и варианты, которые обязательно стоит попробовать, чтобы раскрыть свой потенциал с помощью ИИ. Узнайте больше прямо сейчас!

10 инструментов
xix.ai
Музыкальная композиция Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий
Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий

2026 г. лучшие инструменты для демо-записи вокала на базе ИИ для авторов песен, создателей хуков и команд, работающих с контентом на нескольких языках! XIX.AI подготовил список высокооцененных мощных инструментов, изменивших правила игры, прошедших строгие реальные тесты. Вы найдёте подробные данные сравнения бесплатных и платных версий, комплексные рейтинги и обязательные к использованию варианты, которые помогут повысить эффективность написания и раскрыть ваш творческий потенциал. Исследуйте сейчас, чтобы найти идеальный инструмент для всех ваших задач по созданию контента!

9 инструментов
xix.ai
Бизнес Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса
Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса

2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!

9 инструментов
xix.ai
Редактирование изображений Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия
Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия

2026 Latest Best Photoshop AI retouch tools for ecommerce apparel, skin cleanup, and color consistency! This top-rated curated list features powerful game-changing solutions that help you boost writing efficiency, streamline content creation, and achieve perfect visual results effortlessly. Each tool has undergone real-world tests through weekly updated rankings, complete with free vs paid comparison details. Backed by XIX.AI, it’s the must-try guide for anyone aiming to unlock your AI edge. Explore now!

10 инструментов
xix.ai
Быстрый Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT
Лучшие библиотеки подсказок для ИИ в рабочих процессах ChatGPT

2026: новейшие и лучшие библиотеки подсказок для ИИ с высоким рейтингом, предназначенные для оптимизации всех типов рабочих процессов ChatGPT. XIX.AI подготовила мощную, революционную подборку, прошедшую тщательные тесты в реальных условиях для обеспечения максимальной производительности. Вы найдёте подробные сравнения бесплатных и платных вариантов, а также рейтинги экспертов, которые помогут вам выбрать инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и раскрыть весь потенциал ИИ. Откройте для себя их прямо сейчас!

11 инструментов
xix.ai
Комментарии (11)
0/500
EricJohnson
EricJohnson 30 августа 2026 г., 15:00:30 GMT+03:00

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 8 апреля 2026 г., 21:00:57 GMT+03:00

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 4 апреля 2026 г., 19:00:41 GMT+03:00

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 12 октября 2025 г., 5:30:38 GMT+03:00

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 13 августа 2025 г., 14:00:59 GMT+03:00

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 23 июля 2025 г., 7:59:29 GMT+03:00

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR