Дом
Bailing Team вступила в партнерство с AReno для создания цикла обучения методом усиления с использованием локального ИИ-агента
Возможность локального развертывания не гарантирует беспроблемной обработки реальных бизнес-сценариев. В сложных рабочих процессах ИИ должен не только вести диалог, но и интерпретировать сложные правила, соблюдать ограничения безопасности и точно запускать внешние инструменты для генерации результатов, соответствующих требованиям. Для решения этой задачи команда Ant ASystem и сообщество разработчиков открытого ПО создали AReno — набор инструментов для локальной постобучения крупных моделей. Недавно AReno был интегрирован с крупной моделью BaiLing для создания облегченного рабочего процесса постобучения, что позволило успешно реализовать цикл агентного обучения с подкреплением (RL) в конфигурации с одним компьютером.
Для обеспечения технической воспроизводимости в качестве задачи валидации была выбрана игра «крестики-нолики» из-за её чётких правил и мгновенной обратной связи. Эксперимент проводился на аппаратной платформе DGX Spark, где осуществлялось дообучение модели Ling-3.0-tiny (всего 7,9 млрд параметров, из них 1,3 млрд активных). Изначально модель понимала основные правила, но совершала недопустимые ходы. Благодаря преобразованию правил задачи в точный механизм обратной связи по вознаграждению и обучению в течение 400 шагов с использованием алгоритма GSPO среднее вознаграждение модели резко возросло, а длина вывода стабилизировалась. Последующие тесты подтвердили качественный скачок в стабильности и рациональности модели в отношении вызова инструментов и выбора действий.

Данное исследование подтверждает эффективность прозрачной и воспроизводимой методологии адаптации к задачам: выявление ошибок, определение проверяемой обратной связи, а также проведение локального обучения и повторного тестирования в той же среде. Эта методология выходит за рамки шахматных экспериментов и беспрепятственно применяется к реальным производственным сценариям, таким как устранение ошибок при вызове инструментов, извлечение структурированных полей, выполнение инструкций в конкретных областях знаний и использование интеллектуальных агентов в бизнес-процессах.
Ling-3.0-tiny доступна в нескольких версиях с открытым исходным кодом, включая BF16, FP8 и INT4. Разработчики могут получить доступ к этим моделям через Hugging Face или сообщество Moka. Кроме того, для внесения вклада в код и технических обсуждений доступен репозиторий с открытым исходным кодом AReno.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (2)
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
Возможность локального развертывания не гарантирует беспроблемной обработки реальных бизнес-сценариев. В сложных рабочих процессах ИИ должен не только вести диалог, но и интерпретировать сложные правила, соблюдать ограничения безопасности и точно запускать внешние инструменты для генерации результатов, соответствующих требованиям. Для решения этой задачи команда Ant ASystem и сообщество разработчиков открытого ПО создали AReno — набор инструментов для локальной постобучения крупных моделей. Недавно AReno был интегрирован с крупной моделью BaiLing для создания облегченного рабочего процесса постобучения, что позволило успешно реализовать цикл агентного обучения с подкреплением (RL) в конфигурации с одним компьютером.
Для обеспечения технической воспроизводимости в качестве задачи валидации была выбрана игра «крестики-нолики» из-за её чётких правил и мгновенной обратной связи. Эксперимент проводился на аппаратной платформе DGX Spark, где осуществлялось дообучение модели Ling-3.0-tiny (всего 7,9 млрд параметров, из них 1,3 млрд активных). Изначально модель понимала основные правила, но совершала недопустимые ходы. Благодаря преобразованию правил задачи в точный механизм обратной связи по вознаграждению и обучению в течение 400 шагов с использованием алгоритма GSPO среднее вознаграждение модели резко возросло, а длина вывода стабилизировалась. Последующие тесты подтвердили качественный скачок в стабильности и рациональности модели в отношении вызова инструментов и выбора действий.

Данное исследование подтверждает эффективность прозрачной и воспроизводимой методологии адаптации к задачам: выявление ошибок, определение проверяемой обратной связи, а также проведение локального обучения и повторного тестирования в той же среде. Эта методология выходит за рамки шахматных экспериментов и беспрепятственно применяется к реальным производственным сценариям, таким как устранение ошибок при вызове инструментов, извлечение структурированных полей, выполнение инструкций в конкретных областях знаний и использование интеллектуальных агентов в бизнес-процессах.
Ling-3.0-tiny доступна в нескольких версиях с открытым исходным кодом, включая BF16, FP8 и INT4. Разработчики могут получить доступ к этим моделям через Hugging Face или сообщество Moka. Кроме того, для внесения вклада в код и технических обсуждений доступен репозиторий с открытым исходным кодом AReno.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。











