Дом
Tongyi Lab представила алгоритм FIPO: производительность модели на 32B превосходит o1-mini

Сегодня команда «Интеллектуальных вычислений» лаборатории Tongyi Lab представила новый алгоритм для дообучения крупных языковых моделей — FIPO (Future-KL Influenced Policy Optimization). Этот алгоритм внедряет инновационный механизм «Future-KL», который эффективно решает распространенную техническую проблему «стагнации длины вывода» при обучении с использованием чистого обучения с подкреплением (Pure RL).
При обучении рассуждениям на основе длинных текстов и сложному логическому согласованию традиционное обучение с подкреплением зачастую не способно точно определять ключевые точки принятия решений в длинных последовательностях. Алгоритм FIPO, разработанный командой Tongyi, применяет дифференцированное распределение вознаграждений к ключевым токенам, стимулируя модель к использованию более перспективного подхода при генерации цепочки мыслей (CoT).
Результаты экспериментов показывают, что в условиях чистого обучения с подкреплением с использованием модели масштаба 32B модель, использующая алгоритм FIPO, уже превзошла по производительности модели аналогичного размера, такие как DeepSeek-Zero-MATH и o1-mini от OpenAI, что свидетельствует о значительном прогрессе в способностях к логическому выводу и математическим вычислениям крупных моделей отечественного производства.
В настоящее время конкуренция между крупными моделями смещается с масштаба предварительного обучения на глубокую согласованность на этапе инференса. Выпуск FIPO не только предлагает новый способ оценки качества «процессов мышления» в моделях логического рассуждения, но и сигнализирует о том, что сообщество открытого исходного кода и ведущие отечественные лаборатории постепенно прокладывают независимый технологический путь в своем стремлении к созданию моделей рассуждения мирового уровня.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)

Сегодня команда «Интеллектуальных вычислений» лаборатории Tongyi Lab представила новый алгоритм для дообучения крупных языковых моделей — FIPO (Future-KL Influenced Policy Optimization). Этот алгоритм внедряет инновационный механизм «Future-KL», который эффективно решает распространенную техническую проблему «стагнации длины вывода» при обучении с использованием чистого обучения с подкреплением (Pure RL).
При обучении рассуждениям на основе длинных текстов и сложному логическому согласованию традиционное обучение с подкреплением зачастую не способно точно определять ключевые точки принятия решений в длинных последовательностях. Алгоритм FIPO, разработанный командой Tongyi, применяет дифференцированное распределение вознаграждений к ключевым токенам, стимулируя модель к использованию более перспективного подхода при генерации цепочки мыслей (CoT).
Результаты экспериментов показывают, что в условиях чистого обучения с подкреплением с использованием модели масштаба 32B модель, использующая алгоритм FIPO, уже превзошла по производительности модели аналогичного размера, такие как DeepSeek-Zero-MATH и o1-mini от OpenAI, что свидетельствует о значительном прогрессе в способностях к логическому выводу и математическим вычислениям крупных моделей отечественного производства.
В настоящее время конкуренция между крупными моделями смещается с масштаба предварительного обучения на глубокую согласованность на этапе инференса. Выпуск FIPO не только предлагает новый способ оценки качества «процессов мышления» в моделях логического рассуждения, но и сигнализирует о том, что сообщество открытого исходного кода и ведущие отечественные лаборатории постепенно прокладывают независимый технологический путь в своем стремлении к созданию моделей рассуждения мирового уровня.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











