Tongyi Lab, FIPO 알고리즘 공개… 32B 모델 추론 성능, o1-mini를 능가

통이 랩(Tongyi Lab)의 지능형 컴퓨팅 팀은 오늘 대규모 언어 모델을 위한 새로운 사후 학습 알고리즘인 FIPO(Future-KL Influenced Policy Optimization)를 공개했다. 이 알고리즘은 순수 강화 학습(Pure RL) 훈련에서 흔히 발생하는 기술적 과제인 ‘추론 길이 정체’를 효과적으로 해결하는 새로운 ‘Future-KL’ 메커니즘을 도입합니다.
장문 추론 및 복잡한 논리적 정렬을 위한 훈련 과정에서, 기존의 강화 학습은 긴 시퀀스 내의 핵심 결정 지점을 정확하게 식별하지 못하는 경우가 많습니다. 통이 팀이 개발한 FIPO 알고리즘은 핵심 토큰에 차별화된 보상 할당을 적용함으로써, 모델이 사고 연쇄(CoT) 생성 과정에서 보다 미래 지향적인 접근 방식을 채택하도록 유도합니다.
실험 결과에 따르면, 32B 규모 모델을 사용한 순수 강화 학습 환경에서 FIPO 알고리즘을 적용한 모델은 DeepSeek-Zero-MATH 및 OpenAI의 o1-mini와 같은 유사 규모의 모델들을 이미 능가했으며, 이는 국내 대형 모델의 논리적 추론 및 수학적 계산 능력에서 상당한 진전을 보여줍니다.
현재 대형 모델 간의 경쟁은 사전 학습 규모에서 추론 시점의 심층 정합성으로 초점을 옮기고 있다. FIPO의 출시는 논리적 추론 모델의 ‘사고 과정’ 품질을 평가하는 새로운 방법을 제시할 뿐만 아니라, 오픈소스 커뮤니티와 국내 주요 연구소들이 세계적 수준의 추론 모델을 추구하며 점차 독자적인 기술적 길을 개척하고 있음을 시사한다.
관련 기사
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
관련 특별 주제 추천
의견 (0)
0/500

통이 랩(Tongyi Lab)의 지능형 컴퓨팅 팀은 오늘 대규모 언어 모델을 위한 새로운 사후 학습 알고리즘인 FIPO(Future-KL Influenced Policy Optimization)를 공개했다. 이 알고리즘은 순수 강화 학습(Pure RL) 훈련에서 흔히 발생하는 기술적 과제인 ‘추론 길이 정체’를 효과적으로 해결하는 새로운 ‘Future-KL’ 메커니즘을 도입합니다.
장문 추론 및 복잡한 논리적 정렬을 위한 훈련 과정에서, 기존의 강화 학습은 긴 시퀀스 내의 핵심 결정 지점을 정확하게 식별하지 못하는 경우가 많습니다. 통이 팀이 개발한 FIPO 알고리즘은 핵심 토큰에 차별화된 보상 할당을 적용함으로써, 모델이 사고 연쇄(CoT) 생성 과정에서 보다 미래 지향적인 접근 방식을 채택하도록 유도합니다.
실험 결과에 따르면, 32B 규모 모델을 사용한 순수 강화 학습 환경에서 FIPO 알고리즘을 적용한 모델은 DeepSeek-Zero-MATH 및 OpenAI의 o1-mini와 같은 유사 규모의 모델들을 이미 능가했으며, 이는 국내 대형 모델의 논리적 추론 및 수학적 계산 능력에서 상당한 진전을 보여줍니다.
현재 대형 모델 간의 경쟁은 사전 학습 규모에서 추론 시점의 심층 정합성으로 초점을 옮기고 있다. FIPO의 출시는 논리적 추론 모델의 ‘사고 과정’ 품질을 평가하는 새로운 방법을 제시할 뿐만 아니라, 오픈소스 커뮤니티와 국내 주요 연구소들이 세계적 수준의 추론 모델을 추구하며 점차 독자적인 기술적 길을 개척하고 있음을 시사한다.
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도





집






