Tongyi LabがFIPOアルゴリズムを発表、32Bモデルの推論性能がo1-miniを上回る

Tongyi Labのインテリジェント・コンピューティングチームは本日、大規模言語モデル向けの新たなトレーニング後アルゴリズム「FIPO(Future-KL Influenced Policy Optimization)」を発表した。 このアルゴリズムは、純粋強化学習(Pure RL)のトレーニングにおいてよく見られる技術的課題である「推論長停滞」を効果的に解決する、斬新な「Future-KL」メカニズムを導入しています。
長文推論や複雑な論理的整合性の学習において、従来の強化学習では、長いシーケンス内の重要な決定ポイントを正確に特定できないことがよくあります。Tongyiチームが開発したFIPOアルゴリズムは、重要なトークンに対して差別化された報酬配分を行うことで、思考連鎖(CoT)の生成において、モデルがより先を見据えたアプローチを採用するよう促します。
実験結果によると、32B規模のモデルを用いた純粋強化学習の環境において、FIPOアルゴリズムを採用したモデルは、DeepSeek-Zero-MATHやOpenAIのo1-miniといった同規模のモデルをすでに上回る性能を示しており、国内の大型モデルの論理推論および数学的計算能力において大きな進歩を遂げている。
現在、大規模モデル間の競争は、事前学習の規模から、推論時の深い整合性へと移行しつつある。 FIPOの公開は、論理推論モデルにおける「思考プロセス」の質を評価する新たな手法を提供するだけでなく、オープンソースコミュニティや国内の主要研究機関が、世界クラスの推論モデルを追求する中で、徐々に独自の技術的道を切り拓きつつあることを示唆している。
関連記事
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
関連特集おすすめ
コメント (0)
0/500

Tongyi Labのインテリジェント・コンピューティングチームは本日、大規模言語モデル向けの新たなトレーニング後アルゴリズム「FIPO(Future-KL Influenced Policy Optimization)」を発表した。 このアルゴリズムは、純粋強化学習(Pure RL)のトレーニングにおいてよく見られる技術的課題である「推論長停滞」を効果的に解決する、斬新な「Future-KL」メカニズムを導入しています。
長文推論や複雑な論理的整合性の学習において、従来の強化学習では、長いシーケンス内の重要な決定ポイントを正確に特定できないことがよくあります。Tongyiチームが開発したFIPOアルゴリズムは、重要なトークンに対して差別化された報酬配分を行うことで、思考連鎖(CoT)の生成において、モデルがより先を見据えたアプローチを採用するよう促します。
実験結果によると、32B規模のモデルを用いた純粋強化学習の環境において、FIPOアルゴリズムを採用したモデルは、DeepSeek-Zero-MATHやOpenAIのo1-miniといった同規模のモデルをすでに上回る性能を示しており、国内の大型モデルの論理推論および数学的計算能力において大きな進歩を遂げている。
現在、大規模モデル間の競争は、事前学習の規模から、推論時の深い整合性へと移行しつつある。 FIPOの公開は、論理推論モデルにおける「思考プロセス」の質を評価する新たな手法を提供するだけでなく、オープンソースコミュニティや国内の主要研究機関が、世界クラスの推論モデルを追求する中で、徐々に独自の技術的道を切り拓きつつあることを示唆している。
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー





家






