NVIDIA、強化学習による障壁のないAIコーディングエージェントの進化を実現する「Polar」フレームワークをオープンソース化
5月28日、NVIDIAの研究チームは、強化学習トレーニングフレームワーク「Polar」をオープンソース化しました。その中核となる革新性は、Codex、Claude Code、Qwen Codeといった既存の主流なコードエージェントを、元のコードに変更を加えることなく、GRPO(Generalized Relative Policy Optimization)強化学習トレーニングにシームレスに統合できる点にあります。

I. 業界の課題:エージェント強化学習の障壁
コードエージェントが、単純な単一ステップのタスクから、倉庫レベルのコード変更やOSとの連携といった複雑で長時間実行されるプロセスへと進化するにつれ、開発者は成熟した実行フレームワーク(Harness)への依存度を高めています。しかし、これらの複雑なフレームワークを従来の強化学習インフラに統合するには、大きな課題が伴います:
高い統合コスト:従来の方法では、コードロジックを env.init() や env.step() といった標準的な環境インターフェースに書き換える必要があり、このプロセスは極めて煩雑です。
情報の喪失:リファクタリングの際、ツール呼び出し、複数ターンにわたる対話コンテキスト、サブエージェント間の協調ロジックといった重要な詳細が失われることが多く、その結果、モデルが高品質なトレーニング信号を受け取れなくなります。

II. 核心となる解決策:「境界」をトレーニングのエントリポイントとして活用
Polarは、実行フレームワークの書き換えを不要にします。その代わりに、モデルAPIの境界をトレーニングのエントリポイントとして扱います。
ブラックボックス処理:Polarは、コード実行フレームワークとモデル推論サーバーの間に透過的なプロキシ(Gateway)を配置します。エージェントがAnthropic、OpenAI、GoogleのいずれのAPIを使用しているかに関わらず、Polarはリクエストをシームレスにインターセプトして転送します。
トレースの再構築:転送中に、Polarはプロンプト、サンプリングされたトークン、ログ確率などの主要なデータをリアルタイムで記録し、強化学習トレーナーが必要とする「トレース」データとして再構築します。
効率的な非同期アーキテクチャ:システムはスケジューリングと永続化にロールアウトサーバーを採用し、ゲートウェイノードがライフサイクルとリソースのリサイクルを管理します。プリヒートされたバッファ(READYバッファ)と並列タスク処理を活用することで、GPUトレーニングをブロックする可能性のあるロングテールタスクを効果的に排除します。
III. 性能の飛躍:コードエージェントの変革
実験データによると、PolarをGRPOトレーニングと組み合わせることで、大幅な性能向上が得られることが示されています:
SWE-Benchによる検証済みベンチマークテスト:同じQwen3.5-4Bベースモデルを使用した場合、パフォーマンスはコードフレームワークによって異なります:
Codexフレームワーク:pass@1スコアが3.8%から26.4%へと跳ね上がり、594.74%の急増を記録しました。
Claude Code Framework:29.8%から34.6%へ。
Pi Framework:34.2%から40.4%へ。
極めて高い効率性:prefix_merging戦略を導入した結果、従来のリクエストごとのモードと比較してトレーニングの実行時間が約5.39倍短縮され、GPU利用率は20.4%から87.7%に上昇しました。
業界のコメント
NVIDIAのPolarのオープンソース化は、本質的にAIエージェントが強化学習のトレーニングに参入するための「高速道路」を構築するものです。これにより、研究者は大規模なオープンソースコードフレームワークを活用して効率的にトレーニングを行えるようになるだけでなく、システムレベルの最適化を通じてGPUコンピューティングの参入障壁も低減されます。
Polarの人気が高まるにつれ、開発者はもはや「モデルをトレーニングフレームワークにどう適応させるか」を心配する必要がなくなります。将来的には、AIコーディングエージェントの進化はより標準化され、効率的になるでしょう。これは、AIエージェントのトレーニングが、手作業によるラボでのチューニングから、大規模かつ体系的なエンジニアリング生産へと移行することを意味します。
論文URL: https://arxiv.org/pdf/2605.24220
関連記事
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
アルトマン証言の中で、マスクはOpenAIを子供たちに譲ることを検討した
今朝、OpenAIのCEOサム・アルトマン氏は、同社の企業構造に異議を唱える元共同創設者エロン・マスク氏の訴訟に対応するため証言台に立った。「営利子会社を設立してAI搭載製品を市場に出すことで、他の創設者たちが『慈善団体を盗んだ』」というマスク氏の主張について問われると、アルトマン氏は明らかなためらいを示して応答した。「その枠組みを処理するのは難しい」と、アルトマン氏は一時の間を置いて語った。「私たちは世界最大の慈善団体の一つを設立した。財団は素晴らしい活動を行っており、今後もさらに多くのこ
関連特集おすすめ
コメント (1)
0/500
5月28日、NVIDIAの研究チームは、強化学習トレーニングフレームワーク「Polar」をオープンソース化しました。その中核となる革新性は、Codex、Claude Code、Qwen Codeといった既存の主流なコードエージェントを、元のコードに変更を加えることなく、GRPO(Generalized Relative Policy Optimization)強化学習トレーニングにシームレスに統合できる点にあります。

I. 業界の課題:エージェント強化学習の障壁
コードエージェントが、単純な単一ステップのタスクから、倉庫レベルのコード変更やOSとの連携といった複雑で長時間実行されるプロセスへと進化するにつれ、開発者は成熟した実行フレームワーク(Harness)への依存度を高めています。しかし、これらの複雑なフレームワークを従来の強化学習インフラに統合するには、大きな課題が伴います:
高い統合コスト:従来の方法では、コードロジックを env.init() や env.step() といった標準的な環境インターフェースに書き換える必要があり、このプロセスは極めて煩雑です。
情報の喪失:リファクタリングの際、ツール呼び出し、複数ターンにわたる対話コンテキスト、サブエージェント間の協調ロジックといった重要な詳細が失われることが多く、その結果、モデルが高品質なトレーニング信号を受け取れなくなります。

II. 核心となる解決策:「境界」をトレーニングのエントリポイントとして活用
Polarは、実行フレームワークの書き換えを不要にします。その代わりに、モデルAPIの境界をトレーニングのエントリポイントとして扱います。
ブラックボックス処理:Polarは、コード実行フレームワークとモデル推論サーバーの間に透過的なプロキシ(Gateway)を配置します。エージェントがAnthropic、OpenAI、GoogleのいずれのAPIを使用しているかに関わらず、Polarはリクエストをシームレスにインターセプトして転送します。
トレースの再構築:転送中に、Polarはプロンプト、サンプリングされたトークン、ログ確率などの主要なデータをリアルタイムで記録し、強化学習トレーナーが必要とする「トレース」データとして再構築します。
効率的な非同期アーキテクチャ:システムはスケジューリングと永続化にロールアウトサーバーを採用し、ゲートウェイノードがライフサイクルとリソースのリサイクルを管理します。プリヒートされたバッファ(READYバッファ)と並列タスク処理を活用することで、GPUトレーニングをブロックする可能性のあるロングテールタスクを効果的に排除します。
III. 性能の飛躍:コードエージェントの変革
実験データによると、PolarをGRPOトレーニングと組み合わせることで、大幅な性能向上が得られることが示されています:
SWE-Benchによる検証済みベンチマークテスト:同じQwen3.5-4Bベースモデルを使用した場合、パフォーマンスはコードフレームワークによって異なります:
Codexフレームワーク:pass@1スコアが3.8%から26.4%へと跳ね上がり、594.74%の急増を記録しました。
Claude Code Framework:29.8%から34.6%へ。
Pi Framework:34.2%から40.4%へ。
極めて高い効率性:prefix_merging戦略を導入した結果、従来のリクエストごとのモードと比較してトレーニングの実行時間が約5.39倍短縮され、GPU利用率は20.4%から87.7%に上昇しました。
業界のコメント
NVIDIAのPolarのオープンソース化は、本質的にAIエージェントが強化学習のトレーニングに参入するための「高速道路」を構築するものです。これにより、研究者は大規模なオープンソースコードフレームワークを活用して効率的にトレーニングを行えるようになるだけでなく、システムレベルの最適化を通じてGPUコンピューティングの参入障壁も低減されます。
Polarの人気が高まるにつれ、開発者はもはや「モデルをトレーニングフレームワークにどう適応させるか」を心配する必要がなくなります。将来的には、AIコーディングエージェントの進化はより標準化され、効率的になるでしょう。これは、AIエージェントのトレーニングが、手作業によるラボでのチューニングから、大規模かつ体系的なエンジニアリング生産へと移行することを意味します。
論文URL: https://arxiv.org/pdf/2605.24220
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
アルトマン証言の中で、マスクはOpenAIを子供たちに譲ることを検討した
今朝、OpenAIのCEOサム・アルトマン氏は、同社の企業構造に異議を唱える元共同創設者エロン・マスク氏の訴訟に対応するため証言台に立った。「営利子会社を設立してAI搭載製品を市場に出すことで、他の創設者たちが『慈善団体を盗んだ』」というマスク氏の主張について問われると、アルトマン氏は明らかなためらいを示して応答した。「その枠組みを処理するのは難しい」と、アルトマン氏は一時の間を置いて語った。「私たちは世界最大の慈善団体の一つを設立した。財団は素晴らしい活動を行っており、今後もさらに多くのこ





家






