NVIDIA 將 Polar 框架開源,透過強化學習實現零門檻的 AI 編碼代理演化
5月28日,NVIDIA 研究團隊將強化學習訓練框架「Polar」開源。其核心創新之處在於,能將現有的主流程式碼代理(例如 Codex、Claude Code 和 Qwen Code)無縫整合至 GRPO(通用相對策略優化)強化學習訓練中,且無需對原始程式碼進行任何修改。

I. 產業痛點:代理強化學習的障礙
隨著程式碼代理從簡單的單步驟任務,演進至複雜且長期運行的流程——例如倉庫級別的程式碼修改或作業系統互動——開發人員越來越依賴成熟的執行框架(Harness)。然而,將這些複雜的框架整合到傳統的強化學習基礎架構中,卻面臨著巨大的挑戰:
高整合成本:傳統方法需要將程式邏輯重寫為標準環境介面(如 env.init() 和 env.step()),此過程極為繁瑣。
資訊流失:在重構過程中,關鍵細節(例如工具呼叫、多回合對話語境或子代理協作邏輯)往往會遺失,導致模型無法接收高品質的訓練訊號。

II. 核心解決方案:以「邊界」作為訓練入口點
Polar 無需重寫執行框架,而是將模型 API 邊界視為訓練入口點。
黑盒處理:Polar 在程式碼執行框架與模型推論伺服器之間設置了一個透明的代理(Gateway)。無論代理使用的是 Anthropic、OpenAI 還是 Google 的 API,Polar 都能無縫攔截並轉發請求。
追蹤重建:在轉發過程中,Polar 會記錄關鍵的即時資料——例如提示、採樣標記及對數機率——並將其重建為強化學習訓練器所需的「追蹤」資料。
高效異步架構:系統採用 Rollout Server 負責調度與資料持久化,同時由 Gateway Nodes 管理生命週期與資源回收。透過預熱緩衝區(READY buffer)與並行任務處理,有效消除可能阻塞 GPU 訓練的長尾任務。
III. 性能飛躍:轉化程式碼代理
實驗數據顯示,Polar 結合 GRPO 訓練可帶來顯著的性能提升:
經 SWE-Bench 驗證的基準測試:使用相同的 Qwen3.5-4B 基礎模型,不同程式碼框架的表現存在差異:
Codex 框架:pass@1 分數從 3.8% 躍升至 26.4%——暴增594.74%。
Claude Code Framework:從 29.8% 提升至 34.6%。
Pi Framework:從 34.2% 提升至 40.4%。
極致效率:導入 prefix_merging 策略後,相較於傳統的逐次請求模式,訓練總耗時縮短約5.39 倍,且 GPU 利用率從 20.4% 提升至87.7%。
產業評論
NVIDIA 的 Polar 開源計畫,實質上為 AI 代理進入強化的學習訓練領域鋪設了一條「高速公路」。它不僅讓研究人員能利用龐大的開源程式碼框架進行高效訓練,更透過系統層級的優化降低了 GPU 運算門檻。
隨著 Polar 的日益普及,開發者無需再擔心「如何將模型適應於訓練框架」。未來,AI 編碼代理的演進將變得更加標準化與高效。這標誌著 AI 代理訓練正從手動實驗室調校,轉向大規模、系統化的工程化生產。
論文網址:https://arxiv.org/pdf/2605.24220
相關文章
韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成
韓國媒體EtNews報道,韓國AI計算中心(KOACC)的奠基儀式於8月3日在全羅南道順天市的Solar City資料中心園區舉行。該專案總投資額為2.5萬億韓元(約合118.38億元人民幣),計劃於2028年投入運營,成為迄今為止韓國在AI基礎設施領域規模最大的國家投資之一。該專案的股權分佈凸顯了深化政企合作的戰略意圖。三星SDS作為最大股東持有30%的股份,而包括科學技術資訊通訊部、金融監督院和國家成長基金在內的公共實體合計持有29%的股份。NAVER Cloud緊隨其後,持股26.1%,
六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音
為應對由人工智慧自動化工具產生的大量低質量安全報告,六家主要科技公司——Anthropic、亞馬遜(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金會專案提供了 1250 萬美元 的資金支援。這項投資旨在減輕開源軟體(FOSS)維護者手動篩選的工作負擔,使他們能夠專注於真正的安全威脅。隨著人工智慧技術降低了漏洞發現的門檻,開源社羣正面臨前所未有的挑戰:無效報告:自動生成的 AI 報告使維護者應接不暇。雖然數量龐大,但這些提交往往缺乏深度,
馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證
今早,OpenAI 執行長山姆·阿爾特曼出庭作證,回應前聯合創始人埃隆·馬斯克針對該公司企業結構提起的訴訟。當被問及馬斯克聲稱其他聯合創始人透過成立一家以營利為目的的子公司來推廣基於人工智慧的產品,從而“竊取了一家慈善機構”的說法時,阿爾特曼表現出明顯的猶豫。“這種說法甚至讓人難以理解,”阿爾特曼在停頓後說道,“我們成立的是全球最大的慈善機構之一。該基金會正在開展令人難以置信的工作,並將繼續做更多事情。”馬斯克的律師團隊指出,OpenAI 基金會目前持有的資產價值約為 2000 億美元
相關專題推薦
評論 (1)
0/500
5月28日,NVIDIA 研究團隊將強化學習訓練框架「Polar」開源。其核心創新之處在於,能將現有的主流程式碼代理(例如 Codex、Claude Code 和 Qwen Code)無縫整合至 GRPO(通用相對策略優化)強化學習訓練中,且無需對原始程式碼進行任何修改。

I. 產業痛點:代理強化學習的障礙
隨著程式碼代理從簡單的單步驟任務,演進至複雜且長期運行的流程——例如倉庫級別的程式碼修改或作業系統互動——開發人員越來越依賴成熟的執行框架(Harness)。然而,將這些複雜的框架整合到傳統的強化學習基礎架構中,卻面臨著巨大的挑戰:
高整合成本:傳統方法需要將程式邏輯重寫為標準環境介面(如 env.init() 和 env.step()),此過程極為繁瑣。
資訊流失:在重構過程中,關鍵細節(例如工具呼叫、多回合對話語境或子代理協作邏輯)往往會遺失,導致模型無法接收高品質的訓練訊號。

II. 核心解決方案:以「邊界」作為訓練入口點
Polar 無需重寫執行框架,而是將模型 API 邊界視為訓練入口點。
黑盒處理:Polar 在程式碼執行框架與模型推論伺服器之間設置了一個透明的代理(Gateway)。無論代理使用的是 Anthropic、OpenAI 還是 Google 的 API,Polar 都能無縫攔截並轉發請求。
追蹤重建:在轉發過程中,Polar 會記錄關鍵的即時資料——例如提示、採樣標記及對數機率——並將其重建為強化學習訓練器所需的「追蹤」資料。
高效異步架構:系統採用 Rollout Server 負責調度與資料持久化,同時由 Gateway Nodes 管理生命週期與資源回收。透過預熱緩衝區(READY buffer)與並行任務處理,有效消除可能阻塞 GPU 訓練的長尾任務。
III. 性能飛躍:轉化程式碼代理
實驗數據顯示,Polar 結合 GRPO 訓練可帶來顯著的性能提升:
經 SWE-Bench 驗證的基準測試:使用相同的 Qwen3.5-4B 基礎模型,不同程式碼框架的表現存在差異:
Codex 框架:pass@1 分數從 3.8% 躍升至 26.4%——暴增594.74%。
Claude Code Framework:從 29.8% 提升至 34.6%。
Pi Framework:從 34.2% 提升至 40.4%。
極致效率:導入 prefix_merging 策略後,相較於傳統的逐次請求模式,訓練總耗時縮短約5.39 倍,且 GPU 利用率從 20.4% 提升至87.7%。
產業評論
NVIDIA 的 Polar 開源計畫,實質上為 AI 代理進入強化的學習訓練領域鋪設了一條「高速公路」。它不僅讓研究人員能利用龐大的開源程式碼框架進行高效訓練,更透過系統層級的優化降低了 GPU 運算門檻。
隨著 Polar 的日益普及,開發者無需再擔心「如何將模型適應於訓練框架」。未來,AI 編碼代理的演進將變得更加標準化與高效。這標誌著 AI 代理訓練正從手動實驗室調校,轉向大規模、系統化的工程化生產。
論文網址:https://arxiv.org/pdf/2605.24220
韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成
韓國媒體EtNews報道,韓國AI計算中心(KOACC)的奠基儀式於8月3日在全羅南道順天市的Solar City資料中心園區舉行。該專案總投資額為2.5萬億韓元(約合118.38億元人民幣),計劃於2028年投入運營,成為迄今為止韓國在AI基礎設施領域規模最大的國家投資之一。該專案的股權分佈凸顯了深化政企合作的戰略意圖。三星SDS作為最大股東持有30%的股份,而包括科學技術資訊通訊部、金融監督院和國家成長基金在內的公共實體合計持有29%的股份。NAVER Cloud緊隨其後,持股26.1%,
六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音
為應對由人工智慧自動化工具產生的大量低質量安全報告,六家主要科技公司——Anthropic、亞馬遜(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金會專案提供了 1250 萬美元 的資金支援。這項投資旨在減輕開源軟體(FOSS)維護者手動篩選的工作負擔,使他們能夠專注於真正的安全威脅。隨著人工智慧技術降低了漏洞發現的門檻,開源社羣正面臨前所未有的挑戰:無效報告:自動生成的 AI 報告使維護者應接不暇。雖然數量龐大,但這些提交往往缺乏深度,
馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證
今早,OpenAI 執行長山姆·阿爾特曼出庭作證,回應前聯合創始人埃隆·馬斯克針對該公司企業結構提起的訴訟。當被問及馬斯克聲稱其他聯合創始人透過成立一家以營利為目的的子公司來推廣基於人工智慧的產品,從而“竊取了一家慈善機構”的說法時,阿爾特曼表現出明顯的猶豫。“這種說法甚至讓人難以理解,”阿爾特曼在停頓後說道,“我們成立的是全球最大的慈善機構之一。該基金會正在開展令人難以置信的工作,並將繼續做更多事情。”馬斯克的律師團隊指出,OpenAI 基金會目前持有的資產價值約為 2000 億美元





首頁






