選項
首頁
新聞
NVIDIA 將 Polar 框架開源,透過強化學習實現零門檻的 AI 編碼代理演化

NVIDIA 將 Polar 框架開源,透過強化學習實現零門檻的 AI 編碼代理演化

2026-05-31
163

5月28日,NVIDIA 研究團隊將強化學習訓練框架「Polar」開源。其核心創新之處在於,能將現有的主流程式碼代理(例如 Codex、Claude Code 和 Qwen Code)無縫整合至 GRPO(通用相對策略優化)強化學習訓練中,且無需對原始程式碼進行任何修改。

image.png

I. 產業痛點:代理強化學習的障礙

隨著程式碼代理從簡單的單步驟任務,演進至複雜且長期運行的流程——例如倉庫級別的程式碼修改或作業系統互動——開發人員越來越依賴成熟的執行框架(Harness)。然而,將這些複雜的框架整合到傳統的強化學習基礎架構中,卻面臨著巨大的挑戰:

高整合成本:傳統方法需要將程式邏輯重寫為標準環境介面(如 env.init() 和 env.step()),此過程極為繁瑣。

資訊流失:在重構過程中,關鍵細節(例如工具呼叫、多回合對話語境或子代理協作邏輯)往往會遺失,導致模型無法接收高品質的訓練訊號。

image.png

II. 核心解決方案:以「邊界」作為訓練入口點

Polar 無需重寫執行框架,而是將模型 API 邊界視為訓練入口點

黑盒處理:Polar 在程式碼執行框架與模型推論伺服器之間設置了一個透明的代理(Gateway)。無論代理使用的是 Anthropic、OpenAI 還是 Google 的 API,Polar 都能無縫攔截並轉發請求。

追蹤重建:在轉發過程中,Polar 會記錄關鍵的即時資料——例如提示、採樣標記及對數機率——並將其重建為強化學習訓練器所需的「追蹤」資料。

高效異步架構:系統採用 Rollout Server 負責調度與資料持久化,同時由 Gateway Nodes 管理生命週期與資源回收。透過預熱緩衝區(READY buffer)與並行任務處理,有效消除可能阻塞 GPU 訓練的長尾任務。

III. 性能飛躍:轉化程式碼代理

實驗數據顯示,Polar 結合 GRPO 訓練可帶來顯著的性能提升:

經 SWE-Bench 驗證的基準測試:使用相同的 Qwen3.5-4B 基礎模型,不同程式碼框架的表現存在差異:

Codex 框架:pass@1 分數從 3.8% 躍升至 26.4%——暴增594.74%。

Claude Code Framework:從 29.8% 提升至 34.6%。

Pi Framework:從 34.2% 提升至 40.4%。

極致效率:導入 prefix_merging 策略後,相較於傳統的逐次請求模式,訓練總耗時縮短約5.39 倍,且 GPU 利用率從 20.4% 提升至87.7%。

產業評論

NVIDIA 的 Polar 開源計畫,實質上為 AI 代理進入強化的學習訓練領域鋪設了一條「高速公路」。它不僅讓研究人員能利用龐大的開源程式碼框架進行高效訓練,更透過系統層級的優化降低了 GPU 運算門檻。

隨著 Polar 的日益普及,開發者無需再擔心「如何將模型適應於訓練框架」。未來,AI 編碼代理的演進將變得更加標準化與高效。這標誌著 AI 代理訓練正從手動實驗室調校,轉向大規模、系統化的工程化生產。

論文網址:https://arxiv.org/pdf/2605.24220

相關文章
韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成 韓國啟動國家人工智慧計算中心建設,投資2.5萬億韓元,目標2028年完成 韓國媒體EtNews報道,韓國AI計算中心(KOACC)的奠基儀式於8月3日在全羅南道順天市的Solar City資料中心園區舉行。該專案總投資額為2.5萬億韓元(約合118.38億元人民幣),計劃於2028年投入運營,成為迄今為止韓國在AI基礎設施領域規模最大的國家投資之一。該專案的股權分佈凸顯了深化政企合作的戰略意圖。三星SDS作為最大股東持有30%的股份,而包括科學技術資訊通訊部、金融監督院和國家成長基金在內的公共實體合計持有29%的股份。NAVER Cloud緊隨其後,持股26.1%,
六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音 六大科技巨頭向 Linux 基金會捐贈 1250 萬美元,以應對人工智慧漏洞噪音 為應對由人工智慧自動化工具產生的大量低質量安全報告,六家主要科技公司——Anthropic、亞馬遜(AWS)、GitHub、Google、Microsoft 和 OpenAI——共同向 Linux 基金會專案提供了 1250 萬美元 的資金支援。這項投資旨在減輕開源軟體(FOSS)維護者手動篩選的工作負擔,使他們能夠專注於真正的安全威脅。隨著人工智慧技術降低了漏洞發現的門檻,開源社羣正面臨前所未有的挑戰:無效報告:自動生成的 AI 報告使維護者應接不暇。雖然數量龐大,但這些提交往往缺乏深度,
馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證 馬斯克曾考慮將OpenAI留給他的孩子,而奧特曼正在作證 今早,OpenAI 執行長山姆·阿爾特曼出庭作證,回應前聯合創始人埃隆·馬斯克針對該公司企業結構提起的訴訟。當被問及馬斯克聲稱其他聯合創始人透過成立一家以營利為目的的子公司來推廣基於人工智慧的產品,從而“竊取了一家慈善機構”的說法時,阿爾特曼表現出明顯的猶豫。“這種說法甚至讓人難以理解,”阿爾特曼在停頓後說道,“我們成立的是全球最大的慈善機構之一。該基金會正在開展令人難以置信的工作,並將繼續做更多事情。”馬斯克的律師團隊指出,OpenAI 基金會目前持有的資產價值約為 2000 億美元
相關專題推薦
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
代碼 適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具
適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具

2026 年最新、最優秀的 GitHub 團隊 AI 拉取請求審查工具,就在 XIX.AI!這份精選且評價極高的清單,展示了多款強大且能徹底改變遊戲規則的解決方案,可優化所有團隊工作流程中的重構、錯誤修復及安全漏洞偵測。 透過免費與付費版本的比較、實際測試結果以及詳細排名,協助您找到能顯著提升生產力的完美工具。立即探索,釋放您的 AI 競爭優勢!

12 個工具
xix.ai
評論 (1)
0/500
AlbertWalker
AlbertWalker 2026-06-30 06:00:18

So NVIDIA just dropped Polar as open source? That's huge for AI coding agents - integrating Codex and Claude with reinforcement learning sounds like a game changer. But I wonder how much compute you'd need to actually train it effectively... 🤔

OR