NVIDIA, 강화 학습을 통한 장벽 없는 AI 코딩 에이전트 진화를 위한 ‘Polar’ 프레임워크를 오픈소스로 공개
5월 28일, NVIDIA 연구팀은 강화 학습 훈련 프레임워크인 ‘Polar’를 오픈소스로 공개했습니다. 이 프레임워크의 핵심 혁신은 Codex, Claude Code, Qwen Code와 같은 기존의 주류 코드 에이전트를 원본 코드를 수정할 필요 없이 GRPO(Generalized Relative Policy Optimization) 강화 학습 훈련에 원활하게 통합한다는 점에 있습니다.

I. 업계의 고충: 에이전트 강화 학습의 장벽
코드 에이전트가 단순한 단일 단계 작업에서 창고 수준의 코드 수정이나 OS 상호작용과 같은 복잡하고 장시간 실행되는 프로세스로 진감함에 따라, 개발자들은 점점 더 성숙한 실행 프레임워크(Harness)에 의존하고 있습니다. 그러나 이러한 복잡한 프레임워크를 기존의 강화 학습 인프라에 통합하는 데는 상당한 어려움이 따릅니다:
높은 통합 비용: 기존 방식은 코드 로직을 env.init() 및 env.step()과 같은 표준 환경 인터페이스로 재작성해야 하는데, 이는 매우 번거로운 과정입니다.
정보 손실: 리팩토링 과정에서 도구 호출, 다중 턴 대화 컨텍스트, 하위 에이전트 협업 로직과 같은 중요한 세부 정보가 종종 손실되어, 모델이 고품질의 훈련 신호를 수신하지 못하게 됩니다.

II. 핵심 솔루션: "경계(Boundary)"를 훈련 진입점으로 활용
Polar는 실행 프레임워크를 재작성할 필요가 없도록 합니다. 대신 모델 API 경계를 훈련 진입점으로 취급합니다.
블랙박스 처리: Polar는 코드 실행 프레임워크와 모델 추론 서버 사이에 투명한 프록시(게이트웨이)를 배치합니다. 에이전트가 Anthropic, OpenAI, Google의 API를 사용하든 상관없이, Polar는 요청을 원활하게 가로채어 전달합니다.
추적 재구성: 전달 과정에서 Polar는 프롬프트, 샘플링된 토큰, 로그 확률과 같은 핵심 데이터를 실시간으로 기록하고, 이를 강화 학습 트레이너에 필요한 "추적(trace)" 데이터로 재구성합니다.
효율적인 비동기 아키텍처: 이 시스템은 스케줄링과 지속성을 위해 롤아웃 서버를 활용하며, 게이트웨이 노드는 라이프사이클과 리소스 재활용을 관리합니다. 예열된 버퍼(READY 버퍼)와 병렬 작업 처리를 활용함으로써, GPU 훈련을 차단할 수 있는 롱테일 작업을 효과적으로 제거합니다.
III. 성능의 도약: 코드 에이전트의 변혁
실험 데이터에 따르면, Polar를 GRPO 훈련과 결합할 경우 상당한 성능 향상을 가져옵니다:
SWE-Bench 검증 벤치마크 테스트: 동일한 Qwen3.5-4B 기반 모델을 사용했을 때, 성능은 코드 프레임워크에 따라 차이가 나타납니다:
Codex 프레임워크: pass@1 점수가 3.8%에서 26.4%로 급증하여 594.74%의 향상률을 기록 했습니다.
Claude 코드 프레임워크: 29.8%에서 34.6%로 상승.
Pi 프레임워크: 34.2%에서 40.4%로 상승.
극한의 효율성: prefix_merging 전략을 도입한 후, 훈련 소요 시간은 기존의 요청별 모드에 비해 약 5.39배 단축되었으며, GPU 활용률은 20.4%에서 87.7%로 상승했습니다 .
업계 평론
NVIDIA의 Polar 오픈소스화는 본질적으로 AI 에이전트가 강화 학습 훈련에 진입할 수 있는 "고속도로"를 구축합니다. 이는 연구자들이 방대한 오픈소스 코드 프레임워크를 활용해 효율적으로 훈련할 수 있게 할 뿐만 아니라, 시스템 수준의 최적화를 통해 GPU 컴퓨팅 진입 장벽을 낮춥니다.
Polar의 인기가 높아짐에 따라 개발자들은 더 이상 "모델을 훈련 프레임워크에 어떻게 적용할지"에 대해 고민할 필요가 없습니다. 앞으로 AI 코딩 에이전트의 진화는 더욱 표준화되고 효율화될 것입니다. 이는 AI 에이전트 훈련이 수동적인 실험실 튜닝에서 대규모의 체계적인 엔지니어링 생산으로 전환되는 것을 의미합니다.
논문 URL: https://arxiv.org/pdf/2605.24220
관련 기사
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받
관련 특별 주제 추천
의견 (1)
0/500
5월 28일, NVIDIA 연구팀은 강화 학습 훈련 프레임워크인 ‘Polar’를 오픈소스로 공개했습니다. 이 프레임워크의 핵심 혁신은 Codex, Claude Code, Qwen Code와 같은 기존의 주류 코드 에이전트를 원본 코드를 수정할 필요 없이 GRPO(Generalized Relative Policy Optimization) 강화 학습 훈련에 원활하게 통합한다는 점에 있습니다.

I. 업계의 고충: 에이전트 강화 학습의 장벽
코드 에이전트가 단순한 단일 단계 작업에서 창고 수준의 코드 수정이나 OS 상호작용과 같은 복잡하고 장시간 실행되는 프로세스로 진감함에 따라, 개발자들은 점점 더 성숙한 실행 프레임워크(Harness)에 의존하고 있습니다. 그러나 이러한 복잡한 프레임워크를 기존의 강화 학습 인프라에 통합하는 데는 상당한 어려움이 따릅니다:
높은 통합 비용: 기존 방식은 코드 로직을 env.init() 및 env.step()과 같은 표준 환경 인터페이스로 재작성해야 하는데, 이는 매우 번거로운 과정입니다.
정보 손실: 리팩토링 과정에서 도구 호출, 다중 턴 대화 컨텍스트, 하위 에이전트 협업 로직과 같은 중요한 세부 정보가 종종 손실되어, 모델이 고품질의 훈련 신호를 수신하지 못하게 됩니다.

II. 핵심 솔루션: "경계(Boundary)"를 훈련 진입점으로 활용
Polar는 실행 프레임워크를 재작성할 필요가 없도록 합니다. 대신 모델 API 경계를 훈련 진입점으로 취급합니다.
블랙박스 처리: Polar는 코드 실행 프레임워크와 모델 추론 서버 사이에 투명한 프록시(게이트웨이)를 배치합니다. 에이전트가 Anthropic, OpenAI, Google의 API를 사용하든 상관없이, Polar는 요청을 원활하게 가로채어 전달합니다.
추적 재구성: 전달 과정에서 Polar는 프롬프트, 샘플링된 토큰, 로그 확률과 같은 핵심 데이터를 실시간으로 기록하고, 이를 강화 학습 트레이너에 필요한 "추적(trace)" 데이터로 재구성합니다.
효율적인 비동기 아키텍처: 이 시스템은 스케줄링과 지속성을 위해 롤아웃 서버를 활용하며, 게이트웨이 노드는 라이프사이클과 리소스 재활용을 관리합니다. 예열된 버퍼(READY 버퍼)와 병렬 작업 처리를 활용함으로써, GPU 훈련을 차단할 수 있는 롱테일 작업을 효과적으로 제거합니다.
III. 성능의 도약: 코드 에이전트의 변혁
실험 데이터에 따르면, Polar를 GRPO 훈련과 결합할 경우 상당한 성능 향상을 가져옵니다:
SWE-Bench 검증 벤치마크 테스트: 동일한 Qwen3.5-4B 기반 모델을 사용했을 때, 성능은 코드 프레임워크에 따라 차이가 나타납니다:
Codex 프레임워크: pass@1 점수가 3.8%에서 26.4%로 급증하여 594.74%의 향상률을 기록 했습니다.
Claude 코드 프레임워크: 29.8%에서 34.6%로 상승.
Pi 프레임워크: 34.2%에서 40.4%로 상승.
극한의 효율성: prefix_merging 전략을 도입한 후, 훈련 소요 시간은 기존의 요청별 모드에 비해 약 5.39배 단축되었으며, GPU 활용률은 20.4%에서 87.7%로 상승했습니다 .
업계 평론
NVIDIA의 Polar 오픈소스화는 본질적으로 AI 에이전트가 강화 학습 훈련에 진입할 수 있는 "고속도로"를 구축합니다. 이는 연구자들이 방대한 오픈소스 코드 프레임워크를 활용해 효율적으로 훈련할 수 있게 할 뿐만 아니라, 시스템 수준의 최적화를 통해 GPU 컴퓨팅 진입 장벽을 낮춥니다.
Polar의 인기가 높아짐에 따라 개발자들은 더 이상 "모델을 훈련 프레임워크에 어떻게 적용할지"에 대해 고민할 필요가 없습니다. 앞으로 AI 코딩 에이전트의 진화는 더욱 표준화되고 효율화될 것입니다. 이는 AI 에이전트 훈련이 수동적인 실험실 튜닝에서 대규모의 체계적인 엔지니어링 생산으로 전환되는 것을 의미합니다.
논문 URL: https://arxiv.org/pdf/2605.24220
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받





집







