오픈AI, AI 벤치마크에 일침: 질문의 3분의 1 가까이가 결함이 있었음에도 8개월 만에 합격률이 80%로 치솟았다
오픈AI는 블로그 게시물을 통해 업계 최고의 벤치마크인 ‘SWE-Bench Pro’에 공개적으로 이의를 제기하며, 공개된 731개의 테스트 과제 중 약 30%에 평가상의 결함이 있다고 주장했다. Scale AI가 개발한 SWE-Bench Pro는 대규모 언어 모델과 AI 에이전트의 코딩 능력을 평가하기 위해 고안되었습니다. 실제 기업 개발 환경을 충실히 반영하고 엄격한 부정행위 방지 조치를 시행하기 때문에, AI 소프트웨어 엔지니어링 분야에서 널리 신뢰받는 벤치마크로 자리 잡았습니다.

오픈AI는 블로그 게시물에서 한 가지 중요한 신호를 강조합니다. 바로 이 벤치마크에서 최상위 모델들의 합격률이 불과 8개월 만에 23.3%에서 80.3%로 급증했다는 점입니다. 이러한 급속한 발전은 의심스러워 보이며, 오픈AI는 이 벤치마크가 더 이상 모델의 실제 소프트웨어 개발 능력을 정확하게 측정할 수 없다고 주장합니다. 이 문제는 모델 성능의 진정한 도약이 아니라 평가 방식 자체의 결함에서 비롯된 것으로 보인다.
교차 검증된 두 가지 검토 경로를 통해, 과제 중 거의 30%가 “부적격”으로 판정된 사실이 드러났습니다.
이를 검증하기 위해 OpenAI는 두 가지 병행 검토 절차를 진행했습니다. 데이터 포인트 분석 결과, 731개의 공개 과제 중 27.4%에 해당하는 200개의 과제가 불합격으로 판정되었습니다. 한편, 수동 주석 분석에서는 34.1%에 해당하는 249개의 과제가 불합격으로 표시되었습니다. 두 방법을 상호 대조한 결과, OpenAI는 SWE-Bench Pro 과제의 약 30%가 결함을 포함하고 있으며, 이는 지나치게 엄격한 테스트, 부적절한 프롬프트, 좁은 테스트 범위, 오해의 소지가 있는 프롬프트라는 네 가지 범주로 분류된다고 추정합니다.
OpenAI는 또한 전형적인 사례를 공유했습니다. 한 과제는 콘텐츠를 마크다운(Markdown)으로 변환할 때 줄 시작 부분에 공백 하나를 넣도록 요구했으나, 숨겨진 테스트 기준은 공백 두 개를 기대했습니다. 결과적으로, 모델이 명시된 요구 사항을 따랐더라도 오답으로 처리될 수밖에 없었습니다. 이러한 명시적 지침과 숨겨진 요구 사항 간의 불일치는 모델의 실제 능력 평가를 직접적으로 왜곡하며, 합격률이 비합리적으로 급증한 원인을 설명해 줍니다.
채택 권고 철회 및 AI 평가 시스템 재구축 촉구
이러한 분석을 바탕으로 OpenAI는 SWE-Bench Pro 사용에 대한 기존 권고를 공식적으로 철회했습니다. 이 회사는 향후 벤치마크가 인간 개발자를 위해 설계된 테스트 로직을 전용하는 방식이 아니라, 경험이 풍부한 소프트웨어 개발자들이 AI 평가를 위해 특별히 제작해야 한다고 믿습니다. 업계 벤치마크의 과제 중 거의 30%가 결함을 가지고 있다면, AI 평가 시스템 전체의 신뢰성에 의문이 제기될 수밖에 없습니다. 점수 경쟁에서 벗어나 진정한 엔지니어링 역량 평가로 초점을 전환하는 것이 AI 소프트웨어 엔지니어링 평가의 다음 중요한 단계가 될 수 있습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (0)
0/500
오픈AI는 블로그 게시물을 통해 업계 최고의 벤치마크인 ‘SWE-Bench Pro’에 공개적으로 이의를 제기하며, 공개된 731개의 테스트 과제 중 약 30%에 평가상의 결함이 있다고 주장했다. Scale AI가 개발한 SWE-Bench Pro는 대규모 언어 모델과 AI 에이전트의 코딩 능력을 평가하기 위해 고안되었습니다. 실제 기업 개발 환경을 충실히 반영하고 엄격한 부정행위 방지 조치를 시행하기 때문에, AI 소프트웨어 엔지니어링 분야에서 널리 신뢰받는 벤치마크로 자리 잡았습니다.

오픈AI는 블로그 게시물에서 한 가지 중요한 신호를 강조합니다. 바로 이 벤치마크에서 최상위 모델들의 합격률이 불과 8개월 만에 23.3%에서 80.3%로 급증했다는 점입니다. 이러한 급속한 발전은 의심스러워 보이며, 오픈AI는 이 벤치마크가 더 이상 모델의 실제 소프트웨어 개발 능력을 정확하게 측정할 수 없다고 주장합니다. 이 문제는 모델 성능의 진정한 도약이 아니라 평가 방식 자체의 결함에서 비롯된 것으로 보인다.
교차 검증된 두 가지 검토 경로를 통해, 과제 중 거의 30%가 “부적격”으로 판정된 사실이 드러났습니다.
이를 검증하기 위해 OpenAI는 두 가지 병행 검토 절차를 진행했습니다. 데이터 포인트 분석 결과, 731개의 공개 과제 중 27.4%에 해당하는 200개의 과제가 불합격으로 판정되었습니다. 한편, 수동 주석 분석에서는 34.1%에 해당하는 249개의 과제가 불합격으로 표시되었습니다. 두 방법을 상호 대조한 결과, OpenAI는 SWE-Bench Pro 과제의 약 30%가 결함을 포함하고 있으며, 이는 지나치게 엄격한 테스트, 부적절한 프롬프트, 좁은 테스트 범위, 오해의 소지가 있는 프롬프트라는 네 가지 범주로 분류된다고 추정합니다.
OpenAI는 또한 전형적인 사례를 공유했습니다. 한 과제는 콘텐츠를 마크다운(Markdown)으로 변환할 때 줄 시작 부분에 공백 하나를 넣도록 요구했으나, 숨겨진 테스트 기준은 공백 두 개를 기대했습니다. 결과적으로, 모델이 명시된 요구 사항을 따랐더라도 오답으로 처리될 수밖에 없었습니다. 이러한 명시적 지침과 숨겨진 요구 사항 간의 불일치는 모델의 실제 능력 평가를 직접적으로 왜곡하며, 합격률이 비합리적으로 급증한 원인을 설명해 줍니다.
채택 권고 철회 및 AI 평가 시스템 재구축 촉구
이러한 분석을 바탕으로 OpenAI는 SWE-Bench Pro 사용에 대한 기존 권고를 공식적으로 철회했습니다. 이 회사는 향후 벤치마크가 인간 개발자를 위해 설계된 테스트 로직을 전용하는 방식이 아니라, 경험이 풍부한 소프트웨어 개발자들이 AI 평가를 위해 특별히 제작해야 한다고 믿습니다. 업계 벤치마크의 과제 중 거의 30%가 결함을 가지고 있다면, AI 평가 시스템 전체의 신뢰성에 의문이 제기될 수밖에 없습니다. 점수 경쟁에서 벗어나 진정한 엔지니어링 역량 평가로 초점을 전환하는 것이 AI 소프트웨어 엔지니어링 평가의 다음 중요한 단계가 될 수 있습니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib





집






