옵션
뉴스
Microsoft 연구, AI 모델의 소프트웨어 디버깅 한계 드러내다

Microsoft 연구, AI 모델의 소프트웨어 디버깅 한계 드러내다

2025년 7월 19일
174

OpenAI, Anthropic 및 기타 주요 AI 연구소의 AI 모델은 코딩 작업에 점점 더 많이 활용되고 있다. Google CEO Sundar Pichai는 10월에 AI가 회사 내 새로운 코드의 25%를 생성한다고 언급했으며, Meta CEO Mark Zuckerberg는 소셜 미디어 대기업 내에서 AI 코딩 도구를 광범위하게 구현하려고 한다.

그러나 최고 성능의 모델조차도 숙련된 개발자들이 쉽게 처리하는 소프트웨어 버그를 수정하는 데 어려움을 겪는다.

Microsoft의 R&D 부서에서 수행한 최근 Microsoft Research 연구에 따르면, Anthropic의 Claude 3.7 Sonnet과 OpenAI의 o3-mini와 같은 모델은 SWE-bench Lite 소프트웨어 개발 벤치마크에서 많은 문제를 해결하지 못한다. 이 결과는 OpenAI와 같은 기업의 야심찬 주장에도 불구하고 AI가 코딩과 같은 분야에서 인간의 전문성을 아직 따라가지 못한다는 점을 강조한다.

연구진은 Python 디버거를 포함한 디버깅 도구를 갖춘 “단일 프롬프트 기반 에이전트”의 기반으로 9개의 모델을 테스트했다. 이 에이전트는 SWE-bench Lite에서 선별된 300개의 소프트웨어 디버깅 과제를 해결해야 했다.

결과는 고급 모델을 사용했음에도 불구하고 에이전트가 과제의 절반 이상을 성공적으로 해결한 경우가 드물다는 것을 보여주었다. Claude 3.7 Sonnet이 48.4%의 성공률로 선두를 달렸으며, OpenAI의 o1이 30.2%, o3-mini가 22.1%로 뒤를 이었다.

Microsoft AI 디버깅 벤치마크
디버깅 도구로 인해 모델이 얻은 성능 향상을 보여주는 연구의 차트. 이미지 제공: Microsoft

실망스러운 결과의 원인은 무엇일까? 일부 모델은 사용 가능한 디버깅 도구를 효과적으로 사용하거나 특정 문제에 적합한 도구를 식별하는 데 어려움을 겪었다. 연구진에 따르면 주요 문제는 충분한 훈련 데이터, 특히 인간의 디버깅 흔적과 같은 “순차적 의사결정 과정”을 포착한 데이터의 부족이었다.

“우리는 이러한 모델을 훈련시키거나 미세 조정하면 디버깅 능력을 개선할 수 있다고 믿는다,”라고 연구진은 썼다. “그러나 이를 위해서는 에이전트가 디버거와 상호작용하여 정보를 수집한 후 수정안을 제안하는 궤적 데이터와 같은 특수 데이터가 필요하다.”

TechCrunch Sessions: AI 참석

OpenAI, Anthropic, Cohere의 연사들이 참여하는 최고의 AI 산업 행사에 자리를 예약하라. 한정된 시간 동안, 전문가 강연, 워크숍, 네트워킹 기회를 포함한 하루 종일 티켓이 단돈 292달러다.

TechCrunch Sessions: AI에서 전시

TC Sessions: AI에서 1,200명 이상의 의사결정자에게 당신의 작업을 선보일 기회를 예약하라. 전시 기회는 5월 9일까지 또는 테이블이 모두 예약될 때까지 가능하다.

이 결과는 놀랍지 않다. 수많은 연구에서 AI가 생성한 코드는 프로그래밍 논리를 이해하는 약점 때문에 보안 결함과 오류를 종종 초래한다고 보여주었다. 잘 알려진 AI 코딩 도구인 Devin의 최근 테스트에서는 20개의 프로그래밍 작업 중 단지 3개만 완료할 수 있었다.

Microsoft의 연구는 AI 모델이 직면한 이 지속적인 도전에 대한 가장 심층적인 검토 중 하나를 제공한다. AI 기반 코딩 도구에 대한 투자자 관심을 억제할 가능성은 낮지만, 개발자와 그들의 리더들이 코딩 작업에 AI를 크게 의존하는 것을 재고하게 만들 수 있다.

특히, 여러 기술 리더들은 AI가 코딩 직업을 없애줄 것이라는 생각에 반대해 왔다. Microsoft 공동 창립자 Bill Gates, Replit CEO Amjad Masad, Okta CEO Todd McKinnon, IBM CEO Arvind Krishna는 모두 프로그래밍이 직업으로서 지속될 것이라는 자신감을 표명했다.

관련 기사
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다 올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다 진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가 ‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가 이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화 Anthropic, AI 법률 기술 시장에 진출하며 경쟁 심화 Anthropic은 화요일 법률 실무에 자동화된 지원을 제공하기 위해 설계된 일련의 새로운 챗봇 기능을 공개했습니다. 이러한 기능들은 올해 초 도입된 법률 전용 플랫폼인 Claude for Legal을 확장하여, 다양한 법률 분야에 맞춘 전문 법률 플러그인과 MCP 연결자를 추가합니다.이러한 도구들은 법률 AI 분야의 경쟁이 심화되는 시점에 등장했습니다. 3월, 법률 워크플로우를 간소화하기 위해 에이전트 AI를 활용하는 AI 법률 스타트업 하
관련 특별 주제 추천
교육 및 학습 교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼
교사, 과외 교사 및 코호트 기반 학습 프로그램을 위한 AI 퀴즈 빌더 플랫폼

2026년 최신 최고의 AI 퀴즈 빌더 플랫폼: 교사, 튜터 및 코호트 기반 학습 프로그램을 위한! XIX.AI는 실제 테스트를 거쳐 정확한 순위를 제공하는 강력한 게임 체인저 도구들의 최고 평점 목록을 선별했습니다. 이 필수 플랫폼은 모든 학습 시나리오에서 글쓰기 효율성을 높이고, 콘텐츠 제작을 간소화하며, 퀴즈 설계를 단순화하는 데 도움을 줍니다. 지금 탐색하여 교육에서 AI의 이점을 최대한 활용할 수 있는 완벽한 도구를 발견하세요!

13 도구
xix.ai
암호 리팩토링, 버그, 보안 취약점을 처리하는 GitHub 팀을 위한 AI 풀 리퀘스트 검토 도구
리팩토링, 버그, 보안 취약점을 처리하는 GitHub 팀을 위한 AI 풀 리퀘스트 검토 도구

GitHub 팀을 위한 2026년 최신 최고의 AI 풀 리퀘스트 검토 도구가 XIX.AI에 소개되었습니다! 이 엄선된 최고 평점 목록은 모든 팀 워크플로우 전반에 걸쳐 리팩토링, 버그 수정, 보안 취약점 탐지를 효율화해 주는 획기적인 솔루션을 선보입니다. 무료와 유료 버전의 비교 분석은 물론, 실제 테스트 결과와 상세한 순위 정보를 통해 생산성을 획기적으로 높여줄 완벽한 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

12 도구
xix.ai
텍스트 음성 변환 자연스러운 음성 해설을 위한 최고의 AI 텍스트 음성 변환 도구
자연스러운 음성 해설을 위한 최고의 AI 텍스트 음성 변환 도구

2026년 최신 최고 평점을 받은 자연스러운 음성 나레이션을 위한 AI 텍스트 음성 변환 도구가 XIX.AI에 소개됩니다! 이 엄선된 목록에는 실제 테스트를 거쳐 검증되었으며 매주 업데이트되는 순위를 바탕으로, 모든 사용 사례에 선명한 음성을 제공하는 강력하고 획기적인 옵션들이 포함되어 있습니다. 무료 버전과 유료 버전을 비교해 보고, 생산성을 즉시 높여줄 꼭 시도해 봐야 할 솔루션을 찾아보세요. 지금 바로 탐색하여 AI의 경쟁력을 확보하세요!

11 도구
xix.ai
만화 창작 연재 만화 챕터, 표지 및 홍보용 일러스트를 위한 AI 배경 생성기
연재 만화 챕터, 표지 및 홍보용 일러스트를 위한 AI 배경 생성기

2026년 최신 최고의 만화 AI 배경 생성기, 최고 평점 순위 공개! 이 엄선된 컬렉션은 고품질의 챕터 배경, 책 표지, 홍보용 일러스트 제작에 안성맞춤인, 판도를 바꿀 만큼 강력한 도구들을 소개합니다. 모든 옵션은 신뢰성을 보장하기 위해 엄격한 실제 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보와 함께 상세한 분석도 확인해 보세요. 지금 바로 살펴보고 여러분에게 딱 맞는 도구를 찾아, 만화 제작에서 AI의 장점을 최대한 활용해 보세요.

6 도구
xix.ai
이미지 편집 AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진을 깔끔하게 정리하세요
AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진을 깔끔하게 정리하세요

2026년 최신 최고 평점을 받은 AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진에 최적! XIX.AI는 매주 랭킹을 업데이트하며, 판도를 바꿀 만큼 강력한 도구들을 엄선해 제공합니다. 이 도구들은 실제 테스트를 통해 원치 않는 요소를 빠르게 제거하고, 콘텐츠 품질을 높이며, 결과물의 품질을 떨어뜨리지 않으면서도 시간을 대폭 절약할 수 있도록 도와줍니다. AI 창작의 경쟁력을 한 단계 높이고 싶은 분이라면 꼭 사용해 보세요. 지금 바로 확인해 보세요!

10 도구
xix.ai
텍스트 음성 변환 온라인 강좌를 위한 최고의 AI 텍스트 음성 변환 도구
온라인 강좌를 위한 최고의 AI 텍스트 음성 변환 도구

2026년 온라인 강좌용 최신 최고 평점 AI 텍스트 음성 변환 도구는 XIX.AI가 엄격한 실전 테스트와 매주 업데이트되는 순위를 바탕으로 엄선한 것입니다. 이 강력한 도구들은 콘텐츠 제작자가 손쉽게 선명한 오디오 콘텐츠를 제공할 수 있도록 도와주어, 글쓰기 효율을 높이고 강좌 제작 과정을 간소화합니다. 무료 버전과 유료 버전의 비교 정보를 확인하여 본인에게 가장 적합한 도구를 찾아보세요. 지금 바로 살펴보고 온라인 교육 분야에서 AI를 활용한 경쟁력을 확보하세요.

10 도구
xix.ai
의견 (6)
0/500
ThomasScott
ThomasScott 2025년 9월 7일 오후 1시 30분 35초 GMT+09:00

微软这个研究结果太真实了😂 前几天用Copilot改bug,它居然把正确代码改得更错了…看来AI写代码还是得人工把关,至少现阶段别太依赖它们debug。

HenryWalker
HenryWalker 2025년 8월 17일 오후 2시 0분 59초 GMT+09:00

It's wild that AI is pumping out 25% of Google's code, but this Microsoft study shows it's not perfect at debugging. Kinda makes you wonder if we're trusting these models a bit too much too soon. 😅 Anyone else worried about buggy AI code sneaking into big projects?

BrianRoberts
BrianRoberts 2025년 8월 14일 오후 4시 0분 59초 GMT+09:00

It's wild that AI is cranking out 25% of Google's code, but the debugging struggles are real. Makes me wonder if we're leaning too hard on AI without fixing its blind spots first. 🧑‍💻

KevinDavis
KevinDavis 2025년 8월 10일 오전 6시 0분 59초 GMT+09:00

It's wild that AI is pumping out 25% of Google's code, but the debugging limitations in this study make me wonder if we're leaning too hard on these models without enough human oversight. 🤔

PeterThomas
PeterThomas 2025년 8월 1일 오전 11시 48분 18초 GMT+09:00

Interesting read! AI generating 25% of Google's code is wild, but I'm not surprised it struggles with debugging. Machines can churn out code fast, but catching tricky bugs? That’s still a human’s game. 🧑‍💻

JuanWhite
JuanWhite 2025년 7월 23일 오후 1시 59분 29초 GMT+09:00

AI coding sounds cool, but if it can't debug properly, what's the point? 🤔 Feels like we're hyping up half-baked tools while devs still clean up the mess.

OR