옵션
뉴스
텐센트, ‘WorkBuddy Bench’ 공개: 코드, 웹, 오피스, 보안이 통합된 코딩 지능형 에이전트 테스트 플랫폼

텐센트, ‘WorkBuddy Bench’ 공개: 코드, 웹, 오피스, 보안이 통합된 코딩 지능형 에이전트 테스트 플랫폼

2026년 8월 28일
89

역사적으로 코딩 에이전트는 SWE-bench의 버그 수정이나 Design2Code의 프론트엔드 작업과 같은 좁은 영역으로 제한되어 왔으며, 실제 운영 환경의 벤치마크는 외부 검토가 거의 불가능한 상태였습니다. 텐센트는 최근 arXiv 논문에 상세히 소개된 다중 도메인 평가 스위트인 ‘WorkBuddy Bench’를 통해 이러한 격차를 해소합니다. 이 벤치마크의 가장 큰 특징은 작업량이 아니라, 정답 암기를 방지하기 위해 명시적으로 설계된 아키텍처에 있습니다.

이 벤치마크는 소프트웨어 엔지니어링(리포지토리 수준의 코드), 프론트엔드 개발(웹 아티팩트), 비즈니스 운영(다중 파일 오피스 워크플로우), 사이버 보안(레드팀 및 블루팀 시나리오) 등 네 가지 전문 분야를 다룹니다. 이 평가 스위트는 각각 80개, 70개, 50개, 60개의 과제로 구성되어 총 260개입니다. 중요한 점은, 어떤 과제라도 공개된 문제 은행에서 유래한 것이 아니라는 점입니다. 대신 실제 코드 커밋, 풀 리퀘스트 또는 비즈니스 맥락을 역공학적으로 분석한 후, 이를 간결하고 구어체이며 역할극 형식의 프롬프트로 재구성했습니다. 이러한 접근 방식은 해당 PR이나 커밋 단서에 대한 온라인 검색 결과가 나오지 않도록 하여, 암기식 학습을 효과적으로 차단합니다. 디렉터리, 환경 이미지, 평가 도구, 테스트 케이스 및 참조 솔루션을 포함하여 데이터셋이 완전히 공개되어 있으므로, 데이터셋의 오염 저항성은 모호성에 의존하기보다는 이러한 구성 방법과 버전 관리에 기반을 둡니다.

image.png

네 가지 하위 집합 모두 통일된 디렉터리 구조를 공유하지만, 각각 고유한 검증 지표를 사용하므로 하위 집합 간의 점수 직접 비교는 유효하지 않습니다. 따라서 텐센트는 통합 스위트 점수를 공개하지 않습니다. 코드 과제는 숨겨진 테스트 통과율을 통해 평가되며, 웹 과제는 규칙 검사와 LLM/VLM 및 에이전트 평가를 결합하여, 실제 인터넷 접속 없이 지정된 경로를 따라 결과물을 전달해야 합니다. 오피스 과제는 0.70~0.95의 가중치를 적용한 결정론적 규칙 검사와 증거 기반 LLM 평가를 병용하며; 보안 과제는 대규모 모델을 심사관으로 배제하고, 평균값을 산출하기 위해 세 번 실행되는 결정론적 scoring.py 스크립트에 의존합니다. 보안 하위 세트는 리터럴 스캐닝 비활성화, 입력 이름 변경, 변조된 테스트 마스킹, 종속성 인코딩, 가중치가 낮은 미끼 과제 사용 등 5가지 부정행위 방지 계층을 구현합니다. 이 세트에는 38개의 레드팀 과제와 22개의 블루팀 과제가 포함되어 있으며, binutils, curl, nginx의 실제 CVE를 기반으로 한 화이트박스 감사가 포함되어 있습니다.

과제 생성은 소스 수집, 실제 요청으로의 재작성, 작업 공간 조립, 실행 후 평가 자산 격리, 독립적인 디렉터리로의 패키징이라는 표준화된 파이프라인을 따릅니다. 사용자 데이터는 전 과정에서 변경되지 않습니다. 코드 과제는 5가지 별개의 역할(개발자, 알고리즘 엔지니어, 제품 관리자, QA, 운영)을 할당하는 반면, 보안 과제는 전문적인 페르소나를 할당합니다. 의도적으로 불완전한 정보(대상 파일, 패턴, 경계 조건 등)만 제공되어, 수행자가 스스로 맥락을 파악하도록 유도합니다. 채점용 자산은 실행이 완료된 후에만 공개되므로, 수행자가 작업 중에 이를 접할 일이 없도록 보장합니다.

평가는 모델과 샌드박스 환경이 분리된 격리된 컨테이너에서 이루어집니다. 이 프레임워크는 CodeBuddy Code(기본값)와 Claude Code를 활용하며, 추론 노력을 강화하고 20만 단어의 컨텍스트 창을 적용하는 동시에 WebSearch 및 AskUserQuestion 기능을 비활성화합니다. 이러한 제한은 매우 중요합니다. 온라인 검색을 비활성화함으로써 오염 저항 메커니즘이 의도대로 작동하는지 검증할 수 있기 때문입니다.

리더보드에서는 여러 모델 계열을 순위 매깁니다(점수 0–100, 사고 모드, 3가지 평균). Claude Opus4.8은 코드, 웹, 오피스, 보안 부문 전반에서 상위권을 휩쓸며 5개 부문에서 1위를 차지했습니다. GLM-5.2는 두 개의 보안 카테고리에서 선두를 달렸고, GPT-5.5는 오피스 cc 부문에서 1위를 기록했습니다. 이 프레임워크는 특히 보안 분야에서 높은 민감도를 보여주며, 평균 절대 순위 변동 폭이 8.6점에 달합니다. cc 프레임워크 하에서 Claude Opus4.8은 13개의 답변을 거부한 반면, GPT-5.5는 cbc 프레임워크 하에서 2개의 답변만 거부했습니다. 효율성 측면에서, GPT-5.5는 경쟁력 있는 점수를 유지하면서도 가장 적은 토큰을 생성한 반면, DeepSeek-V4-Pro는 높은 토큰 처리량을 바탕으로 44회의 코드 라운드를 수행하여, 더 많은 자원을 소모하는 접근 방식을 보여주었다.

관련 기사
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법 Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법 무료 웹사이트 구축 방법: 무료 도메인, 호스팅 및 AI 웹사이트 빌더목차서론AI 웹사이트 빌더 1: Hookous AI단계 1: 회원가입단계 2: 비즈니스 유형/니크 선택단계 3: 서비스 선택단계 4: 웹사이트 목표 정의단계 5: 비즈니스 위치 입력단계 6: 고유 판매 포인트 강조단계 7: 연락처 정보 추가단계 8: 디자인 요소 맞춤 설정단계 9: 최종 확정 및 출시AI 웹사이트 빌더 2: Clip.Air 웹사이트 빌더
애플과 구글, 앤트로픽과 손잡고 ‘글래스 윙 프로텍션’을 통해 27년 된 보안 취약점 해결에 나선다 애플과 구글, 앤트로픽과 손잡고 ‘글래스 윙 프로텍션’을 통해 27년 된 보안 취약점 해결에 나선다 인공지능이 코드 생성 및 논리적 추론 분야에서 급속히 발전함에 따라, 사이버 보안 분야는 전례 없는 도전에 직면해 있습니다. 최근, 저명한 AI 스타트업인 앤트로픽(Anthropic )은 최첨단 AI 모델을 활용해 점점 더 복잡해지는 AI 기반 사이버 공격을 방어하기 위해 **“프로젝트 글래스윙(Project Glasswing)”**이라는 산업 간 협업 프
OpenAI 수석 과학자가 AI 추론 투명성 논쟁에 대해 언급: 복잡성은 일정하게 유지, 급격한 도약은 없어 OpenAI 수석 과학자가 AI 추론 투명성 논쟁에 대해 언급: 복잡성은 일정하게 유지, 급격한 도약은 없어 9월 2일, 오픈AI의 수석 과학자 야쿱 파초키는 X에서 AI 모델 아스트라(Astra)와 관련하여 공개된 우려에 대해 답변하며, 해당 모델이 감독 없이 작동하고 투명한 추론 과정을 결여했다는 주장을 명확히 했습니다.논란이 일어난 이유: 심층 순환이 추론 경로를 흐리게 함이 문제는 인포메이션(The Information)의 상세한 보고서에서 비롯되었습니다. 이 보고서는 오픈AI가 '심층 순환(deep recurrence)' 기술을 실험하고
관련 특별 주제 추천
이미지 편집 AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진을 깔끔하게 정리하세요
AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진을 깔끔하게 정리하세요

2026년 최신 최고 평점을 받은 AI 물체 제거 편집기: 인물 사진, 여행 사진, 제품 사진에 최적! XIX.AI는 매주 랭킹을 업데이트하며, 판도를 바꿀 만큼 강력한 도구들을 엄선해 제공합니다. 이 도구들은 실제 테스트를 통해 원치 않는 요소를 빠르게 제거하고, 콘텐츠 품질을 높이며, 결과물의 품질을 떨어뜨리지 않으면서도 시간을 대폭 절약할 수 있도록 도와줍니다. AI 창작의 경쟁력을 한 단계 높이고 싶은 분이라면 꼭 사용해 보세요. 지금 바로 확인해 보세요!

10 도구
xix.ai
텍스트 음성 변환 온라인 강좌를 위한 최고의 AI 텍스트 음성 변환 도구
온라인 강좌를 위한 최고의 AI 텍스트 음성 변환 도구

2026년 온라인 강좌용 최신 최고 평점 AI 텍스트 음성 변환 도구는 XIX.AI가 엄격한 실전 테스트와 매주 업데이트되는 순위를 바탕으로 엄선한 것입니다. 이 강력한 도구들은 콘텐츠 제작자가 손쉽게 선명한 오디오 콘텐츠를 제공할 수 있도록 도와주어, 글쓰기 효율을 높이고 강좌 제작 과정을 간소화합니다. 무료 버전과 유료 버전의 비교 정보를 확인하여 본인에게 가장 적합한 도구를 찾아보세요. 지금 바로 살펴보고 온라인 교육 분야에서 AI를 활용한 경쟁력을 확보하세요.

10 도구
xix.ai
글쓰기 더 높은 클릭률(CTR)을 위한 AI 블로그 제목 도구
더 높은 클릭률(CTR)을 위한 AI 블로그 제목 도구

2026년 최신 최고의 상위 평가 AI 블로그 제목 도구로 클릭률 높이기! XIX.AI는 엄격한 실제 테스트를 거친 강력한 게임 체인저 모음의 상위 도구를 신중하게 선별했습니다. 무료 대 유료 비교, 매주 업데이트되는 순위, 블로그 트래픽을 효율적으로 증대하는 데 도움이 되는 상세한 통찰력을 찾을 수 있습니다. AI 경쟁력을 unlocking하는 데 도움이 되는 필수 옵션이 강조되어 있습니다. 지금 탐색하세요!

10 도구
xix.ai
오토메이션 지원 워크플로우를 위한 최고의 AI 업무 배정 도구
지원 워크플로우를 위한 최고의 AI 업무 배정 도구

2026년 지원 워크플로우를 위한 최신 최고 평점의 AI 업무 배정 도구! XIX.AI는 반드시 사용해 봐야 할, 매우 강력하고 판도를 바꿀 만한 솔루션들을 엄선하여 소개합니다. 이 모든 솔루션은 엄격한 실전 테스트를 거쳤으며 매주 업데이트됩니다. 이 도구들은 워크플로우를 간소화하고 생산성을 높여, 팀이 더 빠르고 효율적인 지원을 제공할 수 있도록 돕습니다. 지금 바로 살펴보고 귀사에 딱 맞는 도구를 찾아 AI의 경쟁력을 극대화해 보세요!

17 도구
xix.ai
학술 연구 AI 인용 및 논문 요약 도구
AI 인용 및 논문 요약 도구

XIX.AI가 엄선한 2026년 최신 최고 평점의 AI 인용 및 논문 요약 도구. 빠른 콘텐츠 제작, 글쓰기 효율 향상, 생산성 증대를 위한 획기적인 솔루션을 만나보세요. 무료 버전과 유료 버전의 비교 정보, 실제 테스트 결과, 매주 업데이트되는 순위 정보를 제공하여 여러분의 필요에 완벽하게 맞는, 꼭 사용해 봐야 할 도구를 찾으실 수 있도록 도와드립니다. 지금 바로 탐색하여 AI를 통한 경쟁 우위를 확보하세요.

10 도구
xix.ai
생산력 일상 업무에 최적화된 최고의 AI 생산성 도구들
일상 업무에 최적화된 최고의 AI 생산성 도구들

2026년, 일상 업무에 최적화된 최신의 우수한 인기 AI 생산성 도구들! XIX.AI는 매주 업데이트되는 철저한 순위 체계와 실제 사용 테스트를 바탕으로 획기적인 성능을 자랑하는 도구들을 엄선했습니다. 글쓰기 효율성을 높이고 콘텐츠 제작 과정을 간소화하며, 일상 업무에서 마주하는 다양한 과제를 극복하는 데 도움을 주는 필수 도구들을 만나보실 수 있습니다. 자신의 니즈에 가장 적합한 도구를 찾기 위해 무료 버전과 유료 버전의 비교 정보도 제공됩니다. 지금 바로 확인하여 AI를 활용한 경쟁 우위를 확보해 보세요!

9 도구
xix.ai
의견 (0)
0/500
OR