텐센트, ‘WorkBuddy Bench’ 공개: 코드, 웹, 오피스, 보안이 통합된 코딩 지능형 에이전트 테스트 플랫폼
역사적으로 코딩 에이전트는 SWE-bench의 버그 수정이나 Design2Code의 프론트엔드 작업과 같은 좁은 영역으로 제한되어 왔으며, 실제 운영 환경의 벤치마크는 외부 검토가 거의 불가능한 상태였습니다. 텐센트는 최근 arXiv 논문에 상세히 소개된 다중 도메인 평가 스위트인 ‘WorkBuddy Bench’를 통해 이러한 격차를 해소합니다. 이 벤치마크의 가장 큰 특징은 작업량이 아니라, 정답 암기를 방지하기 위해 명시적으로 설계된 아키텍처에 있습니다.
이 벤치마크는 소프트웨어 엔지니어링(리포지토리 수준의 코드), 프론트엔드 개발(웹 아티팩트), 비즈니스 운영(다중 파일 오피스 워크플로우), 사이버 보안(레드팀 및 블루팀 시나리오) 등 네 가지 전문 분야를 다룹니다. 이 평가 스위트는 각각 80개, 70개, 50개, 60개의 과제로 구성되어 총 260개입니다. 중요한 점은, 어떤 과제라도 공개된 문제 은행에서 유래한 것이 아니라는 점입니다. 대신 실제 코드 커밋, 풀 리퀘스트 또는 비즈니스 맥락을 역공학적으로 분석한 후, 이를 간결하고 구어체이며 역할극 형식의 프롬프트로 재구성했습니다. 이러한 접근 방식은 해당 PR이나 커밋 단서에 대한 온라인 검색 결과가 나오지 않도록 하여, 암기식 학습을 효과적으로 차단합니다. 디렉터리, 환경 이미지, 평가 도구, 테스트 케이스 및 참조 솔루션을 포함하여 데이터셋이 완전히 공개되어 있으므로, 데이터셋의 오염 저항성은 모호성에 의존하기보다는 이러한 구성 방법과 버전 관리에 기반을 둡니다.

네 가지 하위 집합 모두 통일된 디렉터리 구조를 공유하지만, 각각 고유한 검증 지표를 사용하므로 하위 집합 간의 점수 직접 비교는 유효하지 않습니다. 따라서 텐센트는 통합 스위트 점수를 공개하지 않습니다. 코드 과제는 숨겨진 테스트 통과율을 통해 평가되며, 웹 과제는 규칙 검사와 LLM/VLM 및 에이전트 평가를 결합하여, 실제 인터넷 접속 없이 지정된 경로를 따라 결과물을 전달해야 합니다. 오피스 과제는 0.70~0.95의 가중치를 적용한 결정론적 규칙 검사와 증거 기반 LLM 평가를 병용하며; 보안 과제는 대규모 모델을 심사관으로 배제하고, 평균값을 산출하기 위해 세 번 실행되는 결정론적 scoring.py 스크립트에 의존합니다. 보안 하위 세트는 리터럴 스캐닝 비활성화, 입력 이름 변경, 변조된 테스트 마스킹, 종속성 인코딩, 가중치가 낮은 미끼 과제 사용 등 5가지 부정행위 방지 계층을 구현합니다. 이 세트에는 38개의 레드팀 과제와 22개의 블루팀 과제가 포함되어 있으며, binutils, curl, nginx의 실제 CVE를 기반으로 한 화이트박스 감사가 포함되어 있습니다.
과제 생성은 소스 수집, 실제 요청으로의 재작성, 작업 공간 조립, 실행 후 평가 자산 격리, 독립적인 디렉터리로의 패키징이라는 표준화된 파이프라인을 따릅니다. 사용자 데이터는 전 과정에서 변경되지 않습니다. 코드 과제는 5가지 별개의 역할(개발자, 알고리즘 엔지니어, 제품 관리자, QA, 운영)을 할당하는 반면, 보안 과제는 전문적인 페르소나를 할당합니다. 의도적으로 불완전한 정보(대상 파일, 패턴, 경계 조건 등)만 제공되어, 수행자가 스스로 맥락을 파악하도록 유도합니다. 채점용 자산은 실행이 완료된 후에만 공개되므로, 수행자가 작업 중에 이를 접할 일이 없도록 보장합니다.
평가는 모델과 샌드박스 환경이 분리된 격리된 컨테이너에서 이루어집니다. 이 프레임워크는 CodeBuddy Code(기본값)와 Claude Code를 활용하며, 추론 노력을 강화하고 20만 단어의 컨텍스트 창을 적용하는 동시에 WebSearch 및 AskUserQuestion 기능을 비활성화합니다. 이러한 제한은 매우 중요합니다. 온라인 검색을 비활성화함으로써 오염 저항 메커니즘이 의도대로 작동하는지 검증할 수 있기 때문입니다.
리더보드에서는 여러 모델 계열을 순위 매깁니다(점수 0–100, 사고 모드, 3가지 평균). Claude Opus4.8은 코드, 웹, 오피스, 보안 부문 전반에서 상위권을 휩쓸며 5개 부문에서 1위를 차지했습니다. GLM-5.2는 두 개의 보안 카테고리에서 선두를 달렸고, GPT-5.5는 오피스 cc 부문에서 1위를 기록했습니다. 이 프레임워크는 특히 보안 분야에서 높은 민감도를 보여주며, 평균 절대 순위 변동 폭이 8.6점에 달합니다. cc 프레임워크 하에서 Claude Opus4.8은 13개의 답변을 거부한 반면, GPT-5.5는 cbc 프레임워크 하에서 2개의 답변만 거부했습니다. 효율성 측면에서, GPT-5.5는 경쟁력 있는 점수를 유지하면서도 가장 적은 토큰을 생성한 반면, DeepSeek-V4-Pro는 높은 토큰 처리량을 바탕으로 44회의 코드 라운드를 수행하여, 더 많은 자원을 소모하는 접근 방식을 보여주었다.
관련 기사
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
무료 웹사이트 구축 방법: 무료 도메인, 호스팅 및 AI 웹사이트 빌더목차서론AI 웹사이트 빌더 1: Hookous AI단계 1: 회원가입단계 2: 비즈니스 유형/니크 선택단계 3: 서비스 선택단계 4: 웹사이트 목표 정의단계 5: 비즈니스 위치 입력단계 6: 고유 판매 포인트 강조단계 7: 연락처 정보 추가단계 8: 디자인 요소 맞춤 설정단계 9: 최종 확정 및 출시AI 웹사이트 빌더 2: Clip.Air 웹사이트 빌더
애플과 구글, 앤트로픽과 손잡고 ‘글래스 윙 프로텍션’을 통해 27년 된 보안 취약점 해결에 나선다
인공지능이 코드 생성 및 논리적 추론 분야에서 급속히 발전함에 따라, 사이버 보안 분야는 전례 없는 도전에 직면해 있습니다. 최근, 저명한 AI 스타트업인 앤트로픽(Anthropic )은 최첨단 AI 모델을 활용해 점점 더 복잡해지는 AI 기반 사이버 공격을 방어하기 위해 **“프로젝트 글래스윙(Project Glasswing)”**이라는 산업 간 협업 프
OpenAI 수석 과학자가 AI 추론 투명성 논쟁에 대해 언급: 복잡성은 일정하게 유지, 급격한 도약은 없어
9월 2일, 오픈AI의 수석 과학자 야쿱 파초키는 X에서 AI 모델 아스트라(Astra)와 관련하여 공개된 우려에 대해 답변하며, 해당 모델이 감독 없이 작동하고 투명한 추론 과정을 결여했다는 주장을 명확히 했습니다.논란이 일어난 이유: 심층 순환이 추론 경로를 흐리게 함이 문제는 인포메이션(The Information)의 상세한 보고서에서 비롯되었습니다. 이 보고서는 오픈AI가 '심층 순환(deep recurrence)' 기술을 실험하고
관련 특별 주제 추천
의견 (0)
0/500
역사적으로 코딩 에이전트는 SWE-bench의 버그 수정이나 Design2Code의 프론트엔드 작업과 같은 좁은 영역으로 제한되어 왔으며, 실제 운영 환경의 벤치마크는 외부 검토가 거의 불가능한 상태였습니다. 텐센트는 최근 arXiv 논문에 상세히 소개된 다중 도메인 평가 스위트인 ‘WorkBuddy Bench’를 통해 이러한 격차를 해소합니다. 이 벤치마크의 가장 큰 특징은 작업량이 아니라, 정답 암기를 방지하기 위해 명시적으로 설계된 아키텍처에 있습니다.
이 벤치마크는 소프트웨어 엔지니어링(리포지토리 수준의 코드), 프론트엔드 개발(웹 아티팩트), 비즈니스 운영(다중 파일 오피스 워크플로우), 사이버 보안(레드팀 및 블루팀 시나리오) 등 네 가지 전문 분야를 다룹니다. 이 평가 스위트는 각각 80개, 70개, 50개, 60개의 과제로 구성되어 총 260개입니다. 중요한 점은, 어떤 과제라도 공개된 문제 은행에서 유래한 것이 아니라는 점입니다. 대신 실제 코드 커밋, 풀 리퀘스트 또는 비즈니스 맥락을 역공학적으로 분석한 후, 이를 간결하고 구어체이며 역할극 형식의 프롬프트로 재구성했습니다. 이러한 접근 방식은 해당 PR이나 커밋 단서에 대한 온라인 검색 결과가 나오지 않도록 하여, 암기식 학습을 효과적으로 차단합니다. 디렉터리, 환경 이미지, 평가 도구, 테스트 케이스 및 참조 솔루션을 포함하여 데이터셋이 완전히 공개되어 있으므로, 데이터셋의 오염 저항성은 모호성에 의존하기보다는 이러한 구성 방법과 버전 관리에 기반을 둡니다.

네 가지 하위 집합 모두 통일된 디렉터리 구조를 공유하지만, 각각 고유한 검증 지표를 사용하므로 하위 집합 간의 점수 직접 비교는 유효하지 않습니다. 따라서 텐센트는 통합 스위트 점수를 공개하지 않습니다. 코드 과제는 숨겨진 테스트 통과율을 통해 평가되며, 웹 과제는 규칙 검사와 LLM/VLM 및 에이전트 평가를 결합하여, 실제 인터넷 접속 없이 지정된 경로를 따라 결과물을 전달해야 합니다. 오피스 과제는 0.70~0.95의 가중치를 적용한 결정론적 규칙 검사와 증거 기반 LLM 평가를 병용하며; 보안 과제는 대규모 모델을 심사관으로 배제하고, 평균값을 산출하기 위해 세 번 실행되는 결정론적 scoring.py 스크립트에 의존합니다. 보안 하위 세트는 리터럴 스캐닝 비활성화, 입력 이름 변경, 변조된 테스트 마스킹, 종속성 인코딩, 가중치가 낮은 미끼 과제 사용 등 5가지 부정행위 방지 계층을 구현합니다. 이 세트에는 38개의 레드팀 과제와 22개의 블루팀 과제가 포함되어 있으며, binutils, curl, nginx의 실제 CVE를 기반으로 한 화이트박스 감사가 포함되어 있습니다.
과제 생성은 소스 수집, 실제 요청으로의 재작성, 작업 공간 조립, 실행 후 평가 자산 격리, 독립적인 디렉터리로의 패키징이라는 표준화된 파이프라인을 따릅니다. 사용자 데이터는 전 과정에서 변경되지 않습니다. 코드 과제는 5가지 별개의 역할(개발자, 알고리즘 엔지니어, 제품 관리자, QA, 운영)을 할당하는 반면, 보안 과제는 전문적인 페르소나를 할당합니다. 의도적으로 불완전한 정보(대상 파일, 패턴, 경계 조건 등)만 제공되어, 수행자가 스스로 맥락을 파악하도록 유도합니다. 채점용 자산은 실행이 완료된 후에만 공개되므로, 수행자가 작업 중에 이를 접할 일이 없도록 보장합니다.
평가는 모델과 샌드박스 환경이 분리된 격리된 컨테이너에서 이루어집니다. 이 프레임워크는 CodeBuddy Code(기본값)와 Claude Code를 활용하며, 추론 노력을 강화하고 20만 단어의 컨텍스트 창을 적용하는 동시에 WebSearch 및 AskUserQuestion 기능을 비활성화합니다. 이러한 제한은 매우 중요합니다. 온라인 검색을 비활성화함으로써 오염 저항 메커니즘이 의도대로 작동하는지 검증할 수 있기 때문입니다.
리더보드에서는 여러 모델 계열을 순위 매깁니다(점수 0–100, 사고 모드, 3가지 평균). Claude Opus4.8은 코드, 웹, 오피스, 보안 부문 전반에서 상위권을 휩쓸며 5개 부문에서 1위를 차지했습니다. GLM-5.2는 두 개의 보안 카테고리에서 선두를 달렸고, GPT-5.5는 오피스 cc 부문에서 1위를 기록했습니다. 이 프레임워크는 특히 보안 분야에서 높은 민감도를 보여주며, 평균 절대 순위 변동 폭이 8.6점에 달합니다. cc 프레임워크 하에서 Claude Opus4.8은 13개의 답변을 거부한 반면, GPT-5.5는 cbc 프레임워크 하에서 2개의 답변만 거부했습니다. 효율성 측면에서, GPT-5.5는 경쟁력 있는 점수를 유지하면서도 가장 적은 토큰을 생성한 반면, DeepSeek-V4-Pro는 높은 토큰 처리량을 바탕으로 44회의 코드 라운드를 수행하여, 더 많은 자원을 소모하는 접근 방식을 보여주었다.
Core Web Vitals를 수정하여 SEO 순위 향상을 위한 방법
무료 웹사이트 구축 방법: 무료 도메인, 호스팅 및 AI 웹사이트 빌더목차서론AI 웹사이트 빌더 1: Hookous AI단계 1: 회원가입단계 2: 비즈니스 유형/니크 선택단계 3: 서비스 선택단계 4: 웹사이트 목표 정의단계 5: 비즈니스 위치 입력단계 6: 고유 판매 포인트 강조단계 7: 연락처 정보 추가단계 8: 디자인 요소 맞춤 설정단계 9: 최종 확정 및 출시AI 웹사이트 빌더 2: Clip.Air 웹사이트 빌더
애플과 구글, 앤트로픽과 손잡고 ‘글래스 윙 프로텍션’을 통해 27년 된 보안 취약점 해결에 나선다
인공지능이 코드 생성 및 논리적 추론 분야에서 급속히 발전함에 따라, 사이버 보안 분야는 전례 없는 도전에 직면해 있습니다. 최근, 저명한 AI 스타트업인 앤트로픽(Anthropic )은 최첨단 AI 모델을 활용해 점점 더 복잡해지는 AI 기반 사이버 공격을 방어하기 위해 **“프로젝트 글래스윙(Project Glasswing)”**이라는 산업 간 협업 프
OpenAI 수석 과학자가 AI 추론 투명성 논쟁에 대해 언급: 복잡성은 일정하게 유지, 급격한 도약은 없어
9월 2일, 오픈AI의 수석 과학자 야쿱 파초키는 X에서 AI 모델 아스트라(Astra)와 관련하여 공개된 우려에 대해 답변하며, 해당 모델이 감독 없이 작동하고 투명한 추론 과정을 결여했다는 주장을 명확히 했습니다.논란이 일어난 이유: 심층 순환이 추론 경로를 흐리게 함이 문제는 인포메이션(The Information)의 상세한 보고서에서 비롯되었습니다. 이 보고서는 오픈AI가 '심층 순환(deep recurrence)' 기술을 실험하고





집






