オプション
ニュース
テンセント、「WorkBuddy Bench」を発表:コード、Web、Office、セキュリティを統合したコーディングAIエージェントのテスト環境

テンセント、「WorkBuddy Bench」を発表:コード、Web、Office、セキュリティを統合したコーディングAIエージェントのテスト環境

2026年8月28日
93

これまで、コーディングエージェントは、SWE-benchでのバグ修正やDesign2Codeでのフロントエンドタスクなど、狭い領域に限定されてきた一方で、実運用環境のベンチマークについては、外部からの検証がほぼ不可能な状態が続いていました。 テンセントは、最近のarXiv論文で詳述されたマルチドメイン評価スイート「WorkBuddy Bench」を用いて、このギャップに対処しています。その最大の特徴はタスクの量ではなく、解答の暗記を防止するために明示的に設計されたアーキテクチャにあります。

このベンチマークは、ソフトウェアエンジニアリング(リポジトリレベルのコード)、フロントエンド開発(Webアーティファクト)、業務運営(複数ファイルにわたるオフィスワークフロー)、サイバーセキュリティ(レッドチームおよびブルーチームのシナリオ)という4つの専門分野を網羅しています。 このスイートは、それぞれ80、70、50、60のタスクで構成され、合計260タスクとなる。 重要な点として、どのタスクも公開されている問題バンクに由来するものではなく、実際のコードコミット、プルリクエスト、あるいはビジネスコンテキストからリバースエンジニアリングされ、簡潔で口語的なロールプレイ形式のプロンプトに言い換えられています。 このアプローチにより、対応するプルリクエストやコミットの手がかりをオンラインで検索しても結果が得られなくなり、暗記を効果的に阻止します。ディレクトリ、環境イメージ、評価ツール、テストケース、参照ソリューションを含むデータセットは完全に公開されているため、その汚染耐性は、隠蔽性ではなく、この構築方法とバージョン管理に依存しています。

image.png

4つのサブセットはすべて統一されたディレクトリ構造を共有していますが、それぞれが異なる検証指標を採用しているため、サブセット間の直接的なスコア比較は無効となります。 その結果、テンセントは総合的なスイートスコアを公開していません。コードタスクは非公開のテスト合格率によって評価されます。ウェブタスクは、ルールチェックとLLM/VLMおよびエージェント評価を組み合わせたもので、インターネットへのライブアクセスなしに、指定されたパスに沿って成果物を納品することが求められます。 オフィスタスクでは、0.70~0.95の重み付けがされた決定論的ルールチェックと、証拠に基づくLLM評価を併用します。また、セキュリティタスクでは、大規模モデルを審査員から除外し、平均値を算出するために3回実行される決定論的なscoring.pyスクリプトに依存しています。 セキュリティサブセットでは、5つの不正防止層が実装されています。具体的には、リテラルスキャンの無効化、入力の名前変更、改ざんされたテストのマスキング、依存関係のエンコード、および重みの低いおとりタスクの使用です。 これには、38のレッドチームタスクと22のブルーチームタスクが含まれており、binutils、curl、nginxにおける実在のCVEに基づいたホワイトボックス監査が含まれています。

タスクの作成は、ソースの収集、正規のリクエストへの書き換え、ワークスペースの構築、実行後の評価アセットの隔離、独立したディレクトリへのパッケージ化という標準化されたパイプラインに従います。ユーザーデータは全工程を通じて変更されません。コードタスクでは5つの異なる役割(開発者、アルゴリズムエンジニア、プロダクトマネージャー、QA、運用)が割り当てられ、セキュリティタスクでは専門家のペルソナが割り当てられます。 意図的に不完全な情報(ターゲットファイル、パターン、境界条件は伏せられている)が提供され、エージェントが独自にコンテキストを取得するよう促します。採点対象のアセットは実行後にのみ開示されるため、エージェントが操作中にそれらに遭遇することはありません。

評価は、モデル環境とサンドボックス環境が分離された隔離されたコンテナ内で行われます。このフレームワークは、CodeBuddy Code(デフォルト)とClaude Codeを利用しており、推論の努力度を高め、20万文字のコンテキストウィンドウを採用する一方で、WebSearchとAskUserQuestionを無効化しています。この制限は極めて重要です。オンライン検索を無効化することで、汚染耐性メカニズムが意図した通りに機能しているかどうかを検証できるからです。

リーダーボードでは、複数のモデルファミリーがランク付けされる(スコア0~100、思考モード、3つの平均値)。Claude Opus4.8は、コード、ウェブ、オフィス、セキュリティの各カテゴリで上位を独占し、5つの1位を獲得した。GLM-5.2は2つのセキュリティカテゴリで首位に立ち、GPT-5.5はオフィスccカテゴリで1位となった。 このフレームワークは、特にセキュリティ分野において高い感度を示しており、平均絶対順位変動は8.6ポイントに達しています。ccフレームワーク下では、Claude Opus4.8が13件の回答を拒否したのに対し、cbc下でのGPT-5.5の拒否件数は2件でした。 効率性に関しては、GPT-5.5は競争力のあるスコアを維持しつつ生成トークン数が最も少ない一方、DeepSeek-V4-Proは高いトークンスループットで44回のコードラウンドを実行しており、よりリソースを多用するアプローチを採用していることがうかがえる。

関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト 『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法 Core Web Vitalsを修正してSEOランキングを向上させる方法 AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
プロンプト ChatGPTワークフローに最適なAIプロンプトライブラリ
ChatGPTワークフローに最適なAIプロンプトライブラリ

2026年版:あらゆる種類のChatGPTワークフローを最適化するための、最新かつ最高評価のAIプロンプトライブラリ。XIX.AIは、最高のパフォーマンスを保証するために厳格な実環境テストを経た、強力で画期的なコレクションを厳選しました。 無料版と有料版の詳細な比較や専門家によるランキングを参考に、生産性を高め、AIの真の力を引き出す「必試」ツールを選んでください。今すぐチェックしましょう!

11 ツール
xix.ai
コメント (0)
0/500
OR