テンセント、「WorkBuddy Bench」を発表:コード、Web、Office、セキュリティを統合したコーディングAIエージェントのテスト環境
これまで、コーディングエージェントは、SWE-benchでのバグ修正やDesign2Codeでのフロントエンドタスクなど、狭い領域に限定されてきた一方で、実運用環境のベンチマークについては、外部からの検証がほぼ不可能な状態が続いていました。 テンセントは、最近のarXiv論文で詳述されたマルチドメイン評価スイート「WorkBuddy Bench」を用いて、このギャップに対処しています。その最大の特徴はタスクの量ではなく、解答の暗記を防止するために明示的に設計されたアーキテクチャにあります。
このベンチマークは、ソフトウェアエンジニアリング(リポジトリレベルのコード)、フロントエンド開発(Webアーティファクト)、業務運営(複数ファイルにわたるオフィスワークフロー)、サイバーセキュリティ(レッドチームおよびブルーチームのシナリオ)という4つの専門分野を網羅しています。 このスイートは、それぞれ80、70、50、60のタスクで構成され、合計260タスクとなる。 重要な点として、どのタスクも公開されている問題バンクに由来するものではなく、実際のコードコミット、プルリクエスト、あるいはビジネスコンテキストからリバースエンジニアリングされ、簡潔で口語的なロールプレイ形式のプロンプトに言い換えられています。 このアプローチにより、対応するプルリクエストやコミットの手がかりをオンラインで検索しても結果が得られなくなり、暗記を効果的に阻止します。ディレクトリ、環境イメージ、評価ツール、テストケース、参照ソリューションを含むデータセットは完全に公開されているため、その汚染耐性は、隠蔽性ではなく、この構築方法とバージョン管理に依存しています。

4つのサブセットはすべて統一されたディレクトリ構造を共有していますが、それぞれが異なる検証指標を採用しているため、サブセット間の直接的なスコア比較は無効となります。 その結果、テンセントは総合的なスイートスコアを公開していません。コードタスクは非公開のテスト合格率によって評価されます。ウェブタスクは、ルールチェックとLLM/VLMおよびエージェント評価を組み合わせたもので、インターネットへのライブアクセスなしに、指定されたパスに沿って成果物を納品することが求められます。 オフィスタスクでは、0.70~0.95の重み付けがされた決定論的ルールチェックと、証拠に基づくLLM評価を併用します。また、セキュリティタスクでは、大規模モデルを審査員から除外し、平均値を算出するために3回実行される決定論的なscoring.pyスクリプトに依存しています。 セキュリティサブセットでは、5つの不正防止層が実装されています。具体的には、リテラルスキャンの無効化、入力の名前変更、改ざんされたテストのマスキング、依存関係のエンコード、および重みの低いおとりタスクの使用です。 これには、38のレッドチームタスクと22のブルーチームタスクが含まれており、binutils、curl、nginxにおける実在のCVEに基づいたホワイトボックス監査が含まれています。
タスクの作成は、ソースの収集、正規のリクエストへの書き換え、ワークスペースの構築、実行後の評価アセットの隔離、独立したディレクトリへのパッケージ化という標準化されたパイプラインに従います。ユーザーデータは全工程を通じて変更されません。コードタスクでは5つの異なる役割(開発者、アルゴリズムエンジニア、プロダクトマネージャー、QA、運用)が割り当てられ、セキュリティタスクでは専門家のペルソナが割り当てられます。 意図的に不完全な情報(ターゲットファイル、パターン、境界条件は伏せられている)が提供され、エージェントが独自にコンテキストを取得するよう促します。採点対象のアセットは実行後にのみ開示されるため、エージェントが操作中にそれらに遭遇することはありません。
評価は、モデル環境とサンドボックス環境が分離された隔離されたコンテナ内で行われます。このフレームワークは、CodeBuddy Code(デフォルト)とClaude Codeを利用しており、推論の努力度を高め、20万文字のコンテキストウィンドウを採用する一方で、WebSearchとAskUserQuestionを無効化しています。この制限は極めて重要です。オンライン検索を無効化することで、汚染耐性メカニズムが意図した通りに機能しているかどうかを検証できるからです。
リーダーボードでは、複数のモデルファミリーがランク付けされる(スコア0~100、思考モード、3つの平均値)。Claude Opus4.8は、コード、ウェブ、オフィス、セキュリティの各カテゴリで上位を独占し、5つの1位を獲得した。GLM-5.2は2つのセキュリティカテゴリで首位に立ち、GPT-5.5はオフィスccカテゴリで1位となった。 このフレームワークは、特にセキュリティ分野において高い感度を示しており、平均絶対順位変動は8.6ポイントに達しています。ccフレームワーク下では、Claude Opus4.8が13件の回答を拒否したのに対し、cbc下でのGPT-5.5の拒否件数は2件でした。 効率性に関しては、GPT-5.5は競争力のあるスコアを維持しつつ生成トークン数が最も少ない一方、DeepSeek-V4-Proは高いトークンスループットで44回のコードラウンドを実行しており、よりリソースを多用するアプローチを採用していることがうかがえる。
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (0)
0/500
これまで、コーディングエージェントは、SWE-benchでのバグ修正やDesign2Codeでのフロントエンドタスクなど、狭い領域に限定されてきた一方で、実運用環境のベンチマークについては、外部からの検証がほぼ不可能な状態が続いていました。 テンセントは、最近のarXiv論文で詳述されたマルチドメイン評価スイート「WorkBuddy Bench」を用いて、このギャップに対処しています。その最大の特徴はタスクの量ではなく、解答の暗記を防止するために明示的に設計されたアーキテクチャにあります。
このベンチマークは、ソフトウェアエンジニアリング(リポジトリレベルのコード)、フロントエンド開発(Webアーティファクト)、業務運営(複数ファイルにわたるオフィスワークフロー)、サイバーセキュリティ(レッドチームおよびブルーチームのシナリオ)という4つの専門分野を網羅しています。 このスイートは、それぞれ80、70、50、60のタスクで構成され、合計260タスクとなる。 重要な点として、どのタスクも公開されている問題バンクに由来するものではなく、実際のコードコミット、プルリクエスト、あるいはビジネスコンテキストからリバースエンジニアリングされ、簡潔で口語的なロールプレイ形式のプロンプトに言い換えられています。 このアプローチにより、対応するプルリクエストやコミットの手がかりをオンラインで検索しても結果が得られなくなり、暗記を効果的に阻止します。ディレクトリ、環境イメージ、評価ツール、テストケース、参照ソリューションを含むデータセットは完全に公開されているため、その汚染耐性は、隠蔽性ではなく、この構築方法とバージョン管理に依存しています。

4つのサブセットはすべて統一されたディレクトリ構造を共有していますが、それぞれが異なる検証指標を採用しているため、サブセット間の直接的なスコア比較は無効となります。 その結果、テンセントは総合的なスイートスコアを公開していません。コードタスクは非公開のテスト合格率によって評価されます。ウェブタスクは、ルールチェックとLLM/VLMおよびエージェント評価を組み合わせたもので、インターネットへのライブアクセスなしに、指定されたパスに沿って成果物を納品することが求められます。 オフィスタスクでは、0.70~0.95の重み付けがされた決定論的ルールチェックと、証拠に基づくLLM評価を併用します。また、セキュリティタスクでは、大規模モデルを審査員から除外し、平均値を算出するために3回実行される決定論的なscoring.pyスクリプトに依存しています。 セキュリティサブセットでは、5つの不正防止層が実装されています。具体的には、リテラルスキャンの無効化、入力の名前変更、改ざんされたテストのマスキング、依存関係のエンコード、および重みの低いおとりタスクの使用です。 これには、38のレッドチームタスクと22のブルーチームタスクが含まれており、binutils、curl、nginxにおける実在のCVEに基づいたホワイトボックス監査が含まれています。
タスクの作成は、ソースの収集、正規のリクエストへの書き換え、ワークスペースの構築、実行後の評価アセットの隔離、独立したディレクトリへのパッケージ化という標準化されたパイプラインに従います。ユーザーデータは全工程を通じて変更されません。コードタスクでは5つの異なる役割(開発者、アルゴリズムエンジニア、プロダクトマネージャー、QA、運用)が割り当てられ、セキュリティタスクでは専門家のペルソナが割り当てられます。 意図的に不完全な情報(ターゲットファイル、パターン、境界条件は伏せられている)が提供され、エージェントが独自にコンテキストを取得するよう促します。採点対象のアセットは実行後にのみ開示されるため、エージェントが操作中にそれらに遭遇することはありません。
評価は、モデル環境とサンドボックス環境が分離された隔離されたコンテナ内で行われます。このフレームワークは、CodeBuddy Code(デフォルト)とClaude Codeを利用しており、推論の努力度を高め、20万文字のコンテキストウィンドウを採用する一方で、WebSearchとAskUserQuestionを無効化しています。この制限は極めて重要です。オンライン検索を無効化することで、汚染耐性メカニズムが意図した通りに機能しているかどうかを検証できるからです。
リーダーボードでは、複数のモデルファミリーがランク付けされる(スコア0~100、思考モード、3つの平均値)。Claude Opus4.8は、コード、ウェブ、オフィス、セキュリティの各カテゴリで上位を独占し、5つの1位を獲得した。GLM-5.2は2つのセキュリティカテゴリで首位に立ち、GPT-5.5はオフィスccカテゴリで1位となった。 このフレームワークは、特にセキュリティ分野において高い感度を示しており、平均絶対順位変動は8.6ポイントに達しています。ccフレームワーク下では、Claude Opus4.8が13件の回答を拒否したのに対し、cbc下でのGPT-5.5の拒否件数は2件でした。 効率性に関しては、GPT-5.5は競争力のあるスコアを維持しつつ生成トークン数が最も少ない一方、DeepSeek-V4-Proは高いトークンスループットで44回のコードラウンドを実行しており、よりリソースを多用するアプローチを採用していることがうかがえる。
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A





家






