新たなベンチマークがAIエージェントの職場適応性を問う
約2年前、マイクロソフトのサティア・ナデラCEOは、AIが知識労働——弁護士、投資銀行家、司書、会計士、IT専門家、および類似のホワイトカラー職種の領域——を再構築すると予測した。
しかし、基盤モデルの著しい進歩にもかかわらず、知識労働の変革は遅々として進んでいない。モデルは深い研究や主体的な計画立案に優れているが、ほとんどのホワイトカラー職種の混乱は比較的少ない。その理由は依然として不明である。
これはAIの大きな謎の一つだ。トレーニングデータ分野のリーダーであるMercor社の新たな研究が、重要な知見を提供している。
本研究は、コンサルティング、投資銀行、法律分野における実際のホワイトカラー業務を最先端AIモデルがどう処理するかを評価した。これにより「APEX-Agents」ベンチマークが作成されたが、現状では全てのAI研究所が失敗している。実際の専門家からの質問に対して、最良のモデルでさえ正答率は4分の1未満。大半は誤答か無回答に終わっている。
研究に貢献したMercorのブレンダン・フーディCEOによれば、モデルの主な弱点は複数分野にまたがる情報の統合能力——これは人間の知識労働の中核をなす要素だ。
「このベンチマークの重要な革新点は、実際の専門サービス業をモデル化した完全な環境を構築したことです」とフーディ氏はTechCrunchに説明した。「私たちの仕事は、誰かが全ての文脈を一箇所で提供してくれるわけではありません。現実には、SlackやGoogle Drive、その他様々なツールを横断して業務を行うのです」。多くのエージェント型AIモデルにとって、この種の領域横断的推論は依然として一貫性を欠いている。

スクリーンショット テストシナリオは、Mercorの専門家マーケットプレイスに登録する実際のプロフェッショナルから提供された。彼らがクエリを設計し、正解の基準を定義した。Hugging Faceで公開されている質問を確認すると、これらのタスクの複雑さが明らかになる。
Techcrunchイベント Disrupt 2026 チケット:期間限定オファー
チケット発売中!期間限定で最大680ドルお得に、さらに先着500名様限定で同伴者パスが50%オフ。TechCrunch Disruptでは、Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Faceなどからトップリーダーが集結。250以上のセッションで成長を促進し、競争優位性を高めます。 数百の革新的なスタートアップと交流し、取引・知見・インスピレーションを生み出す厳選ネットワーキングに参加しましょう。
Disrupt 2026 チケット:期間限定オファー
チケット発売中!期間限定で最大680ドルお得に。先着500名様に限り、同伴者パスが50%オフ。TechCrunch Disruptでは、Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Faceなどからトップリーダーが集結。250以上のセッションで成長を促進し、競争優位性を高めます。 数百の革新的なスタートアップとつながり、取引・知見・インスピレーションを生み出す厳選ネットワーキングに参加しましょう。
サンフランシスコ | 2026年10月13日~15日 今すぐ登録 「法律」セクションの一例:
EU域内における生産システム障害発生後48分以内に、ノーススターのエンジニアリングチームが個人データを含むEU生産イベントログのバンドルデータを1~2セット、米国アナリティクスベンダーへエクスポートしました…ノーススターの社内ポリシーに基づき、この1~2回のログエクスポートをEU規則第49条に準拠していると合理的に扱えるでしょうか?
正解は「はい」だが、その結論に至るには、同社の内部ポリシーと関連するEUプライバシー規制の両方について詳細な分析が必要となる。
このような質問は知識豊富な人間でも難問となるが、研究者らは実際の専門業務をシミュレートすることを目指した。こうした問い合わせに確実に回答できる大規模言語モデル(LLM)は、多くの実務弁護士を代替する可能性がある。「これは間違いなく現代で最も重要な経済的課題だ」とフーディはテッククランチに語った。「このベンチマークは、専門家が実際に行う業務を正確に反映している」
OpenAIは以前、GDPvalベンチマークで専門スキルを測定しようとしたが、APEX-Agentsテストは本質的に異なる。GDPvalが幅広い分野の一般知識を評価するのに対し、APEX-Agentsは選りすぐられた高付加価値職業数種において持続的なタスクを実行するシステムの能力を測定する。これによりモデルにとってより困難な課題となり、仕事の自動化可能性への関連性がより直接的になる。
現時点で投資銀行業務を代替できるモデルは存在しないものの、明らかに他モデルより接近した結果を示したモデルもある。Gemini 3 Flashが24%のワンショット精度で首位に立ち、GPT-5.2が23%で僅差で続いた。Opus 4.5、Gemini 3 Pro、GPT-5はいずれも約18%のスコアだった。
これらの初期結果は期待外れではあるが、AI分野は困難なベンチマークを急速に克服する実績がある。APEX-Agentsテストが公開されたことで、改善が可能と確信するAI研究所への挑戦状が提示された。Foodyは今後数ヶ月でこの結果が実現すると完全に予測している。
「進歩のペースは驚くほど速い」と彼はTechCrunchに語った。「現時点では、この技術を『4分の1の確率で正解するインターン』に例えるのが妥当だが、昨年は『5~10%の確率で成功するインターン』だった。この年率の進歩は、非常に短期間で大きな影響を生み出す可能性がある」
関連記事
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (0)
0/500
約2年前、マイクロソフトのサティア・ナデラCEOは、AIが知識労働——弁護士、投資銀行家、司書、会計士、IT専門家、および類似のホワイトカラー職種の領域——を再構築すると予測した。
しかし、基盤モデルの著しい進歩にもかかわらず、知識労働の変革は遅々として進んでいない。モデルは深い研究や主体的な計画立案に優れているが、ほとんどのホワイトカラー職種の混乱は比較的少ない。その理由は依然として不明である。
これはAIの大きな謎の一つだ。トレーニングデータ分野のリーダーであるMercor社の新たな研究が、重要な知見を提供している。
本研究は、コンサルティング、投資銀行、法律分野における実際のホワイトカラー業務を最先端AIモデルがどう処理するかを評価した。これにより「APEX-Agents」ベンチマークが作成されたが、現状では全てのAI研究所が失敗している。実際の専門家からの質問に対して、最良のモデルでさえ正答率は4分の1未満。大半は誤答か無回答に終わっている。
研究に貢献したMercorのブレンダン・フーディCEOによれば、モデルの主な弱点は複数分野にまたがる情報の統合能力——これは人間の知識労働の中核をなす要素だ。
「このベンチマークの重要な革新点は、実際の専門サービス業をモデル化した完全な環境を構築したことです」とフーディ氏はTechCrunchに説明した。「私たちの仕事は、誰かが全ての文脈を一箇所で提供してくれるわけではありません。現実には、SlackやGoogle Drive、その他様々なツールを横断して業務を行うのです」。多くのエージェント型AIモデルにとって、この種の領域横断的推論は依然として一貫性を欠いている。

テストシナリオは、Mercorの専門家マーケットプレイスに登録する実際のプロフェッショナルから提供された。彼らがクエリを設計し、正解の基準を定義した。Hugging Faceで公開されている質問を確認すると、これらのタスクの複雑さが明らかになる。
TechcrunchイベントDisrupt 2026 チケット:期間限定オファー
チケット発売中!期間限定で最大680ドルお得に、さらに先着500名様限定で同伴者パスが50%オフ。TechCrunch Disruptでは、Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Faceなどからトップリーダーが集結。250以上のセッションで成長を促進し、競争優位性を高めます。 数百の革新的なスタートアップと交流し、取引・知見・インスピレーションを生み出す厳選ネットワーキングに参加しましょう。
Disrupt 2026 チケット:期間限定オファー
チケット発売中!期間限定で最大680ドルお得に。先着500名様に限り、同伴者パスが50%オフ。TechCrunch Disruptでは、Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Faceなどからトップリーダーが集結。250以上のセッションで成長を促進し、競争優位性を高めます。 数百の革新的なスタートアップとつながり、取引・知見・インスピレーションを生み出す厳選ネットワーキングに参加しましょう。
サンフランシスコ | 2026年10月13日~15日 今すぐ登録「法律」セクションの一例:
EU域内における生産システム障害発生後48分以内に、ノーススターのエンジニアリングチームが個人データを含むEU生産イベントログのバンドルデータを1~2セット、米国アナリティクスベンダーへエクスポートしました…ノーススターの社内ポリシーに基づき、この1~2回のログエクスポートをEU規則第49条に準拠していると合理的に扱えるでしょうか?
正解は「はい」だが、その結論に至るには、同社の内部ポリシーと関連するEUプライバシー規制の両方について詳細な分析が必要となる。
このような質問は知識豊富な人間でも難問となるが、研究者らは実際の専門業務をシミュレートすることを目指した。こうした問い合わせに確実に回答できる大規模言語モデル(LLM)は、多くの実務弁護士を代替する可能性がある。「これは間違いなく現代で最も重要な経済的課題だ」とフーディはテッククランチに語った。「このベンチマークは、専門家が実際に行う業務を正確に反映している」
OpenAIは以前、GDPvalベンチマークで専門スキルを測定しようとしたが、APEX-Agentsテストは本質的に異なる。GDPvalが幅広い分野の一般知識を評価するのに対し、APEX-Agentsは選りすぐられた高付加価値職業数種において持続的なタスクを実行するシステムの能力を測定する。これによりモデルにとってより困難な課題となり、仕事の自動化可能性への関連性がより直接的になる。
現時点で投資銀行業務を代替できるモデルは存在しないものの、明らかに他モデルより接近した結果を示したモデルもある。Gemini 3 Flashが24%のワンショット精度で首位に立ち、GPT-5.2が23%で僅差で続いた。Opus 4.5、Gemini 3 Pro、GPT-5はいずれも約18%のスコアだった。
これらの初期結果は期待外れではあるが、AI分野は困難なベンチマークを急速に克服する実績がある。APEX-Agentsテストが公開されたことで、改善が可能と確信するAI研究所への挑戦状が提示された。Foodyは今後数ヶ月でこの結果が実現すると完全に予測している。
「進歩のペースは驚くほど速い」と彼はTechCrunchに語った。「現時点では、この技術を『4分の1の確率で正解するインターン』に例えるのが妥当だが、昨年は『5~10%の確率で成功するインターン』だった。この年率の進歩は、非常に短期間で大きな影響を生み出す可能性がある」
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始





家






