OpenAIがAIベンチマークを痛烈に批判:問題の3分の1近くが不備、合格率は8ヶ月で80%に急上昇
OpenAIはブログ記事の中で、業界をリードするベンチマークである「SWE-Bench Pro」に公然と異議を唱え、その731の公開テストタスクのうち約30%に評価上の欠陥があると主張した。 Scale AIによって開発されたSWE-Bench Proは、大規模言語モデルやAIエージェントのコーディング能力を評価するために設計されている。実世界の企業開発を忠実に再現し、厳格な不正防止策を講じていることから、AIソフトウェアエンジニアリング分野において広く信頼されているベンチマークとなっている。

OpenAIはブログ記事の中で、重要な兆候として、このベンチマークにおけるトップクラスのモデルの合格率が、わずか8ヶ月で23.3%から80.3%へと急上昇したことを指摘している。このような急速な進歩は不審であり、OpenAIは、このベンチマークではもはやモデルの実世界におけるソフトウェア開発スキルを正確に測定できないと主張している。 この問題は、モデルの能力における真の飛躍ではなく、評価方法そのものの欠陥に起因している可能性が高い。
相互検証された2つのレビュー経路により、タスクの30%近くが「不適格」と判定されたことが明らかになった。
これを検証するため、OpenAIは2つの並行したレビュープロセスを開始した。データポイント分析では、731件の公開タスクのうち200件(27.4%)が不合格と判明した。一方、手動によるアノテーションでは、249件(34.1%)のタスクが不合格と判定された。 両手法を照合した結果、OpenAIはSWE-Bench Proのタスクの約30%に欠陥が含まれていると推定しており、それらは「過度に厳格なテスト」「不適切なプロンプト」「テストカバレッジの狭さ」「誤解を招くプロンプト」という4つのカテゴリーに分類される。
OpenAIは典型的な例も紹介している。あるタスクでは、コンテンツをMarkdownに変換する際に行の先頭にスペースを1つ入れるよう求められていたが、隠れたテスト要件ではスペースを2つ入れることが想定されていた。 その結果、モデルが明示された要件に従ったとしても、不正解と判定されてしまう。このような明示的な指示と隠れた要件との不一致は、モデルの真の実力の評価を直接歪め、合格率の不合理な急上昇を説明している。
採用推奨の撤回とAI評価システムの再構築を求める声
この分析に基づき、OpenAIはSWE-Bench Proの使用を推奨していた以前の勧告を正式に撤回した。同社は、将来のベンチマークは、人間の開発者向けに設計されたテストロジックを流用するのではなく、経験豊富なソフトウェア開発者がAI評価専用に作成すべきであると考えている。 業界標準のベンチマークのタスクの30%近くが欠陥を抱えている場合、AI評価システム全体の信頼性が疑問視されることになる。スコア追求型のコンテストから、真のエンジニアリング能力の評価へと焦点を移すことが、AIソフトウェアエンジニアリング評価における次の重要な一歩となるかもしれない。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
OpenAIはブログ記事の中で、業界をリードするベンチマークである「SWE-Bench Pro」に公然と異議を唱え、その731の公開テストタスクのうち約30%に評価上の欠陥があると主張した。 Scale AIによって開発されたSWE-Bench Proは、大規模言語モデルやAIエージェントのコーディング能力を評価するために設計されている。実世界の企業開発を忠実に再現し、厳格な不正防止策を講じていることから、AIソフトウェアエンジニアリング分野において広く信頼されているベンチマークとなっている。

OpenAIはブログ記事の中で、重要な兆候として、このベンチマークにおけるトップクラスのモデルの合格率が、わずか8ヶ月で23.3%から80.3%へと急上昇したことを指摘している。このような急速な進歩は不審であり、OpenAIは、このベンチマークではもはやモデルの実世界におけるソフトウェア開発スキルを正確に測定できないと主張している。 この問題は、モデルの能力における真の飛躍ではなく、評価方法そのものの欠陥に起因している可能性が高い。
相互検証された2つのレビュー経路により、タスクの30%近くが「不適格」と判定されたことが明らかになった。
これを検証するため、OpenAIは2つの並行したレビュープロセスを開始した。データポイント分析では、731件の公開タスクのうち200件(27.4%)が不合格と判明した。一方、手動によるアノテーションでは、249件(34.1%)のタスクが不合格と判定された。 両手法を照合した結果、OpenAIはSWE-Bench Proのタスクの約30%に欠陥が含まれていると推定しており、それらは「過度に厳格なテスト」「不適切なプロンプト」「テストカバレッジの狭さ」「誤解を招くプロンプト」という4つのカテゴリーに分類される。
OpenAIは典型的な例も紹介している。あるタスクでは、コンテンツをMarkdownに変換する際に行の先頭にスペースを1つ入れるよう求められていたが、隠れたテスト要件ではスペースを2つ入れることが想定されていた。 その結果、モデルが明示された要件に従ったとしても、不正解と判定されてしまう。このような明示的な指示と隠れた要件との不一致は、モデルの真の実力の評価を直接歪め、合格率の不合理な急上昇を説明している。
採用推奨の撤回とAI評価システムの再構築を求める声
この分析に基づき、OpenAIはSWE-Bench Proの使用を推奨していた以前の勧告を正式に撤回した。同社は、将来のベンチマークは、人間の開発者向けに設計されたテストロジックを流用するのではなく、経験豊富なソフトウェア開発者がAI評価専用に作成すべきであると考えている。 業界標準のベンチマークのタスクの30%近くが欠陥を抱えている場合、AI評価システム全体の信頼性が疑問視されることになる。スコア追求型のコンテストから、真のエンジニアリング能力の評価へと焦点を移すことが、AIソフトウェアエンジニアリング評価における次の重要な一歩となるかもしれない。
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






