オプション
ニュース
ai '推論モデルのサージ、ベンチマークコストを押し上げます

ai '推論モデルのサージ、ベンチマークコストを押し上げます

2025年4月22日
219

ai '推論モデルのサージ、ベンチマークコストを押し上げます

AI推論モデルのベンチマークコストの上昇

OpenAIなどのAIラボは、複雑な問題を段階的に解決するように設計された先進的な「推論」AIモデルを宣伝しています。これらのモデルは、特に物理学などの分野で非常に効果的で、確かに印象的です。しかし、ベンチマークを行う際には高額なコストがかかり、その能力を独立して検証することが困難になっています。

第三者のAIテスト企業であるArtificial Analysisのデータによると、OpenAIのo1推論モデルを7つの人気AIベンチマークで評価するコストは驚くべきことに2,767.05ドルです。これらのベンチマークには、MMLU-Pro、GPQA Diamond、Humanity’s Last Exam、LiveCodeBench、SciCode、AIME 2024、MATH-500が含まれます。一方、Anthropicの「ハイブリッド」推論モデルであるClaude 3.7 Sonnetを同じテストでベンチマークしたコストは1,485.35ドルで、OpenAIのo3-mini-highは344.59ドルと大幅に安価でした。

すべての推論モデルが同じようにテストに高額な費用がかかるわけではありません。たとえば、Artificial AnalysisはOpenAIのo1-miniの評価に141.22ドルしか費やしていません。しかし、これらのモデルのコストは平均して高額になる傾向があります。Artificial Analysisは約12の推論モデルの評価に約5,200ドルを費やしており、これは80以上の非推論モデルの分析に費やした2,400ドルのほぼ2倍です。

比較として、2024年5月にリリースされたOpenAIの非推論GPT-4oモデルの評価には、Artificial Analysisは108.85ドルしかかからず、Claude 3.7 Sonnetの非推論の前モデルであるClaude 3.6 Sonnetは81.41ドルでした。

Artificial Analysisの共同創業者であるGeorge Cameronは、TechCrunchに対し、AIラボが推論モデルの開発を続けるにつれてベンチマーク予算を増やす準備ができていると述べました。「Artificial Analysisでは、毎月数百の評価を行い、これにかなりの予算を割いています」とCameronは述べています。「モデルがより頻繁にリリースされるにつれて、この支出が増える予定です。」

Artificial Analysisだけがこのコスト上昇に直面しているわけではありません。AIスタートアップGeneral ReasoningのCEOであるRoss Taylorは、最近、Claude 3.7 Sonnetを約3,700のユニークなプロンプトで評価するのに580ドルを費やしました。Taylorは、言語理解をテストするために設計されたベンチマークであるMMLU Proの1回の実行には1,800ドルを超えると見積もっています。

Taylorは最近のXの投稿で懸念を強調し、「私たちは、ラボがベンチマークでx%を報告し、yの計算量を費やす世界に移行していますが、学術研究者のリソースはyよりもはるかに少ないです。誰もその結果を再現できなくなるでしょう。」と述べました。

なぜ推論モデルのベンチマークは高額なのか?

推論モデルのテストが高額になる主な理由は、大量のトークンを生成する傾向があるためです。トークンは生のテキストの単位で、たとえば「fantastic」という単語は「fan」「tas」「tic」に分解される可能性があります。Artificial Analysisによると、OpenAIのo1モデルはテスト中に4,400万以上のトークンを生成し、これは非推論のGPT-4oモデルが生成したトークンの約8倍です。

ほとんどのAI企業は、トークンの数に基づいてモデルの使用料を請求しており、これが急速に累積します。さらに、現代のベンチマークは、複雑な多段階タスクを含む質問を組み込むことで、大量のトークンを引き出すように設計されています。Epoch AIのシニアリサーチャーであるJean-Stanislas Denainは、TechCrunchに対し、「今日のベンチマークは、質問数が全体的に減少しているにもかかわらず、より複雑になっています。それらはしばしば、コードの作成と実行、インターネットの閲覧、コンピュータの使用など、現実世界のタスクを実行するモデルの能力を評価しようとします。」と説明しました。

Denainはまた、最も高額なモデルのトークンあたりのコストが上昇していると指摘しました。たとえば、2024年5月にリリースされたAnthropicのClaude 3 Opusは、100万出力トークンあたり75ドルでした。一方、同年早々にリリースされたOpenAIのGPT-4.5とo1-proは、それぞれ100万出力トークンあたり150ドルと600ドルでした。

トークンあたりのコストが上昇しているにもかかわらず、Denainは「モデルが時間とともに改善しているため、特定の性能レベルに到達するコストは依然として大幅に減少しています。しかし、任意の時点で最高最大のモデルを評価したい場合、それでもより多く支払うことになります。」と述べました。

ベンチマークの公正性

OpenAIを含む多くのAIラボは、ベンチマーク目的でモデルへの無料または補助付きアクセスを提供しています。しかし、この慣行は評価プロセスの公正性に関する懸念を引き起こします。操作の証拠がなくても、AIラボの関与のほのめかしだけで、結果の客観性に疑問を投げかける可能性があります。

Ross TaylorはXでこの懸念を表明し、「科学的観点から、誰も同じモデルで再現できない結果を公開した場合、それはもはや科学と言えるのでしょうか?(そもそも科学だったのか、笑)」と尋ねました。

AIベンチマークの高コストと潜在的なバイアスは、ますます高度なモデルを開発し検証しようとする分野が直面する課題を浮き彫りにしています。

関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める 米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成 AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト 『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
データ分析 SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール
SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール

2026年最新版・最高評価のAI異常検知ツール【SaaSおよびEコマースチーム向けKPIモニタリング】!XIX.AIは、厳格な実世界テストと週次更新のランキングに基づき、革新的な強力なコレクションを厳選しました。生産性を向上させ、AIの優位性を引き出すために必須のソリューションを見極めるのに役立つ、無料版と有料版の詳細な比較インサイトが見つかります。今すぐチェックしましょう!

10 ツール
xix.ai
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
画像編集 EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一
EC用アパレル向けPhotoshop AIレタッチツール、肌のクレンジング、色の統一

2026年最新版、eコマース用アパレル向けPhotoshop AIリタッチツール、肌補正、色調統一に最適!この高評価の厳選リストは、文章作成の効率化、コンテンツ制作の簡素化、完璧な視覚結果の達成を支援する革新的なソリューションを提供しています。各ツールは週次更新ランキングを通じて実世界でテストされ、無料版と有料版の比較詳細も記載されています。XIX.AIが後援するこのガイドは、AIの優位性を最大限に引き出したい方に必見です。今すぐチェック!

10 ツール
xix.ai
コメント (18)
0/500
PatrickCarter
PatrickCarter 2026年9月13日 5:00:09 JST

推理模型确实强大,但算钱如流水,普通开发者怎么跟大厂卷?😂

FrankJackson
FrankJackson 2025年8月10日 18:01:00 JST

These AI reasoning models are impressive for tackling complex physics problems step by step, but the surging benchmarking costs could stifle innovation for smaller labs. 😟 Reminds me of how tech giants dominate—maybe we need more affordable alternatives?

DouglasRodriguez
DouglasRodriguez 2025年7月28日 10:20:21 JST

These AI reasoning models sound cool, but the skyrocketing benchmarking costs are wild! 😳 Makes me wonder if smaller labs can even keep up with the big players like OpenAI.

StevenGonzalez
StevenGonzalez 2025年4月24日 21:58:05 JST

These AI reasoning models are impressive, but the rising costs of benchmarking are a real bummer. It's great for fields like physics, but I hope they find a way to make it more affordable. Otherwise, it's just for the big players. 😕

JackPerez
JackPerez 2025年4月24日 16:52:48 JST

Esses modelos de raciocínio de IA são impressionantes, mas o aumento dos custos de benchmarking é uma decepção. É ótimo para áreas como a física, mas espero que encontrem uma maneira de torná-lo mais acessível. Caso contrário, será apenas para os grandes jogadores. 😕

GregoryJones
GregoryJones 2025年4月24日 16:10:43 JST

AI推論モデルは素晴らしいけど、ベンチマーキングのコストが上がるのは残念です。物理分野には良いけど、もっと手頃な価格になる方法を見つけてほしいです。さもないと、大手企業だけのものになってしまいますね。😕

OR