ai '推論モデルのサージ、ベンチマークコストを押し上げます

AI推論モデルのベンチマークコストの上昇
OpenAIなどのAIラボは、複雑な問題を段階的に解決するように設計された先進的な「推論」AIモデルを宣伝しています。これらのモデルは、特に物理学などの分野で非常に効果的で、確かに印象的です。しかし、ベンチマークを行う際には高額なコストがかかり、その能力を独立して検証することが困難になっています。
第三者のAIテスト企業であるArtificial Analysisのデータによると、OpenAIのo1推論モデルを7つの人気AIベンチマークで評価するコストは驚くべきことに2,767.05ドルです。これらのベンチマークには、MMLU-Pro、GPQA Diamond、Humanity’s Last Exam、LiveCodeBench、SciCode、AIME 2024、MATH-500が含まれます。一方、Anthropicの「ハイブリッド」推論モデルであるClaude 3.7 Sonnetを同じテストでベンチマークしたコストは1,485.35ドルで、OpenAIのo3-mini-highは344.59ドルと大幅に安価でした。
すべての推論モデルが同じようにテストに高額な費用がかかるわけではありません。たとえば、Artificial AnalysisはOpenAIのo1-miniの評価に141.22ドルしか費やしていません。しかし、これらのモデルのコストは平均して高額になる傾向があります。Artificial Analysisは約12の推論モデルの評価に約5,200ドルを費やしており、これは80以上の非推論モデルの分析に費やした2,400ドルのほぼ2倍です。
比較として、2024年5月にリリースされたOpenAIの非推論GPT-4oモデルの評価には、Artificial Analysisは108.85ドルしかかからず、Claude 3.7 Sonnetの非推論の前モデルであるClaude 3.6 Sonnetは81.41ドルでした。
Artificial Analysisの共同創業者であるGeorge Cameronは、TechCrunchに対し、AIラボが推論モデルの開発を続けるにつれてベンチマーク予算を増やす準備ができていると述べました。「Artificial Analysisでは、毎月数百の評価を行い、これにかなりの予算を割いています」とCameronは述べています。「モデルがより頻繁にリリースされるにつれて、この支出が増える予定です。」
Artificial Analysisだけがこのコスト上昇に直面しているわけではありません。AIスタートアップGeneral ReasoningのCEOであるRoss Taylorは、最近、Claude 3.7 Sonnetを約3,700のユニークなプロンプトで評価するのに580ドルを費やしました。Taylorは、言語理解をテストするために設計されたベンチマークであるMMLU Proの1回の実行には1,800ドルを超えると見積もっています。
Taylorは最近のXの投稿で懸念を強調し、「私たちは、ラボがベンチマークでx%を報告し、yの計算量を費やす世界に移行していますが、学術研究者のリソースはyよりもはるかに少ないです。誰もその結果を再現できなくなるでしょう。」と述べました。
なぜ推論モデルのベンチマークは高額なのか?
推論モデルのテストが高額になる主な理由は、大量のトークンを生成する傾向があるためです。トークンは生のテキストの単位で、たとえば「fantastic」という単語は「fan」「tas」「tic」に分解される可能性があります。Artificial Analysisによると、OpenAIのo1モデルはテスト中に4,400万以上のトークンを生成し、これは非推論のGPT-4oモデルが生成したトークンの約8倍です。
ほとんどのAI企業は、トークンの数に基づいてモデルの使用料を請求しており、これが急速に累積します。さらに、現代のベンチマークは、複雑な多段階タスクを含む質問を組み込むことで、大量のトークンを引き出すように設計されています。Epoch AIのシニアリサーチャーであるJean-Stanislas Denainは、TechCrunchに対し、「今日のベンチマークは、質問数が全体的に減少しているにもかかわらず、より複雑になっています。それらはしばしば、コードの作成と実行、インターネットの閲覧、コンピュータの使用など、現実世界のタスクを実行するモデルの能力を評価しようとします。」と説明しました。
Denainはまた、最も高額なモデルのトークンあたりのコストが上昇していると指摘しました。たとえば、2024年5月にリリースされたAnthropicのClaude 3 Opusは、100万出力トークンあたり75ドルでした。一方、同年早々にリリースされたOpenAIのGPT-4.5とo1-proは、それぞれ100万出力トークンあたり150ドルと600ドルでした。
トークンあたりのコストが上昇しているにもかかわらず、Denainは「モデルが時間とともに改善しているため、特定の性能レベルに到達するコストは依然として大幅に減少しています。しかし、任意の時点で最高最大のモデルを評価したい場合、それでもより多く支払うことになります。」と述べました。
ベンチマークの公正性
OpenAIを含む多くのAIラボは、ベンチマーク目的でモデルへの無料または補助付きアクセスを提供しています。しかし、この慣行は評価プロセスの公正性に関する懸念を引き起こします。操作の証拠がなくても、AIラボの関与のほのめかしだけで、結果の客観性に疑問を投げかける可能性があります。
Ross TaylorはXでこの懸念を表明し、「科学的観点から、誰も同じモデルで再現できない結果を公開した場合、それはもはや科学と言えるのでしょうか?(そもそも科学だったのか、笑)」と尋ねました。
AIベンチマークの高コストと潜在的なバイアスは、ますます高度なモデルを開発し検証しようとする分野が直面する課題を浮き彫りにしています。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (18)
0/500
These AI reasoning models are impressive for tackling complex physics problems step by step, but the surging benchmarking costs could stifle innovation for smaller labs. 😟 Reminds me of how tech giants dominate—maybe we need more affordable alternatives?
These AI reasoning models sound cool, but the skyrocketing benchmarking costs are wild! 😳 Makes me wonder if smaller labs can even keep up with the big players like OpenAI.
These AI reasoning models are impressive, but the rising costs of benchmarking are a real bummer. It's great for fields like physics, but I hope they find a way to make it more affordable. Otherwise, it's just for the big players. 😕
Esses modelos de raciocínio de IA são impressionantes, mas o aumento dos custos de benchmarking é uma decepção. É ótimo para áreas como a física, mas espero que encontrem uma maneira de torná-lo mais acessível. Caso contrário, será apenas para os grandes jogadores. 😕

AI推論モデルのベンチマークコストの上昇
OpenAIなどのAIラボは、複雑な問題を段階的に解決するように設計された先進的な「推論」AIモデルを宣伝しています。これらのモデルは、特に物理学などの分野で非常に効果的で、確かに印象的です。しかし、ベンチマークを行う際には高額なコストがかかり、その能力を独立して検証することが困難になっています。
第三者のAIテスト企業であるArtificial Analysisのデータによると、OpenAIのo1推論モデルを7つの人気AIベンチマークで評価するコストは驚くべきことに2,767.05ドルです。これらのベンチマークには、MMLU-Pro、GPQA Diamond、Humanity’s Last Exam、LiveCodeBench、SciCode、AIME 2024、MATH-500が含まれます。一方、Anthropicの「ハイブリッド」推論モデルであるClaude 3.7 Sonnetを同じテストでベンチマークしたコストは1,485.35ドルで、OpenAIのo3-mini-highは344.59ドルと大幅に安価でした。
すべての推論モデルが同じようにテストに高額な費用がかかるわけではありません。たとえば、Artificial AnalysisはOpenAIのo1-miniの評価に141.22ドルしか費やしていません。しかし、これらのモデルのコストは平均して高額になる傾向があります。Artificial Analysisは約12の推論モデルの評価に約5,200ドルを費やしており、これは80以上の非推論モデルの分析に費やした2,400ドルのほぼ2倍です。
比較として、2024年5月にリリースされたOpenAIの非推論GPT-4oモデルの評価には、Artificial Analysisは108.85ドルしかかからず、Claude 3.7 Sonnetの非推論の前モデルであるClaude 3.6 Sonnetは81.41ドルでした。
Artificial Analysisの共同創業者であるGeorge Cameronは、TechCrunchに対し、AIラボが推論モデルの開発を続けるにつれてベンチマーク予算を増やす準備ができていると述べました。「Artificial Analysisでは、毎月数百の評価を行い、これにかなりの予算を割いています」とCameronは述べています。「モデルがより頻繁にリリースされるにつれて、この支出が増える予定です。」
Artificial Analysisだけがこのコスト上昇に直面しているわけではありません。AIスタートアップGeneral ReasoningのCEOであるRoss Taylorは、最近、Claude 3.7 Sonnetを約3,700のユニークなプロンプトで評価するのに580ドルを費やしました。Taylorは、言語理解をテストするために設計されたベンチマークであるMMLU Proの1回の実行には1,800ドルを超えると見積もっています。
Taylorは最近のXの投稿で懸念を強調し、「私たちは、ラボがベンチマークでx%を報告し、yの計算量を費やす世界に移行していますが、学術研究者のリソースはyよりもはるかに少ないです。誰もその結果を再現できなくなるでしょう。」と述べました。
なぜ推論モデルのベンチマークは高額なのか?
推論モデルのテストが高額になる主な理由は、大量のトークンを生成する傾向があるためです。トークンは生のテキストの単位で、たとえば「fantastic」という単語は「fan」「tas」「tic」に分解される可能性があります。Artificial Analysisによると、OpenAIのo1モデルはテスト中に4,400万以上のトークンを生成し、これは非推論のGPT-4oモデルが生成したトークンの約8倍です。
ほとんどのAI企業は、トークンの数に基づいてモデルの使用料を請求しており、これが急速に累積します。さらに、現代のベンチマークは、複雑な多段階タスクを含む質問を組み込むことで、大量のトークンを引き出すように設計されています。Epoch AIのシニアリサーチャーであるJean-Stanislas Denainは、TechCrunchに対し、「今日のベンチマークは、質問数が全体的に減少しているにもかかわらず、より複雑になっています。それらはしばしば、コードの作成と実行、インターネットの閲覧、コンピュータの使用など、現実世界のタスクを実行するモデルの能力を評価しようとします。」と説明しました。
Denainはまた、最も高額なモデルのトークンあたりのコストが上昇していると指摘しました。たとえば、2024年5月にリリースされたAnthropicのClaude 3 Opusは、100万出力トークンあたり75ドルでした。一方、同年早々にリリースされたOpenAIのGPT-4.5とo1-proは、それぞれ100万出力トークンあたり150ドルと600ドルでした。
トークンあたりのコストが上昇しているにもかかわらず、Denainは「モデルが時間とともに改善しているため、特定の性能レベルに到達するコストは依然として大幅に減少しています。しかし、任意の時点で最高最大のモデルを評価したい場合、それでもより多く支払うことになります。」と述べました。
ベンチマークの公正性
OpenAIを含む多くのAIラボは、ベンチマーク目的でモデルへの無料または補助付きアクセスを提供しています。しかし、この慣行は評価プロセスの公正性に関する懸念を引き起こします。操作の証拠がなくても、AIラボの関与のほのめかしだけで、結果の客観性に疑問を投げかける可能性があります。
Ross TaylorはXでこの懸念を表明し、「科学的観点から、誰も同じモデルで再現できない結果を公開した場合、それはもはや科学と言えるのでしょうか?(そもそも科学だったのか、笑)」と尋ねました。
AIベンチマークの高コストと潜在的なバイアスは、ますます高度なモデルを開発し検証しようとする分野が直面する課題を浮き彫りにしています。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
These AI reasoning models are impressive for tackling complex physics problems step by step, but the surging benchmarking costs could stifle innovation for smaller labs. 😟 Reminds me of how tech giants dominate—maybe we need more affordable alternatives?
These AI reasoning models sound cool, but the skyrocketing benchmarking costs are wild! 😳 Makes me wonder if smaller labs can even keep up with the big players like OpenAI.
These AI reasoning models are impressive, but the rising costs of benchmarking are a real bummer. It's great for fields like physics, but I hope they find a way to make it more affordable. Otherwise, it's just for the big players. 😕
Esses modelos de raciocínio de IA são impressionantes, mas o aumento dos custos de benchmarking é uma decepção. É ótimo para áreas como a física, mas espero que encontrem uma maneira de torná-lo mais acessível. Caso contrário, será apenas para os grandes jogadores. 😕





家






