オプション
ニュース
AIベンチマーク:今のところそれらを無視する必要がありますか?

AIベンチマーク:今のところそれらを無視する必要がありますか?

2025年4月10日
284

テッククランチの定期AIニュースレターへようこそ!少しお休みしますが、ご心配なく。私のコラム、毎日の分析、速報ニュースを含むすべてのAI関連情報は、テッククランチで引き続きご覧いただけます。毎日これらの記事を直接受信したい場合は、こちらでデイリーニュースレターに登録してください。

今週、イーロン・マスクのAIスタートアップ、xAIが最新のフラッグシップAIモデル、Grok 3をリリースしました。これは同社のGrokチャットボットアプリを動かしており、20万個のGPUでトレーニングされ、数学、コーディングなどでOpenAIのモデルを含む他のトップモデルを上回るベンチマーク結果を示しています。

しかし、これらのベンチマークが実際に何を意味するのかについて話しましょう。

TCでは、これらのベンチマーク数値を報告していますが、いつも喜んでいるとは限りません。なぜなら、これらはAI業界がモデルの進化をアピールする数少ない方法の一つだからです。問題は、こうした人気のAIベンチマークがしばしば不明瞭な内容に焦点を当て、AIが人々が本当に重視することの性能をあまり反映しないスコアを出すことです。

ウォートンの教授、エサン・モリックはXで、より優れたテストと独立したグループによる実施の必要性を指摘しました。彼は、AI企業が自社のベンチマーク結果を報告することが多く、完全に信頼するのが難しいと述べました。

「公開ベンチマークは『まあまあ』で飽和状態にあり、AIテストの多くは食品レビューみたいに好みに基づいている」とモリックは書いています。「AIが仕事に重要なら、もっと必要だ。」

AIの新しいベンチマークを考え出そうとしている人々はたくさんいますが、どれが最適か合意が得られていません。一部は経済的影響に焦点を当てるべきだと考え、他の者は実世界での採用と有用性が本当の成功の指標だと信じています。

この議論は永遠に続くかもしれません。XユーザーのRoonが提案するように、大きなAIのブレークスルーがない限り、新しいモデルやベンチマークにあまり注目しない方がいいかもしれません。それが私たちの精神衛生に良いかもしれませんし、AIの誇大広告を見逃すことになっても。

前述の通り、This Week in AIはお休みします。読者の皆様、いつも支えてくれてありがとう。次回まで。

ニュース

画像クレジット:Nathan Laine/Bloomberg / Getty Images
OpenAIはChatGPTの「検閲解除」を試みています。マックスは、彼らが「知的自由」を受け入れるためにAI開発のアプローチを変更し、難しいまたは物議を醸すトピックにも対応していると書きました。

OpenAIの元CTO、ミラ・ムラティは、Thinking Machines Labという新しいスタートアップを立ち上げました。彼らは「人々の独自のニーズと目標にAIを機能させる」ツールに取り組んでいます。

xAIはGrok 3をリリースし、iOSとウェブ向けのGrokアプリに新機能を追加しました。

Metaは今春、生成AIに焦点を当てた初の開発者カンファレンスを開催します。LlamaモデルにちなんでLlamaConと呼ばれ、4月29日に開催されます。

ポールは、約20の組織によるプロジェクト、OpenEuroLLMについて書きました。これは、EUのすべての言語の「言語的および文化的多様性」を尊重する「透明なAI」を構築するための基盤モデルです。

今週の研究論文

OpenAI ChatGPTのウェブサイトがラップトップ画面に表示されているイラスト写真。

画像クレジット:Jakub Porzycki/NurPhoto / Getty Images
OpenAIの研究者たちは、AIのコーディング能力をテストするための新しいAIベンチマーク、SWE-Lancerを開発しました。これは、バグ修正、機能追加、技術的実装の提案など、1,400以上のフリーランスソフトウェアエンジニアリングタスクで構成されています。

OpenAIによると、トップパフォーマンスのモデル、AnthropicのClaude 3.5 Sonnetは、SWE-Lancerベンチマーク全体で40.3%しかスコアを獲得できず、AIにはまだ長い道のりがあることを示しています。彼らはOpenAIのo3-miniや中国のDeepSeekのR1などの新しいモデルはテストしていません。

今週のモデル

中国のAI企業、Stepfunは、中国語、英語、日本語で音声を理解し生成できる「オープン」AIモデル、Step-Audioをリリースしました。ユーザーは合成音声の感情や方言を調整でき、歌声も含まれます。

Stepfunは、寛容なライセンスでモデルをリリースしている資金力のある中国のAIスタートアップの一つです。2023年に設立され、最近、中国国有のプライベートエクイティ企業を含む投資家から数億ドルの資金調達を完了しました。

その他

Nous Research DeepHermes

画像クレジット:Nous Research
AI研究グループ、Nous Researchは、推論と「直感的な言語モデル機能」を組み合わせた初のAIモデルをリリースしたと主張しています。

彼らのモデル、DeepHermes-3 Previewは、正確さと計算能力のバランスを取るために短いものと長い「思考の連鎖」を切り替えることができます。「推論」モードでは、より難しい問題を解くのに時間がかかり、その思考プロセスを示します。

Anthropicは近日中に同様のモデルをリリースする予定で、OpenAIも近日中のロードマップにあると述べています。

関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ サム・アルトマン氏によるAIの減速論が議論を呼ぶ Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている OpenAIはアップルの営業秘密訴訟と戦っている OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任 OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
SEO 検索戦略に最適なAI SERP分析ツール
検索戦略に最適なAI SERP分析ツール

2026年版、検索戦略に最適な高評価のAI SERP分析ツールは、XIX.AIが実環境での厳格なテストを経て厳選し、毎週ランキングを更新しています。これらの強力なツールを活用すれば、隠れた最適化の機会を発見し、コンテンツのパフォーマンスを向上させ、検索分野で競争優位性を獲得することができます。今すぐ、検索戦略を強化するのに最適なツールを見つけてください。今すぐチェック!

13 ツール
xix.ai
データ分析 SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール
SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール

2026年最新版・最高評価のAI異常検知ツール【SaaSおよびEコマースチーム向けKPIモニタリング】!XIX.AIは、厳格な実世界テストと週次更新のランキングに基づき、革新的な強力なコレクションを厳選しました。生産性を向上させ、AIの優位性を引き出すために必須のソリューションを見極めるのに役立つ、無料版と有料版の詳細な比較インサイトが見つかります。今すぐチェックしましょう!

10 ツール
xix.ai
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
仕事 中小企業に最適なAI競合分析ツール
中小企業に最適なAI競合分析ツール

2026年版 中小企業向け最新・最高評価のAI競合分析ツール!XIX.AIは、実環境での厳格なテストと詳細なランキングに基づき、毎週更新される、極めて強力で業界に革命をもたらすツールを厳選しました。無料版と有料版の包括的な比較も掲載されており、生産性を向上させ、競争優位性をもたらす「ぜひ試すべき」ツールを見つけるのに役立ちます。 今すぐチェックして、あなたにぴったりのツールを見つけましょう!

9 ツール
xix.ai
コメント (62)
0/500
DavidGreen
DavidGreen 2026年6月17日 17:00:23 JST

I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.

JonathanDavis
JonathanDavis 2025年8月19日 15:26:53 JST

AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.

EdwardWalker
EdwardWalker 2025年8月19日 14:00:59 JST

AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?

HarrySmith
HarrySmith 2025年8月12日 4:00:59 JST

AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔

BillyLewis
BillyLewis 2025年8月4日 15:01:00 JST

AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐

JimmyWilson
JimmyWilson 2025年8月1日 11:48:18 JST

AI benchmarks sound fancy, but are they just tech flexing? I mean, cool numbers, but do they really tell us how AI vibes in the real world? 🤔

OR