メタのAIモデルベンチマーク:誤解を招く?

さて、Metaが週末に新しいAIモデル、Maverickをリリースし、LM Arenaで2位を獲得して早くも話題になっています。ご存知の通り、LM Arenaは人間が裁判官となってさまざまなAIモデルを比較し、気に入ったものを選ぶ場所です。でも、ちょっと待って、面白い展開が! LM Arenaで活躍しているMaverickのバージョンは、開発者がダウンロードして使えるものと完全に同じではないことが判明しました。
X(そう、以前はTwitterとして知られていたプラットフォーム)上の鋭いAI研究者たちが、MetaがLM Arenaのバージョンを「実験的なチャットバージョン」と呼んでいることに気づきました。Llamaのウェブサイトを覗いてみると、テストは「会話に最適化されたLlama 4 Maverick」で行われたと明かしているチャートがあります。これについては以前も話しましたが、LM ArenaはAIのパフォーマンスを測るための金字塔というわけではありません。ほとんどのAI企業は、このテストで高得点を狙うためにモデルをいじることはしない——少なくとも、そう公言していません。
問題は、ベンチマークで高得点を出すようにモデルを調整しつつ、一般向けには異なる「バニラ」バージョンを公開すると、開発者がそのモデルが実際のシナリオでどれだけうまく機能するかを判断するのが難しくなることです。それに、ちょっと紛らわしいですよね? ベンチマークには欠陥があるとはいえ、モデルがさまざまなタスクで何ができて何ができないかを明確に示すべきです。
Xの研究者たちは、ダウンロード可能なMaverickとLM Arenaのものとの間に大きな違いがあることにすぐ気づきました。Arenaのバージョンは絵文字を多用し、長い、くどい回答をするのが特徴のようです。
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 2025年4月6日
for some reason, the Llama 4 model in Arena uses a lot more Emojis
on together . ai, it seems better: pic.twitter.com/f74ODX4zTt
— Tech Dev Notes (@techdevnotes) 2025年4月6日
私たちはMetaと、LM Arenaを運営するChatbot Arenaの担当者にこの件についてコメントを求めました。続報をお待ちください!
関連記事
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
マーク・ザッカーバーグは本当にAIが誰にでも役立つと考えているのか?
プレイヤーを読み込み中…メタは本日、グリーマーを発表した。これはオープンウェイトのAIモデルで、誰でもダウンロードして個人のハードウェアで実行できる。この発表は、メタのより強力なモデルであるミューズスパークが独自のAPIを通じてのみ利用可能であることとは対照的だ。このリリースにはマーク・ザッカーバーグによる書簡も添えられ、AIは限られたラボによって制御されるのではなく、誰もがアクセス可能であるべきだと主張している。しかし、Equityのホストたちが指摘するように、このビジョンにはいくつかの重要
Facebook、クリエイター向けAIコンパニオンアプリをリリース
Facebookは水曜日、クリエイタースタジオをAI専用のコンパニオンアプリへと刷新し、クリエイターがプラットフォーム上でリーチを拡大できるよう支援すると明らかにした。このAI駆動型ツールを提供することで、MetaはTikTokやYouTubeとの激しい競争の中で、クリエイターをFacebookに引き留めることを目指している。同社はまた、このアプリによって、コンテンツのアイデア創出やパフォーマンス
関連特集おすすめ
コメント (37)
0/500
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔

さて、Metaが週末に新しいAIモデル、Maverickをリリースし、LM Arenaで2位を獲得して早くも話題になっています。ご存知の通り、LM Arenaは人間が裁判官となってさまざまなAIモデルを比較し、気に入ったものを選ぶ場所です。でも、ちょっと待って、面白い展開が! LM Arenaで活躍しているMaverickのバージョンは、開発者がダウンロードして使えるものと完全に同じではないことが判明しました。
X(そう、以前はTwitterとして知られていたプラットフォーム)上の鋭いAI研究者たちが、MetaがLM Arenaのバージョンを「実験的なチャットバージョン」と呼んでいることに気づきました。Llamaのウェブサイトを覗いてみると、テストは「会話に最適化されたLlama 4 Maverick」で行われたと明かしているチャートがあります。これについては以前も話しましたが、LM ArenaはAIのパフォーマンスを測るための金字塔というわけではありません。ほとんどのAI企業は、このテストで高得点を狙うためにモデルをいじることはしない——少なくとも、そう公言していません。
問題は、ベンチマークで高得点を出すようにモデルを調整しつつ、一般向けには異なる「バニラ」バージョンを公開すると、開発者がそのモデルが実際のシナリオでどれだけうまく機能するかを判断するのが難しくなることです。それに、ちょっと紛らわしいですよね? ベンチマークには欠陥があるとはいえ、モデルがさまざまなタスクで何ができて何ができないかを明確に示すべきです。
Xの研究者たちは、ダウンロード可能なMaverickとLM Arenaのものとの間に大きな違いがあることにすぐ気づきました。Arenaのバージョンは絵文字を多用し、長い、くどい回答をするのが特徴のようです。
Okay Llama 4 is def a littled cooked lol, what is this yap city pic.twitter.com/y3GvhbVz65
— Nathan Lambert (@natolambert) 2025年4月6日
for some reason, the Llama 4 model in Arena uses a lot more Emojis
— Tech Dev Notes (@techdevnotes) 2025年4月6日
on together . ai, it seems better: pic.twitter.com/f74ODX4zTt
私たちはMetaと、LM Arenaを運営するChatbot Arenaの担当者にこの件についてコメントを求めました。続報をお待ちください!
フロンティアAIラボ、異常挙動を示すモデルの封じ込め戦略の開示を拒否
最近の調査によると、主要なAI研究所のうち、封じ込め対応計画を公表または実証しているところはごくわずかであることが示されている。封じ込め計画とは、AIシステムが人間の制御を覆そうとした場合の対応手順を定義するもので、どのアクセス権限を取り消すか、またいつシステムを完全にシャットダウンするかを具体的に規定している。この調査結果は、安全な最先端AI開発の実践を推進することに注力する組織「Guideli
マーク・ザッカーバーグは本当にAIが誰にでも役立つと考えているのか?
プレイヤーを読み込み中…メタは本日、グリーマーを発表した。これはオープンウェイトのAIモデルで、誰でもダウンロードして個人のハードウェアで実行できる。この発表は、メタのより強力なモデルであるミューズスパークが独自のAPIを通じてのみ利用可能であることとは対照的だ。このリリースにはマーク・ザッカーバーグによる書簡も添えられ、AIは限られたラボによって制御されるのではなく、誰もがアクセス可能であるべきだと主張している。しかし、Equityのホストたちが指摘するように、このビジョンにはいくつかの重要
Facebook、クリエイター向けAIコンパニオンアプリをリリース
Facebookは水曜日、クリエイタースタジオをAI専用のコンパニオンアプリへと刷新し、クリエイターがプラットフォーム上でリーチを拡大できるよう支援すると明らかにした。このAI駆動型ツールを提供することで、MetaはTikTokやYouTubeとの激しい競争の中で、クリエイターをFacebookに引き留めることを目指している。同社はまた、このアプリによって、コンテンツのアイデア創出やパフォーマンス
メタのAIベンチマークって怪しくない?🤔 人間が好みで評価するランダムなランキングより、実用的なテストの方が信用できると思う。結局ベンチマークゲームに夢中になる企業より、実際に役立つAIを作ってる会社の方が価値あるよね。 #AIベンチマーク
Meta's Maverick hitting second on LM Arena? Impressive, but I'm skeptical about those benchmarks. Feels like a hype train—wonder if it’s more flash than substance. 🤔 Anyone tested it in real-world tasks yet?
Meta's Maverick AI model is impressive, snagging second place on LM Arena! But are the benchmarks really telling the whole story? It's cool to see AI models go head-to-head, but I'm not sure if it's all fair play. Makes you wonder, right? 🤔 Maybe we need a more transparent way to judge these models!
मेटा का नया AI मॉडल, मैवरिक, LM एरिना में दूसरे स्थान पर पहुंचा! यह प्रभावशाली है, लेकिन क्या बेंचमार्क वास्तव में पूरी कहानी बता रहे हैं? AI मॉडल्स को आपस में प्रतिस्पर्धा करते देखना मजेदार है, लेकिन मुझे नहीं पता कि यह निष्पक्ष है या नहीं। आपको सोचने पर मजबूर करता है, है ना? 🤔 शायद हमें इन मॉडल्स को जज करने का एक और पारदर्शी तरीका चाहिए!
메타의 새로운 AI 모델, 마브릭이 LM Arena에서 2위를 차지하다니 대단해요! 하지만 벤치마크가 정말 모든 것을 말해주고 있는지 궁금해요. AI 모델 간의 경쟁은 재미있지만, 공정한지 확신할 수 없네요. 더 투명한 평가 방법이 필요할 것 같아요 🤔





家






