高校生は、AI MinecraftのビルドオフチャレンジのためにWebサイトを作成します
Minecraftを使用したクリエイティブAIベンチマーク
従来のAIベンチマーク手法が不足する中、開発者たちは生成AIモデルの能力を評価するための革新的なアプローチを模索しています。そのようなクリエイティブな方法の一つが、Microsoftが所有する人気のサンドボックスゲーム、Minecraftを使用することです。一部の開発者グループがMinecraft Benchmark、またはMC-Benchを立ち上げ、AIモデルが与えられたプロンプトに基づいてMinecraftの建築物を作成し競い合うプラットフォームを構築しました。
MC-Benchでは、ユーザーがどのAIモデルの作品を好むかに投票でき、投票後に初めてどのモデルが各建築物を作成したかを知ることができます。このインタラクティブなアプローチは、コミュニティを巻き込むだけでなく、AIの能力を評価する独自の方法を提供します。

画像提供:Minecraft Benchmark 12年生でMC-Benchの創始者であるAdi Singhは、Minecraftの広く知られた認知度が鍵だと考えています。史上最も売れたビデオゲームとして、Minecraftは多くの人に馴染みがあり、ゲームをプレイしたことがない人でもAIが生成した建築物の品質を判断しやすくなっています。「Minecraftは人々がAI開発の進捗をより簡単に見ることを可能にします」とSinghはTechCrunchに説明しました。「人々はMinecraftに慣れており、その見た目や雰囲気に慣れています。」
MC-Benchは8人のボランティア貢献者によるチームによってサポートされています。Anthropic、Google、OpenAI、Alibabaなどの企業がベンチマークプロンプトの実行のために製品を提供していますが、プロジェクトにはそれ以外の関与はありません。
Singhは、MC-Benchを単純な建築物からより複雑で目標指向のタスクへと拡張することを構想しています。「ゲームは、現実世界よりも安全で、テスト目的でより制御可能なエージェント的推論をテストする媒体になるかもしれません。それが私の目には理想的です」と彼は述べました。
他のゲームをAIベンチマークとして
Minecraft以外にも、Pokémon Red、Street Fighter、PictionaryなどのゲームがAIの実験的ベンチマークとして使用されています。AIのベンチマークの課題は、その複雑さにあります。従来の標準化されたテストは、AIモデルが得意とする暗記や基本的な推論といった狭い問題解決領域を重視する傾向があるためです。
例えば、OpenAIのGPT-4はLSATで88パーセンタイルのスコアを獲得できますが、「strawberry」の中のRの数を数えるような簡単なタスクには苦戦します。同様に、AnthropicのClaude 3.7 Sonnetはソフトウェアエンジニアリングベンチマークで62.3%の精度を達成しましたが、Pokémonをプレイする能力では5歳の子供のほとんどの能力に及びません。

画像提供:Minecraft Benchmark MC-Bench:単なるプログラミングベンチマーク以上のもの
技術的には、MC-BenchはAIモデルが「フロスティ・ザ・スノーマン」や「手つかずの砂浜にある魅力的なトロピカルビーチハット」などの建築物を作成するためにコードを書く必要があるため、プログラミングベンチマークです。しかし、このプラットフォームの魅力は、そのアクセシビリティにあります。ユーザーがコードを分析するよりも、建築物の視覚的な品質を評価する方が簡単であり、これによりプロジェクトの範囲とモデルパフォーマンスに関するデータ収集の可能性が広がります。
これらのスコアがAIの有用性を本当に反映しているかどうかについての議論は続いています。しかし、Singhはそれらが強い指標だと信じています。「現在のリーダーボードは、私がこれらのモデルを使用した経験にかなり近いものを反映しています。これは多くの純粋なテキストベンチマークとは異なります」と彼は述べました。「おそらく[MC-Bench]は、企業が正しい方向に進んでいるかどうかを知るのに役立つかもしれません。」
関連記事
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
関連特集おすすめ
コメント (27)
0/500
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
Minecraftを使用したクリエイティブAIベンチマーク
従来のAIベンチマーク手法が不足する中、開発者たちは生成AIモデルの能力を評価するための革新的なアプローチを模索しています。そのようなクリエイティブな方法の一つが、Microsoftが所有する人気のサンドボックスゲーム、Minecraftを使用することです。一部の開発者グループがMinecraft Benchmark、またはMC-Benchを立ち上げ、AIモデルが与えられたプロンプトに基づいてMinecraftの建築物を作成し競い合うプラットフォームを構築しました。
MC-Benchでは、ユーザーがどのAIモデルの作品を好むかに投票でき、投票後に初めてどのモデルが各建築物を作成したかを知ることができます。このインタラクティブなアプローチは、コミュニティを巻き込むだけでなく、AIの能力を評価する独自の方法を提供します。

12年生でMC-Benchの創始者であるAdi Singhは、Minecraftの広く知られた認知度が鍵だと考えています。史上最も売れたビデオゲームとして、Minecraftは多くの人に馴染みがあり、ゲームをプレイしたことがない人でもAIが生成した建築物の品質を判断しやすくなっています。「Minecraftは人々がAI開発の進捗をより簡単に見ることを可能にします」とSinghはTechCrunchに説明しました。「人々はMinecraftに慣れており、その見た目や雰囲気に慣れています。」
MC-Benchは8人のボランティア貢献者によるチームによってサポートされています。Anthropic、Google、OpenAI、Alibabaなどの企業がベンチマークプロンプトの実行のために製品を提供していますが、プロジェクトにはそれ以外の関与はありません。
Singhは、MC-Benchを単純な建築物からより複雑で目標指向のタスクへと拡張することを構想しています。「ゲームは、現実世界よりも安全で、テスト目的でより制御可能なエージェント的推論をテストする媒体になるかもしれません。それが私の目には理想的です」と彼は述べました。
他のゲームをAIベンチマークとして
Minecraft以外にも、Pokémon Red、Street Fighter、PictionaryなどのゲームがAIの実験的ベンチマークとして使用されています。AIのベンチマークの課題は、その複雑さにあります。従来の標準化されたテストは、AIモデルが得意とする暗記や基本的な推論といった狭い問題解決領域を重視する傾向があるためです。
例えば、OpenAIのGPT-4はLSATで88パーセンタイルのスコアを獲得できますが、「strawberry」の中のRの数を数えるような簡単なタスクには苦戦します。同様に、AnthropicのClaude 3.7 Sonnetはソフトウェアエンジニアリングベンチマークで62.3%の精度を達成しましたが、Pokémonをプレイする能力では5歳の子供のほとんどの能力に及びません。

MC-Bench:単なるプログラミングベンチマーク以上のもの
技術的には、MC-BenchはAIモデルが「フロスティ・ザ・スノーマン」や「手つかずの砂浜にある魅力的なトロピカルビーチハット」などの建築物を作成するためにコードを書く必要があるため、プログラミングベンチマークです。しかし、このプラットフォームの魅力は、そのアクセシビリティにあります。ユーザーがコードを分析するよりも、建築物の視覚的な品質を評価する方が簡単であり、これによりプロジェクトの範囲とモデルパフォーマンスに関するデータ収集の可能性が広がります。
これらのスコアがAIの有用性を本当に反映しているかどうかについての議論は続いています。しかし、Singhはそれらが強い指標だと信じています。「現在のリーダーボードは、私がこれらのモデルを使用した経験にかなり近いものを反映しています。これは多くの純粋なテキストベンチマークとは異なります」と彼は述べました。「おそらく[MC-Bench]は、企業が正しい方向に進んでいるかどうかを知るのに役立つかもしれません。」
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





家






