高中生為AI Minecraft建立挑戰創建網站
使用Minecraft進行創意AI基準測試
隨著傳統AI基準測試方法的不足,開發者們正探索創新的方式來評估生成式AI模型的能力。其中一種創意方法是使用Minecraft,這款由Microsoft擁有的熱門沙盒遊戲。一群開發者推出了Minecraft Benchmark,或稱MC-Bench,這是一個讓AI模型根據給定提示競爭創建Minecraft建築的平台。
在MC-Bench上,使用者可以投票選擇他們偏好的AI模型創作,且只有在投票後才會得知每件建築是由哪個模型製作的。這種互動方式不僅吸引了社群參與,還提供了一種獨特的方式來評估AI的能力。

圖片來源:Minecraft Benchmark Adi Singh,一位12年級學生,也是MC-Bench的發起人,認為Minecraft的廣泛知名度是關鍵。作為有史以來最暢銷的電子遊戲,許多人都對它很熟悉,這使得人們即使沒有親自玩過遊戲,也能更容易判斷AI生成建築的品質。Singh向TechCrunch解釋說:「Minecraft讓人們更容易看到[AI發展]的進展。」他補充道:「人們習慣了Minecraft的風格和氛圍。」
MC-Bench由八名志願者組成的團隊支持。像Anthropic、Google、OpenAI和Alibaba這樣的企業提供了他們的產品來運行基準測試提示,但他們並未以其他方式參與該項目。
Singh設想將MC-Bench擴展到超越簡單建築,朝著更複雜、以目標為導向的任務發展。他說:「遊戲可能只是一種測試代理推理的媒介,相較於現實生活更安全,且更可控,適合測試用途,這在我看來更為理想。」
其他遊戲作為AI基準
除了Minecraft,其他遊戲如Pokémon Red、Street Fighter和Pictionary也已被用作AI的實驗性基準。AI基準測試的挑戰在於其複雜性,因為傳統的標準化測試往往偏向AI模型,這是由於它們的訓練方式在狹窄的問題解決領域(如機械記憶或基本推斷)中表現出色。
例如,OpenAI的GPT-4在LSAT考試中能達到88百分位的成績,但在像計算「strawberry」中R的數量這樣較簡單的任務上卻表現不佳。同樣,Anthropic的Claude 3.7 Sonnet在軟體工程基準測試中達到62.3%的準確率,但在玩Pokémon時的表現卻不如大多數五歲的孩子。

圖片來源:Minecraft Benchmark MC-Bench:不僅僅是程式設計基準
從技術上講,MC-Bench是一個程式設計基準,因為它要求AI模型撰寫程式碼來創建像「雪人Frosty」或「原始沙灘上的迷人熱帶小屋」這樣的建築。然而,這個平台的吸引力在於其可及性。使用者評估建築的視覺品質比分析程式碼更容易,這擴大了項目的影響力和收集模型性能數據的潛力。
關於這些分數是否真正反映AI實用性的爭論仍在繼續。然而,Singh認為它們是一個強有力的指標。他說:「目前的排行榜與我使用這些模型的個人經驗相當吻合,這與許多純文字基準不同。」他補充道:「也許[MC-Bench]對企業來說有助於了解他們是否朝著正確的方向前進。」
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (27)
0/500
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
使用Minecraft進行創意AI基準測試
隨著傳統AI基準測試方法的不足,開發者們正探索創新的方式來評估生成式AI模型的能力。其中一種創意方法是使用Minecraft,這款由Microsoft擁有的熱門沙盒遊戲。一群開發者推出了Minecraft Benchmark,或稱MC-Bench,這是一個讓AI模型根據給定提示競爭創建Minecraft建築的平台。
在MC-Bench上,使用者可以投票選擇他們偏好的AI模型創作,且只有在投票後才會得知每件建築是由哪個模型製作的。這種互動方式不僅吸引了社群參與,還提供了一種獨特的方式來評估AI的能力。

Adi Singh,一位12年級學生,也是MC-Bench的發起人,認為Minecraft的廣泛知名度是關鍵。作為有史以來最暢銷的電子遊戲,許多人都對它很熟悉,這使得人們即使沒有親自玩過遊戲,也能更容易判斷AI生成建築的品質。Singh向TechCrunch解釋說:「Minecraft讓人們更容易看到[AI發展]的進展。」他補充道:「人們習慣了Minecraft的風格和氛圍。」
MC-Bench由八名志願者組成的團隊支持。像Anthropic、Google、OpenAI和Alibaba這樣的企業提供了他們的產品來運行基準測試提示,但他們並未以其他方式參與該項目。
Singh設想將MC-Bench擴展到超越簡單建築,朝著更複雜、以目標為導向的任務發展。他說:「遊戲可能只是一種測試代理推理的媒介,相較於現實生活更安全,且更可控,適合測試用途,這在我看來更為理想。」
其他遊戲作為AI基準
除了Minecraft,其他遊戲如Pokémon Red、Street Fighter和Pictionary也已被用作AI的實驗性基準。AI基準測試的挑戰在於其複雜性,因為傳統的標準化測試往往偏向AI模型,這是由於它們的訓練方式在狹窄的問題解決領域(如機械記憶或基本推斷)中表現出色。
例如,OpenAI的GPT-4在LSAT考試中能達到88百分位的成績,但在像計算「strawberry」中R的數量這樣較簡單的任務上卻表現不佳。同樣,Anthropic的Claude 3.7 Sonnet在軟體工程基準測試中達到62.3%的準確率,但在玩Pokémon時的表現卻不如大多數五歲的孩子。

MC-Bench:不僅僅是程式設計基準
從技術上講,MC-Bench是一個程式設計基準,因為它要求AI模型撰寫程式碼來創建像「雪人Frosty」或「原始沙灘上的迷人熱帶小屋」這樣的建築。然而,這個平台的吸引力在於其可及性。使用者評估建築的視覺品質比分析程式碼更容易,這擴大了項目的影響力和收集模型性能數據的潛力。
關於這些分數是否真正反映AI實用性的爭論仍在繼續。然而,Singh認為它們是一個強有力的指標。他說:「目前的排行榜與我使用這些模型的個人經驗相當吻合,這與許多純文字基準不同。」他補充道:「也許[MC-Bench]對企業來說有助於了解他們是否朝著正確的方向前進。」
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





首頁






