高中生为AI Minecraft建立挑战创建网站
使用Minecraft进行创意AI基准测试
随着传统AI基准测试方法的不足,开发者们正在探索创新方法来评估生成式AI模型的能力。其中一种创意方法是使用Microsoft旗下的热门沙盒游戏Minecraft。一组开发者推出了Minecraft基准测试,或称MC-Bench,这是一个平台,让AI模型根据给定的提示竞争创建Minecraft建筑。
在MC-Bench上,用户可以投票选择他们喜欢的AI模型创作,并且只有在投票后才会知道每个建筑是由哪个模型创建的。这种互动方式不仅吸引了社区参与,还提供了一种独特的方式来评估AI能力。

图片来源:Minecraft Benchmark Adi Singh,一名12年级学生,也是MC-Bench的发起人,认为Minecraft的广泛知名度是关键。作为有史以来最畅销的视频游戏,它为许多人所熟悉,使人们更容易判断AI生成建筑的质量,即使他们自己没有玩过这款游戏。Singh对TechCrunch解释说:“Minecraft让人们更容易看到AI发展的进展。人们已经习惯了Minecraft的画面和氛围。”
MC-Bench由八名志愿者组成的团队支持。Anthropic、Google、OpenAI和Alibaba等公司提供了他们的产品用于运行基准测试提示,尽管他们并未以其他方式参与该项目。
Singh设想将MC-Bench扩展到超越简单建筑的更复杂、目标导向的任务。他表示:“游戏可能只是一个测试代理推理的媒介,相比现实生活更安全,且更可控,适合测试目的,在我看来更理想。”
其他游戏作为AI基准
除了Minecraft,其他游戏如Pokémon Red、Street Fighter和Pictionary也被用作AI的实验性基准测试。AI基准测试的挑战在于其复杂性,因为传统标准化测试通常偏向于AI模型,这些模型因训练方法而在狭窄问题解决领域(如机械记忆或基本推断)表现优异。
例如,OpenAI的GPT-4在LSAT考试中能获得88%的分数,但却难以完成像统计“strawberry”中R字母数量这样的简单任务。同样,Anthropic的Claude 3.7 Sonnet在软件工程基准测试中达到62.3%的准确率,但在玩Pokémon时远不如大多数五岁儿童。

图片来源:Minecraft Benchmark MC-Bench:不仅仅是编程基准
从技术角度看,MC-Bench是一个编程基准测试,因为它要求AI模型编写代码来创建像“雪人Frosty”或“原始沙滩上的迷人热带小屋”这样的建筑。然而,该平台的吸引力在于其可访问性。用户更容易评估建筑的视觉质量,而不是分析代码,这拓宽了项目的覆盖范围和模型性能数据收集的潜力。
关于这些分数是否真正反映AI实用性的争论仍在继续。然而,Singh认为它们是一个强有力的指标。他说:“当前的排行榜非常贴近我使用这些模型的体验,这与许多纯文本基准测试不同。也许MC-Bench可以帮助公司了解他们是否朝着正确的方向前进。”
相关文章
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
韩国启动国家人工智能计算中心建设,投资2.5万亿韩元,目标2028年完成
韩国媒体EtNews报道,韩国AI计算中心(KOACC)的奠基仪式于8月3日在全罗南道顺天市的Solar City数据中心园区举行。该项目总投资额为2.5万亿韩元(约合118.38亿元人民币),计划于2028年投入运营,成为迄今为止韩国在AI基础设施领域规模最大的国家投资之一。该项目的股权分布凸显了深化政企合作的战略意图。三星SDS作为最大股东持有30%的股份,而包括科学技术信息通信部、金融监督院和国家成长基金在内的公共实体合计持有29%的股份。NAVER Cloud紧随其后,持股26.1%,
相关专题推荐
评论 (27)
0/500
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果
使用Minecraft进行创意AI基准测试
随着传统AI基准测试方法的不足,开发者们正在探索创新方法来评估生成式AI模型的能力。其中一种创意方法是使用Microsoft旗下的热门沙盒游戏Minecraft。一组开发者推出了Minecraft基准测试,或称MC-Bench,这是一个平台,让AI模型根据给定的提示竞争创建Minecraft建筑。
在MC-Bench上,用户可以投票选择他们喜欢的AI模型创作,并且只有在投票后才会知道每个建筑是由哪个模型创建的。这种互动方式不仅吸引了社区参与,还提供了一种独特的方式来评估AI能力。

Adi Singh,一名12年级学生,也是MC-Bench的发起人,认为Minecraft的广泛知名度是关键。作为有史以来最畅销的视频游戏,它为许多人所熟悉,使人们更容易判断AI生成建筑的质量,即使他们自己没有玩过这款游戏。Singh对TechCrunch解释说:“Minecraft让人们更容易看到AI发展的进展。人们已经习惯了Minecraft的画面和氛围。”
MC-Bench由八名志愿者组成的团队支持。Anthropic、Google、OpenAI和Alibaba等公司提供了他们的产品用于运行基准测试提示,尽管他们并未以其他方式参与该项目。
Singh设想将MC-Bench扩展到超越简单建筑的更复杂、目标导向的任务。他表示:“游戏可能只是一个测试代理推理的媒介,相比现实生活更安全,且更可控,适合测试目的,在我看来更理想。”
其他游戏作为AI基准
除了Minecraft,其他游戏如Pokémon Red、Street Fighter和Pictionary也被用作AI的实验性基准测试。AI基准测试的挑战在于其复杂性,因为传统标准化测试通常偏向于AI模型,这些模型因训练方法而在狭窄问题解决领域(如机械记忆或基本推断)表现优异。
例如,OpenAI的GPT-4在LSAT考试中能获得88%的分数,但却难以完成像统计“strawberry”中R字母数量这样的简单任务。同样,Anthropic的Claude 3.7 Sonnet在软件工程基准测试中达到62.3%的准确率,但在玩Pokémon时远不如大多数五岁儿童。

MC-Bench:不仅仅是编程基准
从技术角度看,MC-Bench是一个编程基准测试,因为它要求AI模型编写代码来创建像“雪人Frosty”或“原始沙滩上的迷人热带小屋”这样的建筑。然而,该平台的吸引力在于其可访问性。用户更容易评估建筑的视觉质量,而不是分析代码,这拓宽了项目的覆盖范围和模型性能数据收集的潜力。
关于这些分数是否真正反映AI实用性的争论仍在继续。然而,Singh认为它们是一个强有力的指标。他说:“当前的排行榜非常贴近我使用这些模型的体验,这与许多纯文本基准测试不同。也许MC-Bench可以帮助公司了解他们是否朝着正确的方向前进。”
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
韩国启动国家人工智能计算中心建设,投资2.5万亿韩元,目标2028年完成
韩国媒体EtNews报道,韩国AI计算中心(KOACC)的奠基仪式于8月3日在全罗南道顺天市的Solar City数据中心园区举行。该项目总投资额为2.5万亿韩元(约合118.38亿元人民币),计划于2028年投入运营,成为迄今为止韩国在AI基础设施领域规模最大的国家投资之一。该项目的股权分布凸显了深化政企合作的战略意图。三星SDS作为最大股东持有30%的股份,而包括科学技术信息通信部、金融监督院和国家成长基金在内的公共实体合计持有29%的股份。NAVER Cloud紧随其后,持股26.1%,
Interesting approach! Using Minecraft for AI benchmarking sounds way more engaging than standard tests. Wonder if this could lead to AI that actually helps design game worlds? The student's project is a cool example of how gaming and AI research can mix. Hope they share the results! 🎮
高校生がAI建築チャレンジのサイトを作ったのか…!Minecraftの世界でAIの創造性を測るってアイデア、すごく面白いな。でも、これって結局マイクロソフトのプロモーションみたいなものじゃないの?AIがどんどんゲーム内に溶け込んでいくの、ちょっと怖い気もする😅 未来のゲームはすべてAIが作っちゃうのかな?
É sempre incrível ver jovens inovando com IA! Alguém já testou se esses desafios do Minecraft realmente conseguem medir bem a criatividade dos modelos? Ou será que é só mais uma moda passageira? 😅
这个高中生用Minecraft来测试AI生成建筑也太有创意了吧!😂 传统AI评测标准太死板了,确实需要这种更直观有趣的方式。不过我很好奇评判标准是什么,是美观度还是还原度?也想试试看用我的世界来测试Stable Diffusion效果





首页






