AI“推理”模型已通过NPR周日拼图问题测试
每周日,NPR的威尔·肖茨,《纽约时报》填字游戏的策划者,通过他的“周日谜题”节目吸引了数千名听众。这些谜题设计为仅需一般知识即可解答,但即便对经验丰富的解谜者也构成了重大挑战。
这种复杂性使得一些专家认为,周日谜题可以作为测试AI问题解决能力界限的宝贵工具。
在一项近期研究中,来自威尔斯利学院、奥伯林学院、德克萨斯大学奥斯汀分校、东北大学、查尔斯大学以及初创公司Cursor的研究人员,利用周日谜题中的谜语开发了一个AI基准测试。他们的发现揭示了推理模型的一些有趣行为,包括OpenAI的o1模型,它偶尔会“放弃”并故意给出错误答案。
东北大学的计算机科学教授、该研究的共同作者阿琼·古哈向TechCrunch解释,目标是创建一个任何具备一般知识的人都能理解的基准测试。他表示:“我们希望开发一个仅需一般知识就能理解问题的基准测试。”
AI行业目前在基准测试方面面临挑战,因为许多测试聚焦于博士级别的数学和科学等高级技能,这些对大多数用户并不相关。此外,即使是最近发布的基准测试也已接近饱和。
据古哈介绍,周日谜题的独特优势在于它不依赖专业知识,其格式能防止AI模型简单地复述记忆中的答案。他进一步解释:“我认为这些问题之所以难,是因为在解决之前很难取得实质性进展——只有当一切豁然开朗时,问题才会迎刃而解。这需要洞察力和排除法的结合。”
然而,周日谜题也有其局限性。它以美国文化为中心,仅使用英语,且存在模型可能因提前见过问题而“作弊”的风险。不过,古哈安慰道,他尚未发现这方面的证据。他补充说:“每周都会发布新问题,我们可以预期最新问题是真正未见过的。我们打算保持基准测试的新鲜度,并追踪模型性能随时间的变化。”
研究人员的基准测试包含约600个周日谜题的谜语,显示出像o1和DeepSeek的R1这样的推理模型明显优于其他模型。这些模型会仔细核查事实,帮助它们避免常见错误。然而,这种彻底性意味着它们需要更长时间得出答案——通常多几秒到几分钟。
有趣的是,DeepSeek的R1有时会承认失败,说“我放弃了”,然后给出一个随机的错误答案——这种反应让许多人感同身受。其他奇特行为包括模型给出一个错误答案后撤回,再次尝试猜测但仍失败。一些模型陷入无休止的“思考”循环,提供荒诞的解释,或在正确回答问题后仍不必要地探索其他答案。
古哈评论R1的行为时说:“在难题上,R1明确表示它感到‘沮丧’。看到模型模仿人类的说法很有趣。推理中的‘沮丧’如何影响模型结果的质量仍有待观察。”

R1在周日谜题挑战集的一个问题上感到“沮丧”。图片来源:古哈等人 当前基准测试的最高得分者是o1,得分为59%,其次是最近发布的o3-mini在高“推理努力”设置下得分47%。R1得分为35%。研究人员计划扩展测试到更多推理模型,希望找出改进的领域。

团队测试的模型在基准测试中的得分。图片来源:古哈等人 古哈强调了可访问基准测试的重要性,他说:“你不需要博士学位就能擅长推理,因此应该可以设计出不要求博士级知识的推理基准测试。具有更广泛访问性的基准测试能让更多研究人员理解和分析结果,这可能会在未来带来更好的解决方案。此外,随着最先进的模型越来越多地部署在影响每个人的场景中,我们认为每个人都应该能够直观了解这些模型的能力和局限性。”
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (12)
0/500
Die Vorstellung, dass KI solche Puzzles löst, ist faszinierend. Aber wie weit kann diese 'Argumentationsfähigkeit' wirklich gehen? Ich frage mich, ob das mehr ist als nur komplexe Mustererkennung. Die ethischen Implikationen, wenn diese Systeme 'echtes' Denken simulieren könnten, sind beängstigend. 🤔
NPR's Sunday Puzzle with AI? Sounds like a brain teaser showdown! I wonder if these models can outsmart Will Shortz’s tricky wordplay. 🤔
¡Esta herramienta de IA que resuelve los rompecabezas de los domingos de NPR es genial! Es como tener un amigo listo que ama los rompecabezas tanto como yo. A veces se equivoca, pero ¿quién no? ¡Sigue así, IA! 😄
This AI tool tackling NPR's Sunday Puzzles is super cool! It's like having a brainy friend who loves puzzles as much as I do. Sometimes it gets the answers wrong, but hey, who doesn't? Keep up the good work, AI! 🤓
每周日,NPR的威尔·肖茨,《纽约时报》填字游戏的策划者,通过他的“周日谜题”节目吸引了数千名听众。这些谜题设计为仅需一般知识即可解答,但即便对经验丰富的解谜者也构成了重大挑战。
这种复杂性使得一些专家认为,周日谜题可以作为测试AI问题解决能力界限的宝贵工具。
在一项近期研究中,来自威尔斯利学院、奥伯林学院、德克萨斯大学奥斯汀分校、东北大学、查尔斯大学以及初创公司Cursor的研究人员,利用周日谜题中的谜语开发了一个AI基准测试。他们的发现揭示了推理模型的一些有趣行为,包括OpenAI的o1模型,它偶尔会“放弃”并故意给出错误答案。
东北大学的计算机科学教授、该研究的共同作者阿琼·古哈向TechCrunch解释,目标是创建一个任何具备一般知识的人都能理解的基准测试。他表示:“我们希望开发一个仅需一般知识就能理解问题的基准测试。”
AI行业目前在基准测试方面面临挑战,因为许多测试聚焦于博士级别的数学和科学等高级技能,这些对大多数用户并不相关。此外,即使是最近发布的基准测试也已接近饱和。
据古哈介绍,周日谜题的独特优势在于它不依赖专业知识,其格式能防止AI模型简单地复述记忆中的答案。他进一步解释:“我认为这些问题之所以难,是因为在解决之前很难取得实质性进展——只有当一切豁然开朗时,问题才会迎刃而解。这需要洞察力和排除法的结合。”
然而,周日谜题也有其局限性。它以美国文化为中心,仅使用英语,且存在模型可能因提前见过问题而“作弊”的风险。不过,古哈安慰道,他尚未发现这方面的证据。他补充说:“每周都会发布新问题,我们可以预期最新问题是真正未见过的。我们打算保持基准测试的新鲜度,并追踪模型性能随时间的变化。”
研究人员的基准测试包含约600个周日谜题的谜语,显示出像o1和DeepSeek的R1这样的推理模型明显优于其他模型。这些模型会仔细核查事实,帮助它们避免常见错误。然而,这种彻底性意味着它们需要更长时间得出答案——通常多几秒到几分钟。
有趣的是,DeepSeek的R1有时会承认失败,说“我放弃了”,然后给出一个随机的错误答案——这种反应让许多人感同身受。其他奇特行为包括模型给出一个错误答案后撤回,再次尝试猜测但仍失败。一些模型陷入无休止的“思考”循环,提供荒诞的解释,或在正确回答问题后仍不必要地探索其他答案。
古哈评论R1的行为时说:“在难题上,R1明确表示它感到‘沮丧’。看到模型模仿人类的说法很有趣。推理中的‘沮丧’如何影响模型结果的质量仍有待观察。”

当前基准测试的最高得分者是o1,得分为59%,其次是最近发布的o3-mini在高“推理努力”设置下得分47%。R1得分为35%。研究人员计划扩展测试到更多推理模型,希望找出改进的领域。

古哈强调了可访问基准测试的重要性,他说:“你不需要博士学位就能擅长推理,因此应该可以设计出不要求博士级知识的推理基准测试。具有更广泛访问性的基准测试能让更多研究人员理解和分析结果,这可能会在未来带来更好的解决方案。此外,随着最先进的模型越来越多地部署在影响每个人的场景中,我们认为每个人都应该能够直观了解这些模型的能力和局限性。”
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
Die Vorstellung, dass KI solche Puzzles löst, ist faszinierend. Aber wie weit kann diese 'Argumentationsfähigkeit' wirklich gehen? Ich frage mich, ob das mehr ist als nur komplexe Mustererkennung. Die ethischen Implikationen, wenn diese Systeme 'echtes' Denken simulieren könnten, sind beängstigend. 🤔
NPR's Sunday Puzzle with AI? Sounds like a brain teaser showdown! I wonder if these models can outsmart Will Shortz’s tricky wordplay. 🤔
¡Esta herramienta de IA que resuelve los rompecabezas de los domingos de NPR es genial! Es como tener un amigo listo que ama los rompecabezas tanto como yo. A veces se equivoca, pero ¿quién no? ¡Sigue así, IA! 😄
This AI tool tackling NPR's Sunday Puzzles is super cool! It's like having a brainy friend who loves puzzles as much as I do. Sometimes it gets the answers wrong, but hey, who doesn't? Keep up the good work, AI! 🤓





首页






