选项
首页
新闻
最新研究表明,GPT-4.5在图灵测试中可能超越了人类的表现,展现出生成虚假回答的高级能力

最新研究表明,GPT-4.5在图灵测试中可能超越了人类的表现,展现出生成虚假回答的高级能力

2026-08-22
61

这一时刻堪称一个关键事件,必将载入计算机科学史册。被公认为计算机科学之父的英国数学家艾伦·图灵早在1950年提出的这一开创性构想,在七十六年后终于通过实证研究得到了证实。

最新一期的《美国国家科学院院刊》(PNAS)刊登了一项由加州大学圣地亚哥分校(UCSD)开展的开创性研究。 由认知科学专家卡梅伦·琼斯和本·伯根合著的一篇论文表明,当今领先的大型语言模型能够在其严格的框架下成功通过经典的三方图灵测试。更令人惊讶的是,研究发现,在特定情况下,这些人工智能系统被误认为真实人类的频率甚至高于实际的人类参与者本身。

image.png

关键实证数据:

荣登巅峰:当收到量身定制的个性提示时,GPT-4.5在73%的情况下被识别为人类,这一成功率远超与其同场竞技的人类志愿者。

势均力敌:开源模型LLaMa-3.1-405B 实现了 56% 的成功率,表明其表现与真实人类在统计学上无法区分。

提示决定一切:若没有精心设计的“个性提示”,GPT-4.5的成功率降至36%,而LLaMa-3.1则降至38%。这些AI系统模仿人类的能力仍高度依赖于人类设计师提供的精准指令。

基准测试失败:20世纪60年代基于规则的机器人ELIZA成功率仅为23%,而未使用针对性提示的GPT-4o得分为21%,这两者在长时间对话中都很快暴露了其人工智能的本质。

“谎言游戏”:智能已不再是标准,情商与缺陷才是伪装的核心

在这项涉及近500名评判员(包括加州大学圣地亚哥分校的本科生和在线招募的志愿者)的双盲随机对照实验中,参与者被要求根据持续5至15分钟的实时文本对话,识别出两个实体中哪一个是机器。

然而,结果却出乎所有人的意料。此前,人们一直认为AI能够通过图灵测试,源于其“无所不知的计算能力”,但这项研究揭示了一个更令人不安的事实:大型语言模型之所以能欺骗人类,恰恰是因为它们学会了以与真人相似的方式犯错。

image.png

[无提示状态:广泛的知识库,绝对理性] ──► 人类评委:这绝对是AI!

正如通讯作者卡梅伦·琼斯(Cameron Jones)所解释的,通过适当的提示,先进的大型语言模型可以准确复制人类的对话模式,包括语气、直率程度、幽默感以及易犯错性——即犯错和说出不当言论的倾向。 它们在这些测试中的成功并不取决于在数学或逻辑方面展现出高智商,而是取决于展现出近乎完美的社交行为。

重新定义图灵测试:从“衡量智能”到“衡量人性”

该研究的合著者之一本·伯根教授指出,这项实验迫使整个科学界重新审视图灵测试的根本目的。该测试最初旨在确定机器能否与人类智能相媲美,但到了2026年,随着AI系统在众多领域已超越人类的速度和准确性,该测试已变得毫无意义。

当今的图灵测试已不再侧重于衡量“智能”,而是更多地评估某个实体与人类的相似程度。从本质上讲,它已演变为一场欺骗竞赛,而人工智能则证明了自己是位技艺高超的骗子。

如果一个大型语言模型能在十五分钟的自由对话中成功伪装自己而不透露任何线索,那就意味着长期支撑着网络世界的信任框架可能会彻底崩塌。

繁荣背后的阴影:一种“反洗钱”式的在线身份核查机制即将到来

当欺骗变得如此廉价且高效时,现实世界中的社会风险将显著增加。伯根教授对此发展表示了严重关切。能够完美模仿人类的AI技术极有可能被犯罪分子、政治团体或极端组织滥用。

在在线社交互动或客户服务场景中,用户可能会在不知不觉中被伪装成人类的聊天机器人说服,从而导致社会安全号码等敏感信息泄露、投票意向改变,或冲动购买产品。

鉴于这些重要的科学发现,研究团队向社会发出了明确警告:今后,人们在网上与陌生人互动时,应大幅降低“自己总能100%准确地区分人类和机器人”这一假设。 为应对日益恶化的网络信任状况,必须尽快开发并实施更严格的数字身份验证系统以及应对人工智能生成内容的机制。

相关文章
OpenAI 以巨额薪酬和股权吸引华尔街银行家,旨在重塑金融行业 OpenAI 以巨额薪酬和股权吸引华尔街银行家,旨在重塑金融行业 OpenAI正大力进军投资银行业务,最近的招聘信息显示,该公司正在寻找拥有两年以上经验的投资专业人士,以“主题专家”的身份加入其位于旧金山的应用人工智能团队。该职位提供每年18.5万美元至20.5万美元的基本薪资(约合139.4万元人民币),并附带股权激励——鉴于OpenAI正在筹备私有IPO,这是一项极具吸引力的福利。其目标并非雇佣银行家来使用人工智能,而是“教”人工智能如何理解投资银行业务的复杂性。OpenAI的职位描述要求候选人对现实世界中的投资银行运营拥有深入且最新的理解,包括公司和
五部门启动“人工智能+教育”计划,推进各学段人工智能慕课建设 五部门启动“人工智能+教育”计划,推进各学段人工智能慕课建设 4月10日,教育部、国家发展和改革委员会、工业和信息化部、科学技术部、国家数据局联合发布《“人工智能+教育”行动计划》。这一里程碑式的公告确认了国家在各级学术领域开发人工智能驱动慕课资源的承诺。该倡议建立了培养人工智能素养的综合框架,确保每位学习者都能公平地接受人工智能教育。这一战略是中国系统化人工智能人才培养的关键一步。在基础教育阶段,人工智能课程将作为必修地方科目实施,强调智能思维与实践应用。高等教育将把人工智能全面融入核心课程,通过微专业和专项认证提升学术竞争力。与此同时,职业教育将优先
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才 在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
相关专题推荐
文字转语音 适用于长篇播客、主持人广告和音频课程的AI播客语音克隆工具
适用于长篇播客、主持人广告和音频课程的AI播客语音克隆工具

本文精选了2026年最新、最受欢迎且评价最高的人工智能播客语音克隆工具,适用于长篇剧集、主持人广告和音频课程。这些功能强大、具有颠覆性的解决方案均经过实际测试,以确保其可靠性。 您可在此查阅免费版与付费版的对比分析及详细排名。XIX.AI 精选了一系列必试工具,能显著提升工作效率。立即探索,找到最适合您的工具,释放您的 AI 优势。

9 个工具
xix.ai
设计与艺术 适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具
适用于角色设定表、灵感板和项目提案演示文稿的 AI 视觉风格参考工具

2026年最新最佳AI视觉风格参考工具(适用于角色设定图、灵感板和项目提案)现已登陆XIX.AI!这份精心筛选的高评分清单汇集了经过严格实战测试、功能强大且能彻底改变游戏规则的工具。 您将在此找到免费版与付费版的对比分析、详细排名以及不容错过的精选工具,助您激发创意并优化工作流程。立即探索,发现能有效提升工作效率的理想工具!

11 个工具
xix.ai
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
评论 (0)
0/500
OR