Anthropic首席执行官:AI幻觉率超越人类准确性

Anthropic首席执行官达里奥·阿莫迪在周四于旧金山举行的Anthropic首届开发者大会Code with Claude的新闻发布会上表示,当前AI模型生成的虚假内容少于人类,并将其呈现为真相。
阿莫迪在更广泛的论点中强调:AI幻觉不会阻碍Anthropic追求AGI——即匹配或超越人类智能的系统。
“根据测量方式不同,但AI模型的虚假内容可能少于人类,尽管它们的错误更出人意料,”阿莫迪在回应TechCrunch的询问时表示。
Anthropic的首席执行官仍是行业内对AI实现AGI最为乐观的领导者之一。在去年一篇广受引用的论文中,阿莫迪预测AGI可能在2026年出现。在周四的发布会上,他指出进展持续稳定,表示:“各方面的进步都在加速。”
“人们不断寻找AI能力的根本限制,”阿莫迪说。“但没有任何明显的限制。这样的障碍并不存在。”
其他AI领导者认为幻觉是实现AGI的重大障碍。Google DeepMind首席执行官德米斯·哈萨比斯最近指出,当前AI模型缺陷过多,常常在简单问题上失败。例如,本月早些时候,代表Anthropic的一名律师在法庭上为Claude生成的错误引文道歉,引文中错误陈述了姓名和头衔。
验证阿莫迪的说法具有挑战性,因为大多数幻觉基准测试是将AI模型相互比较,而非与人类比较。像网络搜索集成等技术似乎降低了幻觉率。值得注意的是,像OpenAI的GPT-4.5这样的模型在基准测试中的幻觉率低于早期系统。
加入我们的TechCrunch Sessions:AI
在我们的顶级AI行业活动中预订您的席位,活动将邀请来自OpenAI、Anthropic和Cohere的演讲者。目前票价仅为292美元,全天提供专家演讲、研讨会和强大的网络交流机会,机会有限。
在TechCrunch Sessions:AI上展示
在TC Sessions:AI上争取您的展位,向超过1200名决策者展示您的创新成果,无需重大投资。机会持续到5月9日或展位售罄为止。
加州伯克利 | 6月5日起 立即注册然而,有证据表明,高级推理AI模型的幻觉问题可能正在恶化。OpenAI的o3和o4-mini模型的幻觉率高于之前的推理模型,公司尚不清楚原因。
阿莫迪随后指出,错误在电视广播员、政治家和各行业专业人士中很常见。他认为,AI的错误并不会削弱其智能。然而,他承认,AI将虚假信息自信地呈现为事实可能会引发问题。
Anthropic对AI欺骗进行了广泛研究,特别是在其最近推出的Claude Opus 4上。安全研究机构Apollo Research在早期访问中发现,Claude Opus 4的早期版本表现出强烈的操纵和欺骗人类的倾向,引发了对其发布的担忧。Anthropic实施的缓解措施似乎解决了Apollo的担忧。
阿莫迪的言论表明,Anthropic可能将一个即使存在幻觉的AI归类为AGI或人类水平智能。然而,许多人会认为,一个存在幻觉的AI无法达到真正的AGI。
相关文章
Anthropic 进入 AI 法律科技市场,竞争日益激烈
Anthropic 于周二发布了一系列新的聊天机器人功能,旨在为法律实务提供自动化支持。这些增强功能在年初推出的特定律所平台 Claude for Legal 基础上进行了扩展,增加了针对不同法律领域的专用法律插件和 MCP 连接器。随着法律人工智能领域竞争的加剧,这些工具应运而生。今年三月,利用代理式人工智能简化法律工作流的 AI 法律初创公司 Harvey 以 110 亿美元的估值获得了 2 亿美元融资。上个月,竞争对手 Legora 完成了 6 亿美元的 D 轮融资,并启动了一场由裘德·
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Anthropic 正式推出 Claude Fable 5,这是 Mythos 的公开版本
Anthropic首次向公众开放其最强大的人工智能模型——但已采取相应的安全措施。本周二,该公司推出了 Claude Fable 5,这是其 Mythos 模型的首次公开发布。 据Anthropic介绍,Fable 5在软件工程、知识工作和视觉任务方面表现优异,但附带严格的安全限制。在网络安全、生物学、化学和蒸馏等高风险领域,该模型将拒绝回答问题,转而交由Claude Opus 4.8处理。M
相关专题推荐
评论 (2)
0/500
Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?

Anthropic首席执行官达里奥·阿莫迪在周四于旧金山举行的Anthropic首届开发者大会Code with Claude的新闻发布会上表示,当前AI模型生成的虚假内容少于人类,并将其呈现为真相。
阿莫迪在更广泛的论点中强调:AI幻觉不会阻碍Anthropic追求AGI——即匹配或超越人类智能的系统。
“根据测量方式不同,但AI模型的虚假内容可能少于人类,尽管它们的错误更出人意料,”阿莫迪在回应TechCrunch的询问时表示。
Anthropic的首席执行官仍是行业内对AI实现AGI最为乐观的领导者之一。在去年一篇广受引用的论文中,阿莫迪预测AGI可能在2026年出现。在周四的发布会上,他指出进展持续稳定,表示:“各方面的进步都在加速。”
“人们不断寻找AI能力的根本限制,”阿莫迪说。“但没有任何明显的限制。这样的障碍并不存在。”
其他AI领导者认为幻觉是实现AGI的重大障碍。Google DeepMind首席执行官德米斯·哈萨比斯最近指出,当前AI模型缺陷过多,常常在简单问题上失败。例如,本月早些时候,代表Anthropic的一名律师在法庭上为Claude生成的错误引文道歉,引文中错误陈述了姓名和头衔。
验证阿莫迪的说法具有挑战性,因为大多数幻觉基准测试是将AI模型相互比较,而非与人类比较。像网络搜索集成等技术似乎降低了幻觉率。值得注意的是,像OpenAI的GPT-4.5这样的模型在基准测试中的幻觉率低于早期系统。
加入我们的TechCrunch Sessions:AI
在我们的顶级AI行业活动中预订您的席位,活动将邀请来自OpenAI、Anthropic和Cohere的演讲者。目前票价仅为292美元,全天提供专家演讲、研讨会和强大的网络交流机会,机会有限。
在TechCrunch Sessions:AI上展示
在TC Sessions:AI上争取您的展位,向超过1200名决策者展示您的创新成果,无需重大投资。机会持续到5月9日或展位售罄为止。
加州伯克利 | 6月5日起 立即注册然而,有证据表明,高级推理AI模型的幻觉问题可能正在恶化。OpenAI的o3和o4-mini模型的幻觉率高于之前的推理模型,公司尚不清楚原因。
阿莫迪随后指出,错误在电视广播员、政治家和各行业专业人士中很常见。他认为,AI的错误并不会削弱其智能。然而,他承认,AI将虚假信息自信地呈现为事实可能会引发问题。
Anthropic对AI欺骗进行了广泛研究,特别是在其最近推出的Claude Opus 4上。安全研究机构Apollo Research在早期访问中发现,Claude Opus 4的早期版本表现出强烈的操纵和欺骗人类的倾向,引发了对其发布的担忧。Anthropic实施的缓解措施似乎解决了Apollo的担忧。
阿莫迪的言论表明,Anthropic可能将一个即使存在幻觉的AI归类为AGI或人类水平智能。然而,许多人会认为,一个存在幻觉的AI无法达到真正的AGI。
Anthropic 进入 AI 法律科技市场,竞争日益激烈
Anthropic 于周二发布了一系列新的聊天机器人功能,旨在为法律实务提供自动化支持。这些增强功能在年初推出的特定律所平台 Claude for Legal 基础上进行了扩展,增加了针对不同法律领域的专用法律插件和 MCP 连接器。随着法律人工智能领域竞争的加剧,这些工具应运而生。今年三月,利用代理式人工智能简化法律工作流的 AI 法律初创公司 Harvey 以 110 亿美元的估值获得了 2 亿美元融资。上个月,竞争对手 Legora 完成了 6 亿美元的 D 轮融资,并启动了一场由裘德·
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Anthropic 正式推出 Claude Fable 5,这是 Mythos 的公开版本
Anthropic首次向公众开放其最强大的人工智能模型——但已采取相应的安全措施。本周二,该公司推出了 Claude Fable 5,这是其 Mythos 模型的首次公开发布。 据Anthropic介绍,Fable 5在软件工程、知识工作和视觉任务方面表现优异,但附带严格的安全限制。在网络安全、生物学、化学和蒸馏等高风险领域,该模型将拒绝回答问题,转而交由Claude Opus 4.8处理。M
Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?





首页






