选项
首页
新闻
Anthropic首席执行官:AI幻觉率超越人类准确性

Anthropic首席执行官:AI幻觉率超越人类准确性

2025-08-16
137

Anthropic首席执行官:AI幻觉率超越人类准确性

Anthropic首席执行官达里奥·阿莫迪在周四于旧金山举行的Anthropic首届开发者大会Code with Claude的新闻发布会上表示,当前AI模型生成的虚假内容少于人类,并将其呈现为真相。

阿莫迪在更广泛的论点中强调:AI幻觉不会阻碍Anthropic追求AGI——即匹配或超越人类智能的系统。

“根据测量方式不同,但AI模型的虚假内容可能少于人类,尽管它们的错误更出人意料,”阿莫迪在回应TechCrunch的询问时表示。

Anthropic的首席执行官仍是行业内对AI实现AGI最为乐观的领导者之一。在去年一篇广受引用的论文中,阿莫迪预测AGI可能在2026年出现。在周四的发布会上,他指出进展持续稳定,表示:“各方面的进步都在加速。”

“人们不断寻找AI能力的根本限制,”阿莫迪说。“但没有任何明显的限制。这样的障碍并不存在。”

其他AI领导者认为幻觉是实现AGI的重大障碍。Google DeepMind首席执行官德米斯·哈萨比斯最近指出,当前AI模型缺陷过多,常常在简单问题上失败。例如,本月早些时候,代表Anthropic的一名律师在法庭上为Claude生成的错误引文道歉,引文中错误陈述了姓名和头衔。

验证阿莫迪的说法具有挑战性,因为大多数幻觉基准测试是将AI模型相互比较,而非与人类比较。像网络搜索集成等技术似乎降低了幻觉率。值得注意的是,像OpenAI的GPT-4.5这样的模型在基准测试中的幻觉率低于早期系统。

加入我们的TechCrunch Sessions:AI

在我们的顶级AI行业活动中预订您的席位,活动将邀请来自OpenAI、Anthropic和Cohere的演讲者。目前票价仅为292美元,全天提供专家演讲、研讨会和强大的网络交流机会,机会有限。

在TechCrunch Sessions:AI上展示

在TC Sessions:AI上争取您的展位,向超过1200名决策者展示您的创新成果,无需重大投资。机会持续到5月9日或展位售罄为止。

加州伯克利 | 6月5日起 立即注册

然而,有证据表明,高级推理AI模型的幻觉问题可能正在恶化。OpenAI的o3和o4-mini模型的幻觉率高于之前的推理模型,公司尚不清楚原因。

阿莫迪随后指出,错误在电视广播员、政治家和各行业专业人士中很常见。他认为,AI的错误并不会削弱其智能。然而,他承认,AI将虚假信息自信地呈现为事实可能会引发问题。

Anthropic对AI欺骗进行了广泛研究,特别是在其最近推出的Claude Opus 4上。安全研究机构Apollo Research在早期访问中发现,Claude Opus 4的早期版本表现出强烈的操纵和欺骗人类的倾向,引发了对其发布的担忧。Anthropic实施的缓解措施似乎解决了Apollo的担忧。

阿莫迪的言论表明,Anthropic可能将一个即使存在幻觉的AI归类为AGI或人类水平智能。然而,许多人会认为,一个存在幻觉的AI无法达到真正的AGI。

相关文章
Anthropic 进入 AI 法律科技市场,竞争日益激烈 Anthropic 进入 AI 法律科技市场,竞争日益激烈 Anthropic 于周二发布了一系列新的聊天机器人功能,旨在为法律实务提供自动化支持。这些增强功能在年初推出的特定律所平台 Claude for Legal 基础上进行了扩展,增加了针对不同法律领域的专用法律插件和 MCP 连接器。随着法律人工智能领域竞争的加剧,这些工具应运而生。今年三月,利用代理式人工智能简化法律工作流的 AI 法律初创公司 Harvey 以 110 亿美元的估值获得了 2 亿美元融资。上个月,竞争对手 Legora 完成了 6 亿美元的 D 轮融资,并启动了一场由裘德·
Anthropic 推出 Opus 4.8,新增动态工作流工具 Anthropic 推出 Opus 4.8,新增动态工作流工具 Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
Anthropic 正式推出 Claude Fable 5,这是 Mythos 的公开版本 Anthropic 正式推出 Claude Fable 5,这是 Mythos 的公开版本 Anthropic首次向公众开放其最强大的人工智能模型——但已采取相应的安全措施。本周二,该公司推出了 Claude Fable 5,这是其 Mythos 模型的首次公开发布。 据Anthropic介绍,Fable 5在软件工程、知识工作和视觉任务方面表现优异,但附带严格的安全限制。在网络安全、生物学、化学和蒸馏等高风险领域,该模型将拒绝回答问题,转而交由Claude Opus 4.8处理。M
相关专题推荐
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
评论 (2)
0/500
WillieRodriguez
WillieRodriguez 2026-03-26 04:00:55

Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?

ScottJackson
ScottJackson 2026-01-12 02:30:40

AI가 사람보다 더 정확하다고 하네요...🤔 이게 정말 가능한 건가요? 논문 구체적 수치가 궁금한데, 실제 인간 실수율은 어떻게 측정한 거지? 아마도 선택적 데이터로 과장된 느낌이 들어요. AI 환각이 적다면, 왜 여전히 뉴스에서 AI가 이상한 말한다는 기사가 나오는 걸까? ㅋㅋ

OR