OpenAI 因振动绘图技术面临反弹

在本周四的 GPT-5 大型直播中,OpenAI 展示了几张图表,似乎展示了该模型令人印象深刻的能力,但仔细观察就会发现数据可视化中存在一些不一致的地方。
具有讽刺意味的是,在一张说明 GPT-5 在 "跨模型欺骗评估"(deception evals across models)中表现的图表中,刻度似乎出现了错位。例如,台上的图表声称,GPT-5 的 "思维 "欺骗率达到了 50.0%。然而,OpenAI 较小的 o3 模型--据报道为 47.4%--却显示为一个较大的条形图。然而,OpenAI 在 GPT-5 官方博文中公布的数据显示,GPT-5 的实际欺骗率为 16.5%。
这种视觉上的不匹配意味着,在台上,GPT-5 的条形图显示得比 o3 的高,尽管它报告的分数更低。在同一张图表的其他地方,o3 和 GPT-4o 得到了不同的分数,但却用相同大小的条形图表示。这个错误非常严重,以至于首席执行官山姆-奥特曼(Sam Altman)公开承认了这一错误,并将这一事件称为 "巨大的图表失误",同时澄清博客中包含的是正确的版本。
OpenAI 的一名营销人员也表示了歉意,他说:"我们在博客中修复了图表,各位,很抱歉无意中造成了图表犯罪。
周五,在回答 Reddit 用户关于图表的问题时,Altman 解释说:"这里的数字是准确的,但我们在直播时弄错了柱形图。在另一张幻灯片上,我们弄错了数字"。他确认博文和系统卡数据准确无误,并补充说:"团队成员工作到很晚,疲惫不堪,这导致了人为错误。这一切都发生在直播的最后一刻"。
尽管如此,在如此重要的发布日出现这样的错误还是让人感到遗憾--尤其是在宣传新机型 "在减少幻觉方面取得重大进展 "的时候。
8 月 8 日更新:添加了 Altman 的 Reddit 评论。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
相关专题推荐
评论 (0)
0/500

在本周四的 GPT-5 大型直播中,OpenAI 展示了几张图表,似乎展示了该模型令人印象深刻的能力,但仔细观察就会发现数据可视化中存在一些不一致的地方。
具有讽刺意味的是,在一张说明 GPT-5 在 "跨模型欺骗评估"(deception evals across models)中表现的图表中,刻度似乎出现了错位。例如,台上的图表声称,GPT-5 的 "思维 "欺骗率达到了 50.0%。然而,OpenAI 较小的 o3 模型--据报道为 47.4%--却显示为一个较大的条形图。然而,OpenAI 在 GPT-5 官方博文中公布的数据显示,GPT-5 的实际欺骗率为 16.5%。
这种视觉上的不匹配意味着,在台上,GPT-5 的条形图显示得比 o3 的高,尽管它报告的分数更低。在同一张图表的其他地方,o3 和 GPT-4o 得到了不同的分数,但却用相同大小的条形图表示。这个错误非常严重,以至于首席执行官山姆-奥特曼(Sam Altman)公开承认了这一错误,并将这一事件称为 "巨大的图表失误",同时澄清博客中包含的是正确的版本。
OpenAI 的一名营销人员也表示了歉意,他说:"我们在博客中修复了图表,各位,很抱歉无意中造成了图表犯罪。
周五,在回答 Reddit 用户关于图表的问题时,Altman 解释说:"这里的数字是准确的,但我们在直播时弄错了柱形图。在另一张幻灯片上,我们弄错了数字"。他确认博文和系统卡数据准确无误,并补充说:"团队成员工作到很晚,疲惫不堪,这导致了人为错误。这一切都发生在直播的最后一刻"。
尽管如此,在如此重要的发布日出现这样的错误还是让人感到遗憾--尤其是在宣传新机型 "在减少幻觉方面取得重大进展 "的时候。
8 月 8 日更新:添加了 Altman 的 Reddit 评论。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里





首页






