OpenAI的o3 AI模型在基准测试中的得分低于最初暗示的水平

为什么基准差异在人工智能中很重要
说到人工智能,数字往往能说明问题--而有时,这些数字并不完全吻合。以 OpenAI 的 o3 模型为例。据报道,o3 可以处理超过 25% 难度极高的 FrontierMath 问题。在当时的情况下,竞争对手只能处理低个位数的问题。但快进到最近的发展,Epoch AI--一家受人尊敬的研究机构--对这一说法提出了质疑。他们的研究结果表明,o3 的实际性能徘徊在 10% 左右。还不错,但肯定不是OpenAI最初吹嘘的那个吸引眼球的数字。
到底发生了什么?
让我们来分析一下。OpenAI最初的得分很可能是在最佳条件下取得的--现实世界中可能无法完全复制。Epoch指出,他们的测试环境可能与OpenAI的略有不同,甚至他们使用的FrontierMath版本也较新。这并不是说OpenAI完全误导了任何人;他们最初的说法与内部测试一致,但这种差异凸显了一个更广泛的问题。基准并不总是苹果与苹果之间的比较。面对现实吧,公司都有动力把自己最好的一面展现出来。
透明度的作用
这种情况提出了一个重要问题:人工智能公司在分享结果时应该有多透明?虽然 OpenAI 并没有赤裸裸地撒谎,但他们的信息确实让人产生了没有完全满足的期望。这是一个微妙的平衡。公司希望展示自己的进步,但也需要诚实地说明这些数字的真正含义。随着人工智能越来越多地融入日常生活,消费者和研究人员都会要求得到更清晰的答案。
行业内的其他争议
基准测试的失误并非 OpenAI 独有。人工智能领域的其他公司也面临着类似的审查。今年 1 月,就在 o3 发布公告之前,Epoch 就因为接受了 OpenAI 未公开的资助而陷入了舆论的漩涡。与此同时,埃隆-马斯克(Elon Musk)的 xAI 因涉嫌调整基准图表,使 Grok 3 看起来比实际情况更好而受到抨击。就连科技巨头之一的 Meta 公司最近也承认,他们基于一个未公开的模型来推广分数。显然,争夺头条新闻的竞争正在白热化,而且并非每个人都在公平竞争。
展望未来
虽然这些争议看似令人沮丧,但它们实际上是进步的标志。随着人工智能领域的成熟,围绕问责制的讨论也日趋激烈。消费者和研究人员正在推动提高透明度,这是一件好事。这迫使公司在展示其成就时更加深思熟虑,并确保用户不会被不切实际的炒作所迷惑。归根结底,我们的目标不应该是玩弄数字游戏,而应该是建立真正推动该领域发展的模型。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (7)
0/500
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

为什么基准差异在人工智能中很重要
说到人工智能,数字往往能说明问题--而有时,这些数字并不完全吻合。以 OpenAI 的 o3 模型为例。据报道,o3 可以处理超过 25% 难度极高的 FrontierMath 问题。在当时的情况下,竞争对手只能处理低个位数的问题。但快进到最近的发展,Epoch AI--一家受人尊敬的研究机构--对这一说法提出了质疑。他们的研究结果表明,o3 的实际性能徘徊在 10% 左右。还不错,但肯定不是OpenAI最初吹嘘的那个吸引眼球的数字。
到底发生了什么?
让我们来分析一下。OpenAI最初的得分很可能是在最佳条件下取得的--现实世界中可能无法完全复制。Epoch指出,他们的测试环境可能与OpenAI的略有不同,甚至他们使用的FrontierMath版本也较新。这并不是说OpenAI完全误导了任何人;他们最初的说法与内部测试一致,但这种差异凸显了一个更广泛的问题。基准并不总是苹果与苹果之间的比较。面对现实吧,公司都有动力把自己最好的一面展现出来。
透明度的作用
这种情况提出了一个重要问题:人工智能公司在分享结果时应该有多透明?虽然 OpenAI 并没有赤裸裸地撒谎,但他们的信息确实让人产生了没有完全满足的期望。这是一个微妙的平衡。公司希望展示自己的进步,但也需要诚实地说明这些数字的真正含义。随着人工智能越来越多地融入日常生活,消费者和研究人员都会要求得到更清晰的答案。
行业内的其他争议
基准测试的失误并非 OpenAI 独有。人工智能领域的其他公司也面临着类似的审查。今年 1 月,就在 o3 发布公告之前,Epoch 就因为接受了 OpenAI 未公开的资助而陷入了舆论的漩涡。与此同时,埃隆-马斯克(Elon Musk)的 xAI 因涉嫌调整基准图表,使 Grok 3 看起来比实际情况更好而受到抨击。就连科技巨头之一的 Meta 公司最近也承认,他们基于一个未公开的模型来推广分数。显然,争夺头条新闻的竞争正在白热化,而且并非每个人都在公平竞争。
展望未来
虽然这些争议看似令人沮丧,但它们实际上是进步的标志。随着人工智能领域的成熟,围绕问责制的讨论也日趋激烈。消费者和研究人员正在推动提高透明度,这是一件好事。这迫使公司在展示其成就时更加深思熟虑,并确保用户不会被不切实际的炒作所迷惑。归根结底,我们的目标不应该是玩弄数字游戏,而应该是建立真正推动该领域发展的模型。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎





首页






