OpenAI的o3 AI模型在基準測試中的得分低於最初暗示的水準

為什麼人工智慧的基準差異很重要?
談到人工智能,數字往往能說明一切--有時候,這些數字加起來並不完全吻合。以 OpenAI 的 o3 模型為例。最初的聲稱簡直令人瞠目:據報,o3 可以處理超過 25% 難度極高的 FrontierMath 問題。在當時的情況下,競爭對手只能處理低個位數的問題。但快進到最近的發展,Epoch AI(一個受人尊敬的研究機構)對這種說法提出了質疑。他們的研究結果顯示,o3 的實際表現徘徊在 10% 左右。還不錯,但肯定不是 OpenAI 最初所吹捧的頭條數字。
到底發生了什麼事?
我們來分析一下。OpenAI最初的得分很可能是在最佳條件下取得的--這些條件在現實世界中可能無法完全複製。Epoch 指出,他們的測試環境可能與 OpenAI 的略有不同,甚至他們使用的 FrontierMath 版本也較新。這並不是說 OpenAI 徹底誤導了任何人;他們最初的聲稱與內部測試一致,但這個差異突顯了一個更廣泛的問題。基準並不總是蘋果對蘋果的比較。而且讓我們面對現實吧,公司都有誘因要把自己最好的一面展現出來。
透明度的作用
這種情況帶出了一個重要的問題:AI 公司在分享結果時應該有多透明?雖然 OpenAI 並沒有徹底說謊,但他們的訊息確實讓人產生期望,而這些期望並沒有完全達成。這是一個微妙的平衡。公司想要展示他們的進步,但也需要誠實地說明這些數字的真正意義。隨著人工智能逐漸融入日常生活,消費者和研究人員都會要求更清楚的答案。
業界其他爭議
Benchmarking 的失誤並非 OpenAI 所獨有。人工智能領域的其他廠商也面臨類似的審查。早在 1 月份,Epoch 就因為在 o3 宣佈之前接受了 OpenAI 未公開的資金而身陷水深火熱之中。與此同時,Elon Musk 的 xAI 因為涉嫌調整他們的基準圖表,讓 Grok 3 看起來比實際表現更好而受到抨擊。即使是科技巨頭之一的 Meta,最近也承認根據一個未公開的模型來推廣分數。顯而易見,主宰頭條新聞的競賽正在升溫,而且並非每個人都能公平競爭。
展望未來
雖然這些爭議看似令人沮喪,但實際上卻是進步的跡象。隨著人工智慧領域的成熟,圍繞責任的討論也日趨成熟。消費者和研究人員正在推動提高透明度,這是一件好事。這能迫使公司在呈現成就時更加深思熟慮,也能確保使用者不會被不切實際的炒作所迷惑。歸根結柢,我們的目標不應該是玩弄數字遊戲,而應該是建立能真正推動該領域發展的模型。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (7)
0/500
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

為什麼人工智慧的基準差異很重要?
談到人工智能,數字往往能說明一切--有時候,這些數字加起來並不完全吻合。以 OpenAI 的 o3 模型為例。最初的聲稱簡直令人瞠目:據報,o3 可以處理超過 25% 難度極高的 FrontierMath 問題。在當時的情況下,競爭對手只能處理低個位數的問題。但快進到最近的發展,Epoch AI(一個受人尊敬的研究機構)對這種說法提出了質疑。他們的研究結果顯示,o3 的實際表現徘徊在 10% 左右。還不錯,但肯定不是 OpenAI 最初所吹捧的頭條數字。
到底發生了什麼事?
我們來分析一下。OpenAI最初的得分很可能是在最佳條件下取得的--這些條件在現實世界中可能無法完全複製。Epoch 指出,他們的測試環境可能與 OpenAI 的略有不同,甚至他們使用的 FrontierMath 版本也較新。這並不是說 OpenAI 徹底誤導了任何人;他們最初的聲稱與內部測試一致,但這個差異突顯了一個更廣泛的問題。基準並不總是蘋果對蘋果的比較。而且讓我們面對現實吧,公司都有誘因要把自己最好的一面展現出來。
透明度的作用
這種情況帶出了一個重要的問題:AI 公司在分享結果時應該有多透明?雖然 OpenAI 並沒有徹底說謊,但他們的訊息確實讓人產生期望,而這些期望並沒有完全達成。這是一個微妙的平衡。公司想要展示他們的進步,但也需要誠實地說明這些數字的真正意義。隨著人工智能逐漸融入日常生活,消費者和研究人員都會要求更清楚的答案。
業界其他爭議
Benchmarking 的失誤並非 OpenAI 所獨有。人工智能領域的其他廠商也面臨類似的審查。早在 1 月份,Epoch 就因為在 o3 宣佈之前接受了 OpenAI 未公開的資金而身陷水深火熱之中。與此同時,Elon Musk 的 xAI 因為涉嫌調整他們的基準圖表,讓 Grok 3 看起來比實際表現更好而受到抨擊。即使是科技巨頭之一的 Meta,最近也承認根據一個未公開的模型來推廣分數。顯而易見,主宰頭條新聞的競賽正在升溫,而且並非每個人都能公平競爭。
展望未來
雖然這些爭議看似令人沮喪,但實際上卻是進步的跡象。隨著人工智慧領域的成熟,圍繞責任的討論也日趨成熟。消費者和研究人員正在推動提高透明度,這是一件好事。這能迫使公司在呈現成就時更加深思熟慮,也能確保使用者不會被不切實際的炒作所迷惑。歸根結柢,我們的目標不應該是玩弄數字遊戲,而應該是建立能真正推動該領域發展的模型。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎





首頁






