OpenAI 面臨 Vibe-Graphing 技術的反彈

OpenAI 在週四舉辦的 GPT-5 活動中,展示了幾張圖表,看起來似乎展示了該模型令人印象深刻的能力,但仔細一看,卻發現資料可視化中有一些不一致的地方。
具有諷刺意味的是,在一個說明 GPT-5 在「跨模型欺騙評估」(deception evals across models)中表現的圖表中,刻度似乎錯位了。舉例來說,台上的圖表聲稱,GPT-5 在「思考」方面的欺騙率達到了 50.0%。然而,OpenAI 較小的 o3 模型(據報告為 47.4%)卻顯示為一個較大的橫條。然而,OpenAI 的官方 GPT-5 博文中發佈的數據顯示,GPT-5 的實際欺騙率為 16.5%。
這種視覺上的錯配意味著,在台上,GPT-5 的橫條顯示得比 o3 高,儘管它報告的分數較低。在同一張圖表的其他地方,o3 和 GPT-4o 得到了不同的分數,但卻用相同大小的橫條來表示。這個錯誤相當嚴重,讓執行長 Sam Altman 不得不公開承認,並標籤這次事件為「超大型的圖表失誤」,同時澄清部落格所載的是正確的版本。
OpenAI 的一位行銷人員也表示歉意,他說:「我們在部落格中修正了圖表,各位,很抱歉無意的圖表犯罪」。
週五,Altman 在回應 Reddit 用戶對圖表的詢問時解釋:「這裡的數字是準確的,但我們在直播時把柱狀圖弄亂了。在另一張幻燈片上,我們弄錯了數字"。他確認部落格文章和系統卡資料都是準確的,並補充說,「團隊成員工作到很晚,疲憊不堪,導致人為錯誤。這一切都是在直播的最後一刻才發生的"。
儘管如此,在如此重要的發佈日,這些錯誤仍為該公司帶來了不幸的外觀,尤其是在該公司宣傳新機型「在減少幻覺方面的重大進展」之時。
8 月 8 日更新:新增 Altman 的 Reddit 評論。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
相關專題推薦
評論 (0)
0/500

OpenAI 在週四舉辦的 GPT-5 活動中,展示了幾張圖表,看起來似乎展示了該模型令人印象深刻的能力,但仔細一看,卻發現資料可視化中有一些不一致的地方。
具有諷刺意味的是,在一個說明 GPT-5 在「跨模型欺騙評估」(deception evals across models)中表現的圖表中,刻度似乎錯位了。舉例來說,台上的圖表聲稱,GPT-5 在「思考」方面的欺騙率達到了 50.0%。然而,OpenAI 較小的 o3 模型(據報告為 47.4%)卻顯示為一個較大的橫條。然而,OpenAI 的官方 GPT-5 博文中發佈的數據顯示,GPT-5 的實際欺騙率為 16.5%。
這種視覺上的錯配意味著,在台上,GPT-5 的橫條顯示得比 o3 高,儘管它報告的分數較低。在同一張圖表的其他地方,o3 和 GPT-4o 得到了不同的分數,但卻用相同大小的橫條來表示。這個錯誤相當嚴重,讓執行長 Sam Altman 不得不公開承認,並標籤這次事件為「超大型的圖表失誤」,同時澄清部落格所載的是正確的版本。
OpenAI 的一位行銷人員也表示歉意,他說:「我們在部落格中修正了圖表,各位,很抱歉無意的圖表犯罪」。
週五,Altman 在回應 Reddit 用戶對圖表的詢問時解釋:「這裡的數字是準確的,但我們在直播時把柱狀圖弄亂了。在另一張幻燈片上,我們弄錯了數字"。他確認部落格文章和系統卡資料都是準確的,並補充說,「團隊成員工作到很晚,疲憊不堪,導致人為錯誤。這一切都是在直播的最後一刻才發生的"。
儘管如此,在如此重要的發佈日,這些錯誤仍為該公司帶來了不幸的外觀,尤其是在該公司宣傳新機型「在減少幻覺方面的重大進展」之時。
8 月 8 日更新:新增 Altman 的 Reddit 評論。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有





首頁






