GPT-5 發布遇阻:OpenAI 積極應對推出挑戰

更新時間:2025年8月8日星期五下午5點21分(美國東部時間):本文發表後不久,OpenAI聯合創始人兼執行長 Sam Altman 確認公司將為特定用戶恢復 GPT-4o 及其他舊版模型的存取權限,並承認 GPT-5 的推出「比我們預期的更為坎坷」。
說得委婉些,萬眾期待的 OpenAI 新模型 GPT-5 的發布起步頗為艱難。
即使忽略昨日直播發布會上的圖表錯誤和語音演示故障(該發布會介紹了四款不同模型以及其中三款可使用的「思考」模式),發布以來的多份用戶報告顯示,GPT-5 在處理相對簡單的問題時表現掙扎,而這些問題早前的 OpenAI 模型——以及競爭對手的 AI 實驗室系統——都能正確解決。
例如,資料科學家 Colin Fraser 分享了 GPT-5 錯誤處理數學證明的截圖——具體來說,是 8.888 無限循環是否等於 9(答案是不等於)。
哇,我本來只是隨便試試,但它真的有點笨 pic.twitter.com/ao51nOH0Ui
— Colin Fraser (@colin_fraser) August 8, 2025
它在一個簡單的算術方程式 5.9 = x + 5.11 上也失敗了,這是許多小學生都能解決的問題。
這令人擔憂。 https://t.co/PUbeCSgtRV
— Benjamin De Kraker (@BenjaminDEKR) August 8, 2025
使用 GPT-5 來評估 OpenAI 自身有缺陷的簡報圖表,也未能產生有用或準確的回應。
問:證明使用 LLM-as-a-judge 仍然行不通
答: pic.twitter.com/KnCK5Xs9ja
— Kangwook Lee (@Kangwook_Lee) August 7, 2025
此外,它在這個較為棘手的文字題上也栽了跟頭(必須承認,連我起初都覺得頗具挑戰性——儘管伊隆·馬斯克的 Grok 4 AI 正確解答了它。提示:請記住石板不能切割;所有 80 塊必須保持完整)。
小心別在崎嶇的前沿領域傷到自己 pic.twitter.com/buJGgJ6baI
— Greg Burnham (@GregHBurnham) August 8, 2025
在我的測試中,較舊的 GPT-4o 模型至少能更可靠地處理其中一道數學問題。不幸的是,OpenAI 正逐步為 ChatGPT 用戶淘汰那些舊模型——包括先前預設的 GPT-4o 和進階推理模型 o3——儘管開發者在近期內仍能透過 API 存取它們。
編程表現未達基準測試水準
儘管 OpenAI 的內部基準測試和某些第三方測試顯示 GPT-5 是編程效能最佳的模型,但實際使用情況表明,Anthropic 最近升級的 Claude Opus 4.1 在處理「一次性」任務時往往更有效——能根據要求交付用戶預期的應用程式或軟體建置。請看開發者 Justin Sun 在 X 平台上發布的這個例子:
Opus 4.1 一次嘗試「建立一個 3D 水豚寵物樂園」——總共 8 分鐘
這實在太瘋狂了,不僅水豚更可愛且會動,還有個別的親密度等級、晝夜切換器、餵食功能,甚至還有截圖功能 pic.twitter.com/FiKTO3FKK4
— justin (@justinsunyt) August 7, 2025
此外,安全公司 SPLX 的一份報告揭露,OpenAI 的內部安全措施在業務一致性、對提示注入攻擊和混淆邏輯攻擊的易感性等領域存在重大漏洞。
儘管是軼事證據,但來自 AI 資深用戶的早期回饋表明總體反應冷淡。
AI 網紅暨前谷歌員工 Bilawal Sidhu 在 X 上進行了一項投票,詢問追隨者的「感覺檢查」。截至目前有 172 票,最主要的回應是「有點普通」。
好了,GPT-5 感覺檢查
— Bilawal Sidhu (@bilawalsidhu) August 7, 2025
正如化名帳號 AI Leaks and News 所指出的:「來自 X 和 Reddit AMA 的壓倒性共識是對 GPT-5 極度負面。」
來自 X 和 Reddit AMA 的壓倒性共識是對 GPT-5 極度負面
大多數用戶對故障的模型選擇器以及非專業用戶無法存取舊版模型感到不滿
你對 GPT-5 的最初想法是什麼?
— AI Leaks and News (@AILeaksAndNews) August 8, 2025
AIPRM 首席工程師、X 平台上知名的 AI 評論家 Tibor Blaho 彙整了一份關於 ChatGPT-5 推出問題的全面總結。他指出,其中一項旗艦功能——根據查詢複雜度自動選擇思考或非思考模式的「路由器」——已成為主要抱怨點,因為該模型對許多用戶經常預設使用非思考模式。
GPT-5 的發布目前為止進展令人有點難過,尤其是在漫長等待和高度期待之後
– 模型間的自動切換(路由器)似乎部分故障/不可靠
– 不清楚你實際互動的究竟是哪個模型(標準版或迷你版,…
— Tibor Blaho (@btibor91) August 8, 2025
競爭者蓄勢待發
因此,圍繞 ChatGPT-5 的輿論遠非一片叫好——這對 OpenAI 構成嚴峻挑戰,因為來自美國巨頭如 Google 和 Anthropic 的競爭加劇,同時來自越來越多的免費、開源且能力強大的中國大型語言模型的競爭也在升溫,這些模型提供了許多美國模型所缺乏的功能。
以阿里巴巴千問研究團隊為例,他們今天將其高效能 Qwen 3 模型升級至支援 100 萬個 token 的上下文長度。這使得用戶每次互動可交換的資訊量幾乎是 GPT-5 目前提供量的四倍。
隨著 OpenAI 本週另一項重大發布——新的開源 gpt-oss 模型系列——也獲得褒貶不一的早期評價,這家用戶領先的專注 AI 公司(ChatGPT 目前擁有 7 億週活躍用戶)前景變得不明朗。
這種情緒在預測市場 Polymarket 上得到呼應,用戶壓倒性地押注 Google 很可能在 2025 年 8 月底前擁有領先的 AI 模型。
其他資深用戶,例如 Otherside AI 的聯合創始人兼執行長 Matt Shumer——他早期取得了 GPT-5 存取權並發布了正面評價——建議,隨著更多人針對新模型優化其工作流程,意見可能會發生變化:
許多體驗不佳的人是在尚未針對 GPT-5 優化的代理框架中使用它。
對於每個新模型發布,從發布到整合該模型的公司真正使其順暢運行之間存在時間差。
代理公司急於…
— Matt Shumer (@mattshumer_) August 8, 2025
雖然現在評價 GPT-5 還為時過早——並且隨著更多人在各種任務中測試它,意見可能會顯著改變——但初步跡象表明,這並非像之前 GPT-4、GPT-4o 或 o3 等發布那樣是支「全壘打」。對於這家最近剛完成新一輪融資,但由於高昂的研發支出仍處於虧損狀態的公司來說,這是一個令人擔憂的信號。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (1)
0/500

更新時間:2025年8月8日星期五下午5點21分(美國東部時間):本文發表後不久,OpenAI聯合創始人兼執行長 Sam Altman 確認公司將為特定用戶恢復 GPT-4o 及其他舊版模型的存取權限,並承認 GPT-5 的推出「比我們預期的更為坎坷」。
說得委婉些,萬眾期待的 OpenAI 新模型 GPT-5 的發布起步頗為艱難。
即使忽略昨日直播發布會上的圖表錯誤和語音演示故障(該發布會介紹了四款不同模型以及其中三款可使用的「思考」模式),發布以來的多份用戶報告顯示,GPT-5 在處理相對簡單的問題時表現掙扎,而這些問題早前的 OpenAI 模型——以及競爭對手的 AI 實驗室系統——都能正確解決。
例如,資料科學家 Colin Fraser 分享了 GPT-5 錯誤處理數學證明的截圖——具體來說,是 8.888 無限循環是否等於 9(答案是不等於)。
哇,我本來只是隨便試試,但它真的有點笨 pic.twitter.com/ao51nOH0Ui
— Colin Fraser (@colin_fraser) August 8, 2025
它在一個簡單的算術方程式 5.9 = x + 5.11 上也失敗了,這是許多小學生都能解決的問題。
這令人擔憂。 https://t.co/PUbeCSgtRV
— Benjamin De Kraker (@BenjaminDEKR) August 8, 2025
使用 GPT-5 來評估 OpenAI 自身有缺陷的簡報圖表,也未能產生有用或準確的回應。
問:證明使用 LLM-as-a-judge 仍然行不通
— Kangwook Lee (@Kangwook_Lee) August 7, 2025
答: pic.twitter.com/KnCK5Xs9ja
此外,它在這個較為棘手的文字題上也栽了跟頭(必須承認,連我起初都覺得頗具挑戰性——儘管伊隆·馬斯克的 Grok 4 AI 正確解答了它。提示:請記住石板不能切割;所有 80 塊必須保持完整)。
小心別在崎嶇的前沿領域傷到自己 pic.twitter.com/buJGgJ6baI
— Greg Burnham (@GregHBurnham) August 8, 2025
在我的測試中,較舊的 GPT-4o 模型至少能更可靠地處理其中一道數學問題。不幸的是,OpenAI 正逐步為 ChatGPT 用戶淘汰那些舊模型——包括先前預設的 GPT-4o 和進階推理模型 o3——儘管開發者在近期內仍能透過 API 存取它們。
編程表現未達基準測試水準
儘管 OpenAI 的內部基準測試和某些第三方測試顯示 GPT-5 是編程效能最佳的模型,但實際使用情況表明,Anthropic 最近升級的 Claude Opus 4.1 在處理「一次性」任務時往往更有效——能根據要求交付用戶預期的應用程式或軟體建置。請看開發者 Justin Sun 在 X 平台上發布的這個例子:
Opus 4.1 一次嘗試「建立一個 3D 水豚寵物樂園」——總共 8 分鐘
— justin (@justinsunyt) August 7, 2025
這實在太瘋狂了,不僅水豚更可愛且會動,還有個別的親密度等級、晝夜切換器、餵食功能,甚至還有截圖功能 pic.twitter.com/FiKTO3FKK4
此外,安全公司 SPLX 的一份報告揭露,OpenAI 的內部安全措施在業務一致性、對提示注入攻擊和混淆邏輯攻擊的易感性等領域存在重大漏洞。
儘管是軼事證據,但來自 AI 資深用戶的早期回饋表明總體反應冷淡。
AI 網紅暨前谷歌員工 Bilawal Sidhu 在 X 上進行了一項投票,詢問追隨者的「感覺檢查」。截至目前有 172 票,最主要的回應是「有點普通」。
好了,GPT-5 感覺檢查
— Bilawal Sidhu (@bilawalsidhu) August 7, 2025
正如化名帳號 AI Leaks and News 所指出的:「來自 X 和 Reddit AMA 的壓倒性共識是對 GPT-5 極度負面。」
來自 X 和 Reddit AMA 的壓倒性共識是對 GPT-5 極度負面
— AI Leaks and News (@AILeaksAndNews) August 8, 2025
大多數用戶對故障的模型選擇器以及非專業用戶無法存取舊版模型感到不滿
你對 GPT-5 的最初想法是什麼?
AIPRM 首席工程師、X 平台上知名的 AI 評論家 Tibor Blaho 彙整了一份關於 ChatGPT-5 推出問題的全面總結。他指出,其中一項旗艦功能——根據查詢複雜度自動選擇思考或非思考模式的「路由器」——已成為主要抱怨點,因為該模型對許多用戶經常預設使用非思考模式。
GPT-5 的發布目前為止進展令人有點難過,尤其是在漫長等待和高度期待之後
— Tibor Blaho (@btibor91) August 8, 2025
– 模型間的自動切換(路由器)似乎部分故障/不可靠
– 不清楚你實際互動的究竟是哪個模型(標準版或迷你版,…
競爭者蓄勢待發
因此,圍繞 ChatGPT-5 的輿論遠非一片叫好——這對 OpenAI 構成嚴峻挑戰,因為來自美國巨頭如 Google 和 Anthropic 的競爭加劇,同時來自越來越多的免費、開源且能力強大的中國大型語言模型的競爭也在升溫,這些模型提供了許多美國模型所缺乏的功能。
以阿里巴巴千問研究團隊為例,他們今天將其高效能 Qwen 3 模型升級至支援 100 萬個 token 的上下文長度。這使得用戶每次互動可交換的資訊量幾乎是 GPT-5 目前提供量的四倍。
隨著 OpenAI 本週另一項重大發布——新的開源 gpt-oss 模型系列——也獲得褒貶不一的早期評價,這家用戶領先的專注 AI 公司(ChatGPT 目前擁有 7 億週活躍用戶)前景變得不明朗。
這種情緒在預測市場 Polymarket 上得到呼應,用戶壓倒性地押注 Google 很可能在 2025 年 8 月底前擁有領先的 AI 模型。
其他資深用戶,例如 Otherside AI 的聯合創始人兼執行長 Matt Shumer——他早期取得了 GPT-5 存取權並發布了正面評價——建議,隨著更多人針對新模型優化其工作流程,意見可能會發生變化:
許多體驗不佳的人是在尚未針對 GPT-5 優化的代理框架中使用它。
— Matt Shumer (@mattshumer_) August 8, 2025
對於每個新模型發布,從發布到整合該模型的公司真正使其順暢運行之間存在時間差。
代理公司急於…
雖然現在評價 GPT-5 還為時過早——並且隨著更多人在各種任務中測試它,意見可能會顯著改變——但初步跡象表明,這並非像之前 GPT-4、GPT-4o 或 o3 等發布那樣是支「全壘打」。對於這家最近剛完成新一輪融資,但由於高昂的研發支出仍處於虧損狀態的公司來說,這是一個令人擔憂的信號。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






