OpenAI 推出 GPT-5.4 Pro 及 Thinking 版本

週四,OpenAI 推出了 GPT-5.4,這是一款被描述為「我們目前功能最強大且最高效的專業工作前沿模型」的新基礎模型。除了標準版本外,GPT-5.4 還提供專注於推理的變體(GPT-5.4 Thinking)以及性能優化的版本(GPT-5.4 Pro)。
該模型的 API 版本將支援長達 100 萬個標記的上下文視窗,創下 OpenAI 迄今為止提供的最大上下文容量紀錄。
OpenAI 亦強調了提升的標記效率,指出 GPT-5.4 解決相同問題所需的標記數量,遠少於其前代產品。
新模型在基準測試中表現大幅提升,於電腦應用基準測試 OSWorld-Verified 和 WebArena Verified 中創下紀錄分數。此外,在 OpenAI 針對知識型工作任務的 GDPval 測試中,更以 83% 的得分刷新紀錄。
根據 Mercor 執行長 Brendan Foody 的聲明,GPT-5.4 在 Mercor 的 APEX-Agents 基準測試中表現領先,該測試旨在評估法律與金融領域的專業技能。
「[GPT-5.4] 在產出長週期交付成果方面表現卓越,例如簡報檔、財務模型及法律分析,」Foody 表示,「不僅展現頂尖效能,運作速度更勝競品前沿模型,且成本更低。」
GPT-5.4 延續了 OpenAI 降低「幻覺」與事實錯誤的研發成果。該公司報告指出,相較於 GPT-5.2,新模型在單一陳述中出現錯誤的機率降低了 33%,整體回應中包含錯誤的機率則降低了 18%。
作為此次發布的一部分,OpenAI 重新設計了 GPT-5.4 API 處理工具調用的方式,並引入了一套名為「工具搜尋」(Tool Search)的新系統。此前,系統提示必須預先定義所有可用工具——隨著工具庫的擴展,此過程會消耗大量代幣。新系統允許模型按需檢索工具定義,使在擁有眾多工具的環境中,請求處理速度更快且更具成本效益。
OpenAI 還新增了一項安全評估機制,用以檢視其模型的「思維鏈」——這是在執行多步驟任務時,揭示模型推理過程的即時註解。AI 安全研究人員長期以來一直擔憂,推理型模型可能會誤導其思維鏈,而測試結果證實,在特定條件下確實可能發生這種情況。
OpenAI 的新評估顯示,在 GPT-5.4 的「思考版」(Thinking version)中,這種誤導行為發生的機率較低,這「表明該模型缺乏隱藏其推理過程的能力,且 CoT 監控仍是一種有效的安全工具。」
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (0)
0/500

週四,OpenAI 推出了 GPT-5.4,這是一款被描述為「我們目前功能最強大且最高效的專業工作前沿模型」的新基礎模型。除了標準版本外,GPT-5.4 還提供專注於推理的變體(GPT-5.4 Thinking)以及性能優化的版本(GPT-5.4 Pro)。
該模型的 API 版本將支援長達 100 萬個標記的上下文視窗,創下 OpenAI 迄今為止提供的最大上下文容量紀錄。
OpenAI 亦強調了提升的標記效率,指出 GPT-5.4 解決相同問題所需的標記數量,遠少於其前代產品。
新模型在基準測試中表現大幅提升,於電腦應用基準測試 OSWorld-Verified 和 WebArena Verified 中創下紀錄分數。此外,在 OpenAI 針對知識型工作任務的 GDPval 測試中,更以 83% 的得分刷新紀錄。
根據 Mercor 執行長 Brendan Foody 的聲明,GPT-5.4 在 Mercor 的 APEX-Agents 基準測試中表現領先,該測試旨在評估法律與金融領域的專業技能。
「[GPT-5.4] 在產出長週期交付成果方面表現卓越,例如簡報檔、財務模型及法律分析,」Foody 表示,「不僅展現頂尖效能,運作速度更勝競品前沿模型,且成本更低。」
GPT-5.4 延續了 OpenAI 降低「幻覺」與事實錯誤的研發成果。該公司報告指出,相較於 GPT-5.2,新模型在單一陳述中出現錯誤的機率降低了 33%,整體回應中包含錯誤的機率則降低了 18%。
作為此次發布的一部分,OpenAI 重新設計了 GPT-5.4 API 處理工具調用的方式,並引入了一套名為「工具搜尋」(Tool Search)的新系統。此前,系統提示必須預先定義所有可用工具——隨著工具庫的擴展,此過程會消耗大量代幣。新系統允許模型按需檢索工具定義,使在擁有眾多工具的環境中,請求處理速度更快且更具成本效益。
OpenAI 還新增了一項安全評估機制,用以檢視其模型的「思維鏈」——這是在執行多步驟任務時,揭示模型推理過程的即時註解。AI 安全研究人員長期以來一直擔憂,推理型模型可能會誤導其思維鏈,而測試結果證實,在特定條件下確實可能發生這種情況。
OpenAI 的新評估顯示,在 GPT-5.4 的「思考版」(Thinking version)中,這種誤導行為發生的機率較低,這「表明該模型缺乏隱藏其推理過程的能力,且 CoT 監控仍是一種有效的安全工具。」
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






