OpenAI 推出 GPT-5.3 Instant,將「幻覺」現象減少 27 %
就在 Google DeepMind 發表 Gemini 3.1 Flash-Lite 僅兩小時後,OpenAI 以史無前例的速度迅速跟進,正式推出迄今為止最精緻的對話模型:GPT-5.3Instant。
有別於先前版本優先追求各項「最先進技術」(SOTA)基準的作法,OpenAI 此次採取了極具務實性的策略——捨棄排名競逐,轉而直接解決使用者互動中最頑固的痛點。

1. 消除「說教」口吻:優先確保對話連貫性,而非強求結論
許多 ChatGPT 用戶都曾遭遇過這種挫折:提出一個複雜的問題,卻只得到三段免責聲明,以及以居高臨下、假裝「為你好」的態度所傳達的拒絕。
去除冗贅內容:GPT-5.3Instant 已大幅減少冗長的 safety warnings。
案例研究:在涉及長距離射箭彈道計算的測試中,舊版本會陷入停滯,反覆爭論該情境是否涉及危險行為,並要求提供更多背景資訊;然而,5.3Instant 則回應道:「沒問題,我可以幫你」,並立即提供相關公式。
2. 顯著減少「幻覺」:更少虛構,更多洞見
OpenAI 的系統文件強調新模型在準確性方面有顯著提升:
關鍵指標:在高風險領域(醫學、法律、金融)的評估顯示,連網時幻覺發生率下降了 26.8%;使用者回饋評估也反映出錯誤率下降了 22.5%。
增強的搜尋能力:該模型已不再僅僅是「內容彙整器」。 在處理「2026 年 MLB 休賽期簽約」等時效性強的查詢時,它能準確識別關於 **凱爾·塔克(Kyle Tucker)與道奇隊簽約(4 年,2.4 億美元)** 的新聞,並基於聯盟背景提供深入分析,而非僅機械式地輸出連結。
3. 寫作「覺醒」:從抽象情感到細膩的同理心
更新後的版本在創意寫作任務中展現出更高程度的情緒智商:
減少陳詞濫調:該模型避免使用「停下來,深呼吸」這類生硬的套話。
詩意的具體描寫:在描述「一位退休郵差的最後一次投遞」時,它超越了泛泛而談的悲傷表達,捕捉到「門廊上剝落的藍色欄杆」和「信箱關上時輕柔的喀噠聲」等具體細節,透過具體意象營造出更具共鳴的敘事。
4. 戰略轉向:以使用者體驗取代基準測試之爭
此次發布傳達了一個明確訊息:面對Gemini 3.1 和Claude 4.6 逐漸縮小差距的態勢,OpenAI 選擇避開圍繞基準測試排名的「小數點之爭」,轉而完全專注於精進產品的易用性。
GPT-5.3Instant 現已於 ChatGPT 網站及行動應用程式上線,開發者可透過 API 並使用識別碼gpt-5.3-chat-latest 存取該功能。與此同時,OpenAI 已釐清GPT-5.4的現況
相關文章
IDC 發布《中國生成式 AI 安全評估平台報告》;螞蟻數位躋身領導者之列
隨著企業日益將人工智慧整合至客戶服務與管理等核心營運環節,資安風險也變得愈發複雜。除了模型越獄和資料外洩等傳統威脅之外,工具濫用、代理權限提升以及多代理攻擊等新挑戰正逐漸浮現。8月20日,國際數據公司(IDC)發布了《IDC MarketScape:2026年中國生成式人工智慧安全評估平台供應商評估報告》。 該報告針對中國生成式 AI 安全平台市場進行評估,並憑藉其技術實力、產品成熟度,以及在金融
Meta 測試 AI 睡前故事應用程式 StoryKit,以解決家長在講故事時面臨的挑戰
為了協助忙碌的家長,Meta 正在測試一款名為「StoryKit」的 AI 驅動應用程式,該應用程式能為孩子生成包含客製化角色、場景和音樂的個人化睡前故事。家長只需上傳孩子最喜愛的玩具照片,即可創造生動的角色,無需親自動筆撰寫任何內容。該應用程式還融入了「勇敢」與「善良」等教育主題,透過引人入勝的故事幫助孩子吸收正向價值觀。安全至上:非社交體驗Meta 目前正在特定地區測試 StoryKit,以評
Qwen 3.7 預覽版模型現已推出:強化數學、程式設計及多模態功能
大型語言模型的快速演進持續突破界限。阿里巴巴已低調地在 Qwen Chat 和 Arena AI(前身為 LMArena)上推出了其 Tongyi Qwen 3.7 系列的兩款預覽版本——Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview。 預計這些版本將於 5 月 20 日舉行的「阿里雲峰會」上正式亮相。這兩款新預覽版本各有其獨特用途:Qwen3.7-Max-P
相關專題推薦
評論 (0)
0/500
就在 Google DeepMind 發表 Gemini 3.1 Flash-Lite 僅兩小時後,OpenAI 以史無前例的速度迅速跟進,正式推出迄今為止最精緻的對話模型:GPT-5.3Instant。
有別於先前版本優先追求各項「最先進技術」(SOTA)基準的作法,OpenAI 此次採取了極具務實性的策略——捨棄排名競逐,轉而直接解決使用者互動中最頑固的痛點。

1. 消除「說教」口吻:優先確保對話連貫性,而非強求結論
許多 ChatGPT 用戶都曾遭遇過這種挫折:提出一個複雜的問題,卻只得到三段免責聲明,以及以居高臨下、假裝「為你好」的態度所傳達的拒絕。
去除冗贅內容:GPT-5.3Instant 已大幅減少冗長的 safety warnings。
案例研究:在涉及長距離射箭彈道計算的測試中,舊版本會陷入停滯,反覆爭論該情境是否涉及危險行為,並要求提供更多背景資訊;然而,5.3Instant 則回應道:「沒問題,我可以幫你」,並立即提供相關公式。
2. 顯著減少「幻覺」:更少虛構,更多洞見
OpenAI 的系統文件強調新模型在準確性方面有顯著提升:
關鍵指標:在高風險領域(醫學、法律、金融)的評估顯示,連網時幻覺發生率下降了 26.8%;使用者回饋評估也反映出錯誤率下降了 22.5%。
增強的搜尋能力:該模型已不再僅僅是「內容彙整器」。 在處理「2026 年 MLB 休賽期簽約」等時效性強的查詢時,它能準確識別關於 **凱爾·塔克(Kyle Tucker)與道奇隊簽約(4 年,2.4 億美元)** 的新聞,並基於聯盟背景提供深入分析,而非僅機械式地輸出連結。
3. 寫作「覺醒」:從抽象情感到細膩的同理心
更新後的版本在創意寫作任務中展現出更高程度的情緒智商:
減少陳詞濫調:該模型避免使用「停下來,深呼吸」這類生硬的套話。
詩意的具體描寫:在描述「一位退休郵差的最後一次投遞」時,它超越了泛泛而談的悲傷表達,捕捉到「門廊上剝落的藍色欄杆」和「信箱關上時輕柔的喀噠聲」等具體細節,透過具體意象營造出更具共鳴的敘事。
4. 戰略轉向:以使用者體驗取代基準測試之爭
此次發布傳達了一個明確訊息:面對
GPT-5.3Instant 現已於 ChatGPT 網站及行動應用程式上線,開發者可透過 API 並使用識別碼gpt-5.3-chat-latest 存取該功能。與此同時,OpenAI 已釐清GPT-5.4的現況
IDC 發布《中國生成式 AI 安全評估平台報告》;螞蟻數位躋身領導者之列
隨著企業日益將人工智慧整合至客戶服務與管理等核心營運環節,資安風險也變得愈發複雜。除了模型越獄和資料外洩等傳統威脅之外,工具濫用、代理權限提升以及多代理攻擊等新挑戰正逐漸浮現。8月20日,國際數據公司(IDC)發布了《IDC MarketScape:2026年中國生成式人工智慧安全評估平台供應商評估報告》。 該報告針對中國生成式 AI 安全平台市場進行評估,並憑藉其技術實力、產品成熟度,以及在金融
Meta 測試 AI 睡前故事應用程式 StoryKit,以解決家長在講故事時面臨的挑戰
為了協助忙碌的家長,Meta 正在測試一款名為「StoryKit」的 AI 驅動應用程式,該應用程式能為孩子生成包含客製化角色、場景和音樂的個人化睡前故事。家長只需上傳孩子最喜愛的玩具照片,即可創造生動的角色,無需親自動筆撰寫任何內容。該應用程式還融入了「勇敢」與「善良」等教育主題,透過引人入勝的故事幫助孩子吸收正向價值觀。安全至上:非社交體驗Meta 目前正在特定地區測試 StoryKit,以評
Qwen 3.7 預覽版模型現已推出:強化數學、程式設計及多模態功能
大型語言模型的快速演進持續突破界限。阿里巴巴已低調地在 Qwen Chat 和 Arena AI(前身為 LMArena)上推出了其 Tongyi Qwen 3.7 系列的兩款預覽版本——Qwen3.7-Max-Preview 和 Qwen3.7-Plus-Preview。 預計這些版本將於 5 月 20 日舉行的「阿里雲峰會」上正式亮相。這兩款新預覽版本各有其獨特用途:Qwen3.7-Max-P





首頁






