選項
首頁
新聞
隨著 Sol 和 Luna 加入,OpenAI GPT-6 在各項基準測試中將代幣成本削減一半

隨著 Sol 和 Luna 加入,OpenAI GPT-6 在各項基準測試中將代幣成本削減一半

2026-10-04
21

根據 Artificial Analysis 的報告,GPT-6 Sol (max) 在智慧能力方面名列榜首,售價為 48 美元。圖片來源:Getty Images

在 OpenAI 推出 GPT-6 Sol 和 Luna 之後,解決方案工程總監 Matt Weaver 向《AI Magazine》闡述了這些新模型如何為企業提供更強大的營運靈活性。

OpenAI 近期推出了 GPT-6 Astra,並將其描述為「全球最智能且最符合需求模型」。該人工智慧實驗室隨後又宣布推出 GPT-6 Sol 和 GPT-6 Luna,這兩款性價比高的變體模型採用與其旗艦模型 GPT-6 Astra 相似的訓練方法。

隨著對代幣使用成本上漲的擔憂日益加劇,人工智慧公司之間的價格競爭也愈發激烈,尤其是當中國的開放式模型威脅要搶佔企業客戶時。

基準測試公司 Artificial Analysis 指出,GPT-6 Sol 和 Luna 與 GPT-5.6 Sol 及 Luna 相比,成本降低了半數,正「推動成本效益的邊界」。

OpenAI 解決方案工程主管 Matt Weaver 向《AI Magazine》表示:「透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型。」

OpenAI 解決方案工程主管 Matt Weaver。圖片來源:Matt Weaver/LinkedIn

將模型與工作流程相結合

OpenAI 聲稱其 GPT-6 模型引領成本-效能曲線,透過專為高效、大規模部署設計的基礎架構,在所有層級皆能提供卓越的能力。

該公司指出,快取與推論技術的進步使這些模型能以更低的成本提供服務,並透過將 Sol 和 Luna 的 API 價格(相較於 GPT-5.6 的促銷費率)下調 50%,將節省的成本直接回饋給用戶。

在闡述各 AI 模型的獨特角色時,Matt 補充道:「GPT-6 Astra 專為要求最嚴苛的專案而設計,在這些專案中,極致的處理能力至關重要。

OpenAI GPT-6 在各項基準測試中,Sol & Luna 的代幣成本均減半

Matt 進一步說明:「GPT-6 Sol 專為複雜的專業任務而打造,包括繁複的商業工作流程與程式編寫;而 GPT-6 Luna 則為文件摘要或資訊擷取等大量且定義明確的任務,提供更高效的解決方案。

「Sol 和 Luna 將 Astra 在專業工作、事實準確性、程式碼編寫及電腦應用方面的進展,融入到更快、更經濟實惠的模型中。隨著 AI 從實驗階段過渡到核心業務運作,為每種任務類型選擇合適的模型至關重要。

「我們的目標是讓先進的人工智慧在各組織中得以實際應用——協助團隊加快進度、做出更明智的決策,並將更多時間投入於更高價值的工作。」

關鍵事實

  • OpenAI 將 GPT-6 Sol 和 Luna 的 API 價格較 GPT-5.6 調降 50%
  • GPT-6 Sol 在 AutomationBench 上的表現超越 Claude Opus 5,成本卻僅為其 9%
  • GPT-6 Sol(最高設定)的輸出速度可達每秒 131 個標記
  • Intelligence Index 任務成本降至 Sol 每項 1.06 美元、Luna 每項 0.07 美元
  • GPT-6 Sol 與 Luna 在 AA-Omniscience 基準測試中均展現出較低的幻覺率。

模型效能分析

OpenAI 強調,在 AutomationBench(一項跨應用程式的商業工作流程測試)中,GPT-6 Sol 採用「xhigh」努力程度時,其表現優於採用「max」努力程度的 Claude Opus 5,且每項任務的成本僅為 Opus 5 的 9%。

該公司指出,在「高」努力程度下,GPT-6 Luna 的表現較前代模型提升了 5.4 個百分點,且每項任務的成本降低了 58%。

OpenAI 指出,在評估代理程式處理複雜專業工作流程能力的「Agents’ Last Exam」測試中,以「max effort」模式運作的 GPT-6 Sol 獲得 56.4% 的得分,超越 Claude Opus 5 在該評估中的最高分,且每項任務的成本降低了 61%。

該公司指出,在評估程式設計代理能否產出可直接合併至真實程式碼庫的變更的「FrontierCode」測試中,GPT-6 Sol 相較於 GPT-5.6 Sol 展現顯著進步,且以遠低於後者的成本達到與 Claude Fable 5.1 xhigh 相當的表現。

這兩款模型在「AA-Omniscience」(Artificial Analysis 用於評估知識與幻覺的基準測試)中,均展現出較低的幻覺發生率。

透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型

——OpenAI 解決方案工程總監

Matt Weaver

每項「智慧指數任務」的成本。圖片來源:Artificial Analysis

這家基準測試公司解釋道,GPT-6 Sol 版本包含六種模型,每種模型在智慧水平、效能及定價方面均具有獨特特性。透過比較這六種模型的關鍵指標,Artificial Analysis 發現:

  • 就智能而言,GPT-6 Sol 的頂級模型是 GPT-6 Sol (max),數值為 48。
  • 就輸出速度而言,最快的模型是 GPT-6 Sol (max),達 131 t/s。
  • 就延遲而言,GPT-6 Sol (Non-reasoning) 以 0.93 秒的「首次回答標記時間」表現最優。
  • 在定價方面,GPT-6 Sol (low) 每任務成本為 0.13 美元,為最低。各模型間的價格差異最高可達 8 倍。

該公司發現,在各模型中,智慧指數(Intelligence Index)與編碼代理指數(Coding Agent Index)的分數仍與 GPT-5.6 保持一致,部分評估指標有所進步,部分則出現退步。

GPT-6 Sol 專為艱鉅的專業工作而設計——從複雜的商業工作流程到程式碼編寫皆然;而 GPT-6 Luna 則為大量且定義明確的任務(如文件摘要或資訊擷取)提供更高效的選項。

——OpenAI 解決方案工程主管 Matt Weaver

在 FrontierCode 1.1 Main⁠ 中,AI 代理所編寫的程式碼不僅會根據正確性進行評分,還會評估其「可合併性」:例如測試品質、範圍規範、程式碼風格以及是否符合程式碼庫標準。圖片來源:OpenAI

成本效益的重要性

圍繞 AI 模型定價的競爭日益白熱化,這往往是由低成本的中國模型所驅動。 正如布魯金斯學會的凱爾·陳(Kyle Chan)在部落格中所指出的,中國模型大多為開源,讓使用者能夠自訂模型,並以較低價格取得具備美國模型 90% 功能的能力。因此,這些模型正在以成本為導向的企業中迅速佔據一席之地。

OpenAI 正積極調整策略以維持競爭力;儘管新模型每項任務產出的標記數量略多,但運行「人工分析智慧指數(Artificial Analysis Intelligence Index)」的成本卻顯著降低:

  • GPT-6 Sol(最高設定):每項任務成本為 1.06 美元(較 GPT-5.6 Sol 的 1.99 美元下降約 50%),即使輸出代幣量從 GPT-5.6 的 2.9 萬增加至 3.1 萬。
  • GPT-6 Luna(最高設定):每項任務成本為 0.07 美元(較 GPT-5.6 Luna 的 0.18 美元下降約 60%),儘管輸出代幣量從 GPT-5.6 的 4.1 萬增加至 5.1 萬。

Artificial Analysis 指出,這兩項發布使 OpenAI 得以佔據成本效益帕累托前沿(即在不提高價格的情況下無法進一步提升效能的最佳邊界)的顯著部分。

透過在不犧牲效能的前提下降低門檻,OpenAI 正積極因應企業的「代幣疲勞」問題,同時抵禦低成本市場競爭對手的挑戰。

相關文章
史丹佛大學研究人員如何運用人工智慧設計出人工病毒 史丹佛大學研究人員如何運用人工智慧設計出人工病毒 人工智慧領域的領導者們已指出,具備生物學能力的AI模型可能帶來的潛在風險。圖片來源:CDC/Unsplash美國研究人員利用人工智慧設計出首種針對大腸桿菌的合成病毒,而 Anthropic 執行長達里奧·阿莫迪(Dario Amodei)則對人工智慧引發的生物威脅表示擔憂。美國史丹佛大學的科學家利用人工智慧,設計出自然界中不存在的病毒。該團隊的研究基於「Evo 2」生成的基因組,這是一種旨在透過提
Hexagon:超過半數的成年人對機器人感到興奮 Hexagon:超過半數的成年人對機器人感到興奮 機器人正日益融入企業營運。圖片來源:HumanoidHexagon 的數據顯示,59% 的成年人對與機器人共事感到興奮,但日益壯大的「機器人世代」兒童對人工智慧工作環境的期待更是遠超於此Hexagon 最新數據顯示,超過半數的成年人對與機器人共事的展望感到興奮。這項數據將成年人的觀點與兒童的觀點進行了對比,後者持有不同看法,且將引領下一代。數據顯示,五分之四的兒童(80%)表示對機器人感到興奮,而
AI 墳場:一份持續更新的失敗專案與新創公司清單 AI 墳場:一份持續更新的失敗專案與新創公司清單 Relay 是一項以人工智慧驅動的工作流程自動化平台,定位為 Zapier 的替代方案,已於週一停止營運。該服務讓使用者能透過 AI 代理程式自動化電子郵件和任務工作流程,但隨著 OpenAI、Google 及其他主要平台將類似的自動化功能直接整合至其生態系統中,成立五年的 Relay 已難以證明其作為獨立產品的存在價值。Relay 這家被大型平台超越的新創公司,反映了當前產業格局的一面。然而,許
相關專題推薦
音樂創作 用於音樂創作的 AI 歌詞構思工具
用於音樂創作的 AI 歌詞構思工具

2026 年最新、最受好評的 AI 歌詞構思工具,盡在 XIX.AI!這份精心挑選的清單收錄了多款強大且具革命性的工具,這些工具均經過實際測試,能快速提供高品質的歌詞構思,協助使用者激發創意並簡化音樂創作流程。 您還可獲取免費版與付費版的比較概覽。立即探索,發掘最適合您的工具!

16 個工具
xix.ai
漫畫創作 用於漫畫世界構建的AI角色設定表工具
用於漫畫世界構建的AI角色設定表工具

2026 年最新最佳頂級評分 AI 角色表工具,助力漫畫世界構建,現已登陸 XIX.AI!本精選列表收錄了經過嚴格現實測試的強大且具顛覆性的選項。您將看到免費與付費版本的對比,以及每週更新的排行榜,助您發掘那些能激發創意並簡化世界構建任務的必備工具。立即探索,解鎖您的 AI 優勢!

13 個工具
xix.ai
自動化 n8n AI 自動化工具,適用於內部營運、資料同步及多步驟代理流程
n8n AI 自動化工具,適用於內部營運、資料同步及多步驟代理流程

2026 年最新最佳 n8n AI 自動化工具,適用於內部營運、資料同步及多步驟代理流程,現已登場!XIX.AI 精心精選了一系列廣受好評、功能強大且能徹底改變遊戲規則的工具,可提升各項工作任務的生產力。 每項工具均經過嚴格的實際環境測試以確保可靠性,並提供詳盡的免費版與付費版比較,以及每週更新的排行榜。這些必試選項能助您發揮 AI 優勢,並輕鬆優化工作流程。立即探索,找出最適合您的工具!

11 個工具
xix.ai
迅速的 最適合多模型團隊的最佳提示管理工具
最適合多模型團隊的最佳提示管理工具

2026 年最新、最受好評的多模型團隊必備提示語管理工具! XIX.AI 精心精選了一系列強大且顛覆遊戲規則的必試工具,提供免費與付費版本的比較、實際應用測試以及詳細排名。這些頂級解決方案能透過簡化工作流程、消除重複作業,並在所有團隊專案中激發創意,從而顯著提升生產力。立即探索,找到最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
會議助理 適用於遠端團隊的 AI 會議摘要工具
適用於遠端團隊的 AI 會議摘要工具

2026 年最新、最受好評的遠端團隊 AI 會議摘要工具!XIX.AI 精心精選了一系列強大且顛覆業界的必試工具,這些工具均經過實測驗證,能提供精準的會議記錄與可付諸行動的洞察。 您將在此找到免費與付費版本的比較數據及詳細排名,助您挑選最理想的方案,從而提升生產力並優化團隊溝通。立即探索,釋放您的 AI 優勢!

13 個工具
xix.ai
軟件開發 最佳 AI DevOps 輔助工具:監控部署、日誌及故障事件
最佳 AI DevOps 輔助工具:監控部署、日誌及故障事件

2026年最新、最優秀、評分最高的AI DevOps輔助工具彙總,專為監控部署流程、日誌記錄及故障處理而設計。XIX.AI透過實際應用測試與嚴格的評分體系,提供了極具突破性的強大工具,能夠顯著提升工作效率。您可以檢視免費版與付費版的對比資訊,找到最適合您工作流程的理想解決方案。立即探索,讓AI優勢助力您的業務發展。

7 個工具
xix.ai
評論 (0)
0/500
OR