OpenAI 的 GPT-4.5 模型亮相:批判性評估
OpenAI 最近宣佈 GPT-4.5 後,人工智慧社群為之沸騰。在直播揭曉之後,核心問題仍然是:這代表了重大突破,還是只是微妙的升級?我們的深入分析檢視了圍繞 GPT-4.5 的聲稱,將其與前代產品和競爭對手進行比較,從宣傳炒作中區分出事實。
重點
GPT-4.5 在市場上被宣稱為具有增強預訓功能的多功能通用模型。
早期的基準資料顯示 GPT-4.5 在特定任務上落後於某些開放原始碼模型。
GPT-4.5 的 API 定價遠高於先前的版本。
人們開始質疑 OpenAI 是否將純粹的規模優先於模型架構和訓練方法的真正創新改進。
DeepSeek V3 等替代方案提供了性能可比、效率更高的強大開源選項。
GPT-4.5:承諾與現實
初步反應與未解答的問題
對於 GPT-4.5 的亮相,市場的反應是興奮與懷疑並存。

強調讓機型看起來「更自然」,讓人對其具體、可量測的進步產生疑問。許多人感到疑惑:它的幻覺是否減少了?它在日常應用中真正超越 GPT-4o 的程度有多大?這些懸而未決的疑問要求我們更深入地探究這個模型的效能與技術基礎。
在人工智慧領域中,失望的感覺是顯而易見的。使用者正在尋求可量化的進步,超越表面上自然的對話方式。真正衡量其成功與否的標準,將是其管理複雜任務、提供實用解決方案,以及產生真正創意成果的能力。
任何人工智慧模型最終都是以其客觀效能與成本效益來評斷。如果無法在這些關鍵領域取得重大進展,「更自然」互動的吸引力可能不足以成為升級的理由。
基準比較:近距離觀察
GPT-4.5 的官方基準資料顯示有些乏善可陳。

雖然 GPT-4.5 在某些領域有所進步,但在相對較新的開放原始碼模型 DeepSeek V3 上,GPT-4.5 的表現明顯落後。考慮到 OpenAI 龐大的資源和專業知識,這實在令人驚訝。將 GPT-4.5 與其直接前身 GPT-4o 進行比較,而不是與更多現代競爭對手進行比較的決定,進一步加深了人們的懷疑。
以下是基準效能的細分,強調值得關注的關鍵領域:
- 數學 (AIME '24):GPT-4.5 的準確率為 36.7%,與其他可用的基礎模型相比相對較低。這是非常重要的能力,因為強大的數學推理能力對於許多實際世界的應用是非常重要的。
- 科學 (GPQA):在這方面,GPT-4.5 的表現較為穩健,準確率達到 71.4%。這顯示 GPT-4.5 對科學原理有扎實的理解,但這並不代表 GPT-4.5 的整體能力超群。
- 編碼 (SWE-Bench Verified):GPT-4.5 的得分率為 38%,顯示在編程任務上有明顯的弱點。
重要的是要記住,這些基準只提供模型在特定、受控情境中能力的有限觀點。徹底的評估需要在不同的真實應用環境中進行測試,才能準確衡量其潛力。
任務 GPT-4.5 精確度 GPT-4o 精確度 GPQA (科學) 71.4% 53.6% AIME '24(數學) 36.7% 9.3% SWE-Bench Verified (編碼) 38% 31% MMMU(多模式) 74.4% 69.1%
API 定價:自然」的溢價?
使用 GPT-4.5 API 的成本明顯比早期型號高。

這種定價策略引起了關於可及性的重要問題,特別是對於小型公司和獨立開發人員而言。在「自然性」方面的改進是否足以證明大幅提價是合理的?
對大多數人而言,答案可能是否定的。AI 模型的基本價值在於其效能、精確度和作業效率。如果 GPT-4.5 無法在這些核心指標上有顯著的躍進,其高昂的成本將難以維護。更經濟實惠的開放原始碼替代方案可能會獲得顯著的吸引力。
考慮 Aider 編碼基準:在 GPT-4.5 上執行的成本遠高於使用 DeepSeek V3。這種價格差異造成較高的入門門檻,可能會阻礙 GPT-4.5 在開發人員之間的廣泛採用。
此外,據報導,GPT-4.5 的價格比 DeepSeek 高出數百倍。光是這個成本因素,就可能成為許多人捨 GPT-4.5 而選擇更經濟的系統的決定性原因。
型號 輸入價格 (每 100 萬代用幣) 輸出價格 (每 100 萬個代幣) GPT-4.5 $75.00 $150.00 GPT-4o $2.50 $10.00
開放原始碼替代方案的崛起:DeepSeek V3
DeepSeek V3 为何值得关注
DeepSeek V3等高性能开源模型的崛起对OpenAI的市场领导地位构成了严峻挑战。

DeepSeek V3 提供了具有竞争力的性能、运营效率和模型透明度等极具吸引力的组合。據報導,它的成本比 GPT-4.5 低數百倍。
以下是它的一些主要優點:
- 有競爭力的效能:如基準所示,DeepSeek V3 在數學和編碼等關鍵領域與 GPT-4.5 競爭,有時甚至超越 GPT-4.5。
- 成本效益:DeepSeek V3 採用開放原始碼,沒有相關的 API 成本,因此部署成本大幅降低。這將先進的人工智慧開放給更廣泛的使用者。
- 透明度與客製化:開放源碼模型提供了更高的工作透明度,並允許進行廣泛的客製化。開發人員可以針對特定用途調整模型,並參與模型的演進。
值得注意的是,DeepSeek 最近舉辦了「開放源碼週」,發佈了多個專注於 GPU 效率與最佳化的儲存庫。這正是許多企業在擴大營運規模時所需要的實用創新,而非僅是提昇模型的會話感。
GPT-4.5:權衡利弊
優點
更自然、更流暢的語言互動潛力。
在某些任務類別可能有專門的進步。
OpenAI 持續的開發與維護支援。
強大的一般語言能力。
缺點
相較於競爭對手,API 成本過高。
在多項基準測試中,效能落後於領先的開放原始碼替代方案。
模型的內部架構和訓練資料不清楚。
在數學和編碼任務上有明顯的弱點。
價格比 GPT-4o 高出 12 到 30 倍。
常見問題
GPT-4.5 是 GPT-4o 的重大升級嗎?
最初的基準結果並不一致。它在某些學科上顯示出進步,但在特定挑戰上卻無法與其他開放原始碼模型相提並論。要明確評估其價值,需要更全面的實際評估。
GPT-4.5 是否值得高昂的 API 成本?
答案取決於您的特定需求和財務限制。如果您需要頂級效能來處理特定的關鍵應用程式,可能值得考慮。然而,對大多數使用者來說,高昂的價格並不值得,尤其是有能力且免費提供的開放原始碼選項。
DeepSeek V3 等開源 AI 模型的主要優勢是什麼?
開放原始碼模型可提供具有競爭力的效能、卓越的成本效益、更高的作業透明度,以及客製化的彈性。它們讓每個人都能使用強大的 AI 工具,並鼓勵社群驅動的創新。
相關問題
人工智能模型開發的未來是什麼?
AI 發展的軌跡很可能會涉及到專屬與開源努力之間的協同效應。OpenAI 等大型科技公司將持續以大規模模型推動技術發展,而開放原始碼社群則在人工智慧存取民主化及透過協同開發與客製化促進創新方面扮演關鍵角色。我們必須承認 GPT-4.5 有顯著的缺點,OpenAI 需要解決幾個方面的問題,才能有效地與其他開源模型競爭。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
相關專題推薦
評論 (5)
0/500
Die Diskussion um GPT-4.5 erinnert mich an die ewige Frage: Ist es wirklich ein Durchbruch oder nur ein cleveres Marketing-Upgrade? 🤔 Die Geschwindigkeitssteigerung klingt praktisch, aber ich frage mich, ob die Kosten für Endnutzer wieder steigen werden. Die KI-Community scheint gespalten – einige feiern es, andere sehen nur inkrementelle Fortschritte. Spannend wird sein, wie sich das auf den Wettbewerb mit anderen Modellen auswirkt.
Die Diskussion um GPT-4.5 ist echt spannend. Ich frage mich, ob die Verbesserungen wirklich so bahnbrechend sind oder ob es eher um Marketing geht. Die KI-Entwicklung wird immer schneller, aber die Kosten und der Energieverbrauch sind auch ein Thema, über das man reden sollte. 🤔
이번 GPT-4.5 발표를 보면서 AI 경쟁이 점점 더 치열해지고 있다는 생각이 들어요. 🤔 다른 기업들도 곧 비슷한 모델을 내놓지 않을까? 기술 발전 속도가 너무 빨라서 따라가기 벅차네요. 개인정보 보호 문제는 어떻게 해결할지 궁금해지는데...
Wait, another model drop already? 🤔 The speed is insane but I'm low-key worried about how smaller AI labs can keep up. Also, did they mention anything about training costs this time? The energy consumption talk is always glossed over...
OpenAI 最近宣佈 GPT-4.5 後,人工智慧社群為之沸騰。在直播揭曉之後,核心問題仍然是:這代表了重大突破,還是只是微妙的升級?我們的深入分析檢視了圍繞 GPT-4.5 的聲稱,將其與前代產品和競爭對手進行比較,從宣傳炒作中區分出事實。
重點
GPT-4.5 在市場上被宣稱為具有增強預訓功能的多功能通用模型。
早期的基準資料顯示 GPT-4.5 在特定任務上落後於某些開放原始碼模型。
GPT-4.5 的 API 定價遠高於先前的版本。
人們開始質疑 OpenAI 是否將純粹的規模優先於模型架構和訓練方法的真正創新改進。
DeepSeek V3 等替代方案提供了性能可比、效率更高的強大開源選項。
GPT-4.5:承諾與現實
初步反應與未解答的問題
對於 GPT-4.5 的亮相,市場的反應是興奮與懷疑並存。

強調讓機型看起來「更自然」,讓人對其具體、可量測的進步產生疑問。許多人感到疑惑:它的幻覺是否減少了?它在日常應用中真正超越 GPT-4o 的程度有多大?這些懸而未決的疑問要求我們更深入地探究這個模型的效能與技術基礎。
在人工智慧領域中,失望的感覺是顯而易見的。使用者正在尋求可量化的進步,超越表面上自然的對話方式。真正衡量其成功與否的標準,將是其管理複雜任務、提供實用解決方案,以及產生真正創意成果的能力。
任何人工智慧模型最終都是以其客觀效能與成本效益來評斷。如果無法在這些關鍵領域取得重大進展,「更自然」互動的吸引力可能不足以成為升級的理由。
基準比較:近距離觀察
GPT-4.5 的官方基準資料顯示有些乏善可陳。

雖然 GPT-4.5 在某些領域有所進步,但在相對較新的開放原始碼模型 DeepSeek V3 上,GPT-4.5 的表現明顯落後。考慮到 OpenAI 龐大的資源和專業知識,這實在令人驚訝。將 GPT-4.5 與其直接前身 GPT-4o 進行比較,而不是與更多現代競爭對手進行比較的決定,進一步加深了人們的懷疑。
以下是基準效能的細分,強調值得關注的關鍵領域:
- 數學 (AIME '24):GPT-4.5 的準確率為 36.7%,與其他可用的基礎模型相比相對較低。這是非常重要的能力,因為強大的數學推理能力對於許多實際世界的應用是非常重要的。
- 科學 (GPQA):在這方面,GPT-4.5 的表現較為穩健,準確率達到 71.4%。這顯示 GPT-4.5 對科學原理有扎實的理解,但這並不代表 GPT-4.5 的整體能力超群。
- 編碼 (SWE-Bench Verified):GPT-4.5 的得分率為 38%,顯示在編程任務上有明顯的弱點。
重要的是要記住,這些基準只提供模型在特定、受控情境中能力的有限觀點。徹底的評估需要在不同的真實應用環境中進行測試,才能準確衡量其潛力。
| 任務 | GPT-4.5 精確度 | GPT-4o 精確度 |
|---|---|---|
| GPQA (科學) | 71.4% | 53.6% |
| AIME '24(數學) | 36.7% | 9.3% |
| SWE-Bench Verified (編碼) | 38% | 31% |
| MMMU(多模式) | 74.4% | 69.1% |
API 定價:自然」的溢價?
使用 GPT-4.5 API 的成本明顯比早期型號高。

這種定價策略引起了關於可及性的重要問題,特別是對於小型公司和獨立開發人員而言。在「自然性」方面的改進是否足以證明大幅提價是合理的?
對大多數人而言,答案可能是否定的。AI 模型的基本價值在於其效能、精確度和作業效率。如果 GPT-4.5 無法在這些核心指標上有顯著的躍進,其高昂的成本將難以維護。更經濟實惠的開放原始碼替代方案可能會獲得顯著的吸引力。
考慮 Aider 編碼基準:在 GPT-4.5 上執行的成本遠高於使用 DeepSeek V3。這種價格差異造成較高的入門門檻,可能會阻礙 GPT-4.5 在開發人員之間的廣泛採用。
此外,據報導,GPT-4.5 的價格比 DeepSeek 高出數百倍。光是這個成本因素,就可能成為許多人捨 GPT-4.5 而選擇更經濟的系統的決定性原因。
| 型號 | 輸入價格 (每 100 萬代用幣) | 輸出價格 (每 100 萬個代幣) |
|---|---|---|
| GPT-4.5 | $75.00 | $150.00 |
| GPT-4o | $2.50 | $10.00 |
開放原始碼替代方案的崛起:DeepSeek V3
DeepSeek V3 为何值得关注
DeepSeek V3等高性能开源模型的崛起对OpenAI的市场领导地位构成了严峻挑战。

DeepSeek V3 提供了具有竞争力的性能、运营效率和模型透明度等极具吸引力的组合。據報導,它的成本比 GPT-4.5 低數百倍。
以下是它的一些主要優點:
- 有競爭力的效能:如基準所示,DeepSeek V3 在數學和編碼等關鍵領域與 GPT-4.5 競爭,有時甚至超越 GPT-4.5。
- 成本效益:DeepSeek V3 採用開放原始碼,沒有相關的 API 成本,因此部署成本大幅降低。這將先進的人工智慧開放給更廣泛的使用者。
- 透明度與客製化:開放源碼模型提供了更高的工作透明度,並允許進行廣泛的客製化。開發人員可以針對特定用途調整模型,並參與模型的演進。
值得注意的是,DeepSeek 最近舉辦了「開放源碼週」,發佈了多個專注於 GPU 效率與最佳化的儲存庫。這正是許多企業在擴大營運規模時所需要的實用創新,而非僅是提昇模型的會話感。
GPT-4.5:權衡利弊
優點
更自然、更流暢的語言互動潛力。
在某些任務類別可能有專門的進步。
OpenAI 持續的開發與維護支援。
強大的一般語言能力。
缺點
相較於競爭對手,API 成本過高。
在多項基準測試中,效能落後於領先的開放原始碼替代方案。
模型的內部架構和訓練資料不清楚。
在數學和編碼任務上有明顯的弱點。
價格比 GPT-4o 高出 12 到 30 倍。
常見問題
GPT-4.5 是 GPT-4o 的重大升級嗎?
最初的基準結果並不一致。它在某些學科上顯示出進步,但在特定挑戰上卻無法與其他開放原始碼模型相提並論。要明確評估其價值,需要更全面的實際評估。
GPT-4.5 是否值得高昂的 API 成本?
答案取決於您的特定需求和財務限制。如果您需要頂級效能來處理特定的關鍵應用程式,可能值得考慮。然而,對大多數使用者來說,高昂的價格並不值得,尤其是有能力且免費提供的開放原始碼選項。
DeepSeek V3 等開源 AI 模型的主要優勢是什麼?
開放原始碼模型可提供具有競爭力的效能、卓越的成本效益、更高的作業透明度,以及客製化的彈性。它們讓每個人都能使用強大的 AI 工具,並鼓勵社群驅動的創新。
相關問題
人工智能模型開發的未來是什麼?
AI 發展的軌跡很可能會涉及到專屬與開源努力之間的協同效應。OpenAI 等大型科技公司將持續以大規模模型推動技術發展,而開放原始碼社群則在人工智慧存取民主化及透過協同開發與客製化促進創新方面扮演關鍵角色。我們必須承認 GPT-4.5 有顯著的缺點,OpenAI 需要解決幾個方面的問題,才能有效地與其他開源模型競爭。
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
Die Diskussion um GPT-4.5 erinnert mich an die ewige Frage: Ist es wirklich ein Durchbruch oder nur ein cleveres Marketing-Upgrade? 🤔 Die Geschwindigkeitssteigerung klingt praktisch, aber ich frage mich, ob die Kosten für Endnutzer wieder steigen werden. Die KI-Community scheint gespalten – einige feiern es, andere sehen nur inkrementelle Fortschritte. Spannend wird sein, wie sich das auf den Wettbewerb mit anderen Modellen auswirkt.
Die Diskussion um GPT-4.5 ist echt spannend. Ich frage mich, ob die Verbesserungen wirklich so bahnbrechend sind oder ob es eher um Marketing geht. Die KI-Entwicklung wird immer schneller, aber die Kosten und der Energieverbrauch sind auch ein Thema, über das man reden sollte. 🤔
이번 GPT-4.5 발표를 보면서 AI 경쟁이 점점 더 치열해지고 있다는 생각이 들어요. 🤔 다른 기업들도 곧 비슷한 모델을 내놓지 않을까? 기술 발전 속도가 너무 빨라서 따라가기 벅차네요. 개인정보 보호 문제는 어떻게 해결할지 궁금해지는데...
Wait, another model drop already? 🤔 The speed is insane but I'm low-key worried about how smaller AI labs can keep up. Also, did they mention anything about training costs this time? The energy consumption talk is always glossed over...





首頁






