OpenAI 的 GPT-4.5 模型亮相:批判性评估
OpenAI 最近发布的 GPT-4.5 令人工智能界沸腾不已。在直播揭晓之后,核心问题仍然是:这是一次重大突破,还是一次微妙的升级?我们将深入分析围绕 GPT-4.5 的各种说法,并将其与前代产品和竞争对手进行比较,从而将事实与宣传炒作区分开来。
关键点
GPT-4.5 在市场上被宣传为具有增强预训练功能的多功能通用模型。
早期的基准数据显示,GPT-4.5 在特定任务上落后于某些开源模型。
GPT-4.5 的应用程序接口价格大大高于以前的版本。
人们开始质疑,OpenAI 是否在优先考虑纯粹的规模,而不是模型架构和训练方法上真正的创新改进。
DeepSeek V3 等替代方案提供了性能相当、效率更高的强大开源选择。
GPT-4.5:承诺与现实
初步反应和悬而未决的问题
人们对 GPT-4.5 的反应既兴奋又怀疑。

强调让机型看起来 "更自然",引发了人们对其具体、可衡量的进步的质疑。许多人不禁要问:它的幻觉减少了吗?它的幻觉是否减少了?它在日常应用中真正超越 GPT-4o 的程度有多大?这些悬而未决的疑问要求我们更深入地研究该模型的性能和技术基础。
在人工智能领域,失望之情溢于言表。用户正在寻求可量化的进步,而不仅仅是表面上自然的对话风格。真正衡量人工智能成功与否的标准是其管理复杂任务、提供实用解决方案和产生真正创造性成果的能力。
任何人工智能模型最终都要根据其客观性能和成本效益来评判。如果不能在这些关键领域取得长足进步,"更自然 "的交互方式可能不足以成为升级的理由。
基准比较:近距离观察
GPT-4.5 的官方基准数据略显平淡。

虽然它在某些领域取得了进步,但与 DeepSeek V3(一种相对较新的开源模型)相比,其性能明显不足。考虑到 OpenAI 丰富的资源和专业知识,这一点令人惊讶。将 GPT-4.5 主要与其直接前身 GPT-4o 进行比较,而不是与更广泛的现代竞争对手进行比较,这一决定进一步加深了人们的怀疑。
以下是基准性能的细分,重点关注关键领域:
- 数学(AIME '24):GPT-4.5 实现了 36.7% 的准确率,与其他可用的基础模型相比相对较低。这是一项至关重要的能力,因为强大的数学推理能力对于众多现实世界的应用至关重要。
- 科学(GPQA):在这方面,GPT-4.5 的表现更为稳健,准确率达到 71.4%。这表明 GPT-4.5 对科学原理有扎实的理解,但这并不意味着 GPT-4.5 的整体能力超群。
- 编码(SWE-Bench 验证):GPT-4.5 的得分率为 38%,表明其在编程任务方面存在明显不足。
重要的是要记住,这些基准只能有限地反映模型在特定、受控场景中的能力。要进行全面评估,就必须在不同的实际应用中进行测试,以准确衡量其潜力。
任务 GPT-4.5 精确度 GPT-4o 精度 GPQA(科学) 71.4% 53.6% AIME '24(数学) 36.7% 9.3% SWE-Bench 验证(编码) 38% 31% MMMU(多模式) 74.4% 69.1%
API 定价:自然 "的溢价?
使用 GPT-4.5 应用程序接口的成本明显高于早期版本。

这种定价策略引发了关于可访问性的重要问题,尤其是对小公司和独立开发人员而言。在 "自然性 "方面的改进是否足以证明大幅提价是合理的?
对于大多数人来说,答案可能是否定的。人工智能模型的根本价值在于其性能、精度和运行效率。如果 GPT-4.5 无法在这些核心指标上实现实质性飞跃,那么其高昂的成本就很难得到维护。价格更低廉的开源替代品很可能会获得巨大的吸引力。
考虑一下 Aider 编码基准:在 GPT-4.5 上执行该基准要比使用 DeepSeek V3 昂贵得多。这种价格上的差距造成了更高的准入门槛,可能会阻碍 GPT-4.5 在开发人员中的广泛应用。
此外,据说它的价格比 DeepSeek 高出数百倍。仅这一成本因素就可能成为许多人放弃 GPT-4.5 而选择更经济的系统的决定性原因。
模型 输入价格(每 100 万个代币) 输出价格(每 100 万个代币) GPT-4.5 $75.00 $150.00 GPT-4o $2.50 $10.00
开源替代品的崛起:DeepSeek V3
DeepSeek V3 为何值得关注
DeepSeek V3等高性能开源模型的崛起对OpenAI的市场领导地位构成了严峻挑战。

DeepSeek V3提供了极具竞争力的性能、运行效率和模型透明度等极具吸引力的组合。据报道,它的成本比 GPT-4.5 低数百倍。
以下是它的一些主要优势:
- 有竞争力的性能:基准测试表明,DeepSeek V3 在数学和编码等关键领域可与 GPT-4.5 竞争,有时甚至超越 GPT-4.5。
- 成本效益:作为开源软件,DeepSeek V3 没有相关的应用程序接口(API)成本,因此部署成本大大降低。这就为更多人提供了先进的人工智能技术。
- 透明度和定制化:开源模型提供了更高的工作透明度,并允许进行广泛的定制。开发人员可以根据特定用途调整模型,并参与其演变。
值得注意的是,DeepSeek 最近举办了 "开源周 "活动,发布了多个专注于 GPU 效率和优化的资源库。这正是许多企业扩大运营所需的实用创新类型,而不仅仅是完善模型的对话感。
GPT-4.5:权衡利弊
优点
有可能实现更自然、更流畅的语言交互。
可能在某些任务类别中取得专业进步。
来自 OpenAI 的持续开发和维护支持。
强大的通用语言能力。
缺点
与同类产品相比,API 成本过高。
在多个基准测试中,性能落后于领先的开源替代方案。
模型的内部架构和训练数据不够清晰。
在数学和编码任务方面存在明显弱点。
价格比 GPT-4o 高 12 到 30 倍。
常见问题
GPT-4.5 是 GPT-4o 的重大升级吗?
最初的基准测试结果并不一致。它在某些学科上取得了进步,但在特定挑战上与其他开源模型相比还有差距。要明确评估其价值,需要进行更全面的实际评估。
GPT-4.5 是否值得高昂的应用程序接口费用?
答案取决于您的特殊要求和资金限制。如果您需要为特定的关键应用提供顶级性能,那么可能值得考虑。但是,对于大多数用户来说,高昂的价格很难让人信服,尤其是在有能力免费提供开源选项的情况下。
DeepSeek V3 等开源人工智能模型的主要优势是什么?
开源模型具有极具竞争力的性能、卓越的成本效益、更高的操作透明度和定制灵活性。它们使每个人都能获得强大的人工智能工具,并鼓励社区驱动的创新。
相关问题
人工智能模型开发的未来是什么?
人工智能发展的轨迹可能会涉及专有和开源努力之间的协同作用。OpenAI 等大型科技公司将继续通过大规模模型推动技术发展,而开源社区在实现人工智能访问民主化以及通过合作开发和定制化促进创新方面将发挥至关重要的作用。重要的是要认识到 GPT-4.5 有明显的不足之处,OpenAI 需要解决几个方面的问题,才能有效地与其他开源模型竞争。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (5)
0/500
Die Diskussion um GPT-4.5 erinnert mich an die ewige Frage: Ist es wirklich ein Durchbruch oder nur ein cleveres Marketing-Upgrade? 🤔 Die Geschwindigkeitssteigerung klingt praktisch, aber ich frage mich, ob die Kosten für Endnutzer wieder steigen werden. Die KI-Community scheint gespalten – einige feiern es, andere sehen nur inkrementelle Fortschritte. Spannend wird sein, wie sich das auf den Wettbewerb mit anderen Modellen auswirkt.
Die Diskussion um GPT-4.5 ist echt spannend. Ich frage mich, ob die Verbesserungen wirklich so bahnbrechend sind oder ob es eher um Marketing geht. Die KI-Entwicklung wird immer schneller, aber die Kosten und der Energieverbrauch sind auch ein Thema, über das man reden sollte. 🤔
이번 GPT-4.5 발표를 보면서 AI 경쟁이 점점 더 치열해지고 있다는 생각이 들어요. 🤔 다른 기업들도 곧 비슷한 모델을 내놓지 않을까? 기술 발전 속도가 너무 빨라서 따라가기 벅차네요. 개인정보 보호 문제는 어떻게 해결할지 궁금해지는데...
Wait, another model drop already? 🤔 The speed is insane but I'm low-key worried about how smaller AI labs can keep up. Also, did they mention anything about training costs this time? The energy consumption talk is always glossed over...
OpenAI 最近发布的 GPT-4.5 令人工智能界沸腾不已。在直播揭晓之后,核心问题仍然是:这是一次重大突破,还是一次微妙的升级?我们将深入分析围绕 GPT-4.5 的各种说法,并将其与前代产品和竞争对手进行比较,从而将事实与宣传炒作区分开来。
关键点
GPT-4.5 在市场上被宣传为具有增强预训练功能的多功能通用模型。
早期的基准数据显示,GPT-4.5 在特定任务上落后于某些开源模型。
GPT-4.5 的应用程序接口价格大大高于以前的版本。
人们开始质疑,OpenAI 是否在优先考虑纯粹的规模,而不是模型架构和训练方法上真正的创新改进。
DeepSeek V3 等替代方案提供了性能相当、效率更高的强大开源选择。
GPT-4.5:承诺与现实
初步反应和悬而未决的问题
人们对 GPT-4.5 的反应既兴奋又怀疑。

强调让机型看起来 "更自然",引发了人们对其具体、可衡量的进步的质疑。许多人不禁要问:它的幻觉减少了吗?它的幻觉是否减少了?它在日常应用中真正超越 GPT-4o 的程度有多大?这些悬而未决的疑问要求我们更深入地研究该模型的性能和技术基础。
在人工智能领域,失望之情溢于言表。用户正在寻求可量化的进步,而不仅仅是表面上自然的对话风格。真正衡量人工智能成功与否的标准是其管理复杂任务、提供实用解决方案和产生真正创造性成果的能力。
任何人工智能模型最终都要根据其客观性能和成本效益来评判。如果不能在这些关键领域取得长足进步,"更自然 "的交互方式可能不足以成为升级的理由。
基准比较:近距离观察
GPT-4.5 的官方基准数据略显平淡。

虽然它在某些领域取得了进步,但与 DeepSeek V3(一种相对较新的开源模型)相比,其性能明显不足。考虑到 OpenAI 丰富的资源和专业知识,这一点令人惊讶。将 GPT-4.5 主要与其直接前身 GPT-4o 进行比较,而不是与更广泛的现代竞争对手进行比较,这一决定进一步加深了人们的怀疑。
以下是基准性能的细分,重点关注关键领域:
- 数学(AIME '24):GPT-4.5 实现了 36.7% 的准确率,与其他可用的基础模型相比相对较低。这是一项至关重要的能力,因为强大的数学推理能力对于众多现实世界的应用至关重要。
- 科学(GPQA):在这方面,GPT-4.5 的表现更为稳健,准确率达到 71.4%。这表明 GPT-4.5 对科学原理有扎实的理解,但这并不意味着 GPT-4.5 的整体能力超群。
- 编码(SWE-Bench 验证):GPT-4.5 的得分率为 38%,表明其在编程任务方面存在明显不足。
重要的是要记住,这些基准只能有限地反映模型在特定、受控场景中的能力。要进行全面评估,就必须在不同的实际应用中进行测试,以准确衡量其潜力。
| 任务 | GPT-4.5 精确度 | GPT-4o 精度 |
|---|---|---|
| GPQA(科学) | 71.4% | 53.6% |
| AIME '24(数学) | 36.7% | 9.3% |
| SWE-Bench 验证(编码) | 38% | 31% |
| MMMU(多模式) | 74.4% | 69.1% |
API 定价:自然 "的溢价?
使用 GPT-4.5 应用程序接口的成本明显高于早期版本。

这种定价策略引发了关于可访问性的重要问题,尤其是对小公司和独立开发人员而言。在 "自然性 "方面的改进是否足以证明大幅提价是合理的?
对于大多数人来说,答案可能是否定的。人工智能模型的根本价值在于其性能、精度和运行效率。如果 GPT-4.5 无法在这些核心指标上实现实质性飞跃,那么其高昂的成本就很难得到维护。价格更低廉的开源替代品很可能会获得巨大的吸引力。
考虑一下 Aider 编码基准:在 GPT-4.5 上执行该基准要比使用 DeepSeek V3 昂贵得多。这种价格上的差距造成了更高的准入门槛,可能会阻碍 GPT-4.5 在开发人员中的广泛应用。
此外,据说它的价格比 DeepSeek 高出数百倍。仅这一成本因素就可能成为许多人放弃 GPT-4.5 而选择更经济的系统的决定性原因。
| 模型 | 输入价格(每 100 万个代币) | 输出价格(每 100 万个代币) |
|---|---|---|
| GPT-4.5 | $75.00 | $150.00 |
| GPT-4o | $2.50 | $10.00 |
开源替代品的崛起:DeepSeek V3
DeepSeek V3 为何值得关注
DeepSeek V3等高性能开源模型的崛起对OpenAI的市场领导地位构成了严峻挑战。

DeepSeek V3提供了极具竞争力的性能、运行效率和模型透明度等极具吸引力的组合。据报道,它的成本比 GPT-4.5 低数百倍。
以下是它的一些主要优势:
- 有竞争力的性能:基准测试表明,DeepSeek V3 在数学和编码等关键领域可与 GPT-4.5 竞争,有时甚至超越 GPT-4.5。
- 成本效益:作为开源软件,DeepSeek V3 没有相关的应用程序接口(API)成本,因此部署成本大大降低。这就为更多人提供了先进的人工智能技术。
- 透明度和定制化:开源模型提供了更高的工作透明度,并允许进行广泛的定制。开发人员可以根据特定用途调整模型,并参与其演变。
值得注意的是,DeepSeek 最近举办了 "开源周 "活动,发布了多个专注于 GPU 效率和优化的资源库。这正是许多企业扩大运营所需的实用创新类型,而不仅仅是完善模型的对话感。
GPT-4.5:权衡利弊
优点
有可能实现更自然、更流畅的语言交互。
可能在某些任务类别中取得专业进步。
来自 OpenAI 的持续开发和维护支持。
强大的通用语言能力。
缺点
与同类产品相比,API 成本过高。
在多个基准测试中,性能落后于领先的开源替代方案。
模型的内部架构和训练数据不够清晰。
在数学和编码任务方面存在明显弱点。
价格比 GPT-4o 高 12 到 30 倍。
常见问题
GPT-4.5 是 GPT-4o 的重大升级吗?
最初的基准测试结果并不一致。它在某些学科上取得了进步,但在特定挑战上与其他开源模型相比还有差距。要明确评估其价值,需要进行更全面的实际评估。
GPT-4.5 是否值得高昂的应用程序接口费用?
答案取决于您的特殊要求和资金限制。如果您需要为特定的关键应用提供顶级性能,那么可能值得考虑。但是,对于大多数用户来说,高昂的价格很难让人信服,尤其是在有能力免费提供开源选项的情况下。
DeepSeek V3 等开源人工智能模型的主要优势是什么?
开源模型具有极具竞争力的性能、卓越的成本效益、更高的操作透明度和定制灵活性。它们使每个人都能获得强大的人工智能工具,并鼓励社区驱动的创新。
相关问题
人工智能模型开发的未来是什么?
人工智能发展的轨迹可能会涉及专有和开源努力之间的协同作用。OpenAI 等大型科技公司将继续通过大规模模型推动技术发展,而开源社区在实现人工智能访问民主化以及通过合作开发和定制化促进创新方面将发挥至关重要的作用。重要的是要认识到 GPT-4.5 有明显的不足之处,OpenAI 需要解决几个方面的问题,才能有效地与其他开源模型竞争。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Die Diskussion um GPT-4.5 erinnert mich an die ewige Frage: Ist es wirklich ein Durchbruch oder nur ein cleveres Marketing-Upgrade? 🤔 Die Geschwindigkeitssteigerung klingt praktisch, aber ich frage mich, ob die Kosten für Endnutzer wieder steigen werden. Die KI-Community scheint gespalten – einige feiern es, andere sehen nur inkrementelle Fortschritte. Spannend wird sein, wie sich das auf den Wettbewerb mit anderen Modellen auswirkt.
Die Diskussion um GPT-4.5 ist echt spannend. Ich frage mich, ob die Verbesserungen wirklich so bahnbrechend sind oder ob es eher um Marketing geht. Die KI-Entwicklung wird immer schneller, aber die Kosten und der Energieverbrauch sind auch ein Thema, über das man reden sollte. 🤔
이번 GPT-4.5 발표를 보면서 AI 경쟁이 점점 더 치열해지고 있다는 생각이 들어요. 🤔 다른 기업들도 곧 비슷한 모델을 내놓지 않을까? 기술 발전 속도가 너무 빨라서 따라가기 벅차네요. 개인정보 보호 문제는 어떻게 해결할지 궁금해지는데...
Wait, another model drop already? 🤔 The speed is insane but I'm low-key worried about how smaller AI labs can keep up. Also, did they mention anything about training costs this time? The energy consumption talk is always glossed over...





首页






