选项
首页
新闻
GPT-5 发布,揭开 OpenAI 下一代人工智能模型的神秘面纱

GPT-5 发布,揭开 OpenAI 下一代人工智能模型的神秘面纱

2025-12-30
165

OpenAI 推出了新的旗舰人工智能模型 GPT-5,它将推动下一代 ChatGPT 的发展。

GPT-5 于本周四发布,是 OpenAI 的首个统一人工智能模型,融合了 o 系列模型的推理优势和 GPT 系列的快速反应能力。这一下一代模型标志着 ChatGPT 和 OpenAI 的新篇章,彰显了该公司建立人工智能系统的雄心壮志,这些系统的行为更像主动代理,而不是被动的聊天机器人。

GPT-4 使人工智能聊天机器人能够提供各种主题的智能回答,而 GPT-5 则使 ChatGPT 能够代表用户执行任务,如开发软件应用程序、管理日程安排或编制研究简报。

OpenAI 还致力于通过 GPT-5 使 ChatGPT 更易于使用。该模型不需要用户调整设置,而是包含一个实时路由器,它能确定最佳的回复方式--无论是快速回复还是花更多时间推理答案。

图片来源:OpenAIOpenAI

OpenAI 首席执行官山姆-阿尔特曼(Sam Altman)在向记者介绍情况时,将 GPT-5 称作 "世界上最好的模型",称其为朝着开发在最具经济价值的工作中胜过人类的人工智能(也称为人工通用智能(AGI))迈出的 "重要一步"。

阿尔特曼补充说:"像GPT-5这样的工具在历史的任何其他时期都几乎是不可想象的。

从本周四开始,GPT-5 将成为所有免费 ChatGPT 用户的默认模型。据 OpenAI 的 ChatGPT 副总裁尼克-特利(Nick Turley)称,此举首次为免费用户提供了使用人工智能推理模型的机会。(在此之前,这种高级模型只有付费用户才能使用)。

"这是我们实现使命的方式之一--确保这些进步真正惠及每个人,"Turley 评论道,他指的是 OpenAI 致力于让最前沿的人工智能广泛普及。

Techcrunch 活动

顶级科技和风险投资领袖加入 "颠覆 2025 "议程

Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等有影响力的公司都加入了 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在 8 月 7 日涨价之前最多可节省 675 美元。

顶级科技和风险投资领袖加入 Disrupt 2025 议程

Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等极具影响力的公司将加入 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在价格上涨之前最多可节省 675 美元。

旧金山|2025 年 10 月 27-29 日立即注册

自 2022 年 ChatGPT 使 OpenAI 一举成名以来,GPT-5 是 OpenAI 最令人期待的发布会之一。从那时起,ChatGPT 已成为世界上使用最广泛的消费产品之一,据该公司称,现在每周有超过 7 亿用户使用,接近全球人口的 10%。

许多人认为,GPT-5 是更广泛的人工智能进步的风向标,它在硅谷的受欢迎程度可能会对大科技公司、华尔街和科技政策制定者产生重大影响。利益相关者都在关注 GPT-5 是否会像其前身 GPT-4 一样,带来人工智能能力的实质性飞跃,GPT-4 重新定义了软件所能实现的功能。

GPT-5 与竞争对手的差距微乎其微

OpenAI 声称,GPT-5 在多个领域设立了新标准,在关键基准上略微超过了 Anthropic、谷歌 DeepMind 和埃隆-马斯克的 xAI 等公司的领先模型,但在其他方面略有不足。

该公司强调了 GPT-5 的卓越编码能力;Altman 指出,该模型擅长按需生成完整的软件应用程序,这种能力通常被称为 "振动编码"。

在 SWE-bench Verified(基于 GitHub 上真实世界编码任务的测试)中,GPT-5 的首次尝试得分率为 74.9%。这使它仅次于 Anthropic 的 Claude Opus 4.1(74.5%)和 Google DeepMind 的 Gemini 2.5 Pro(59.6%)。

在 "人类最后一次考试"(Humanity's Last Exam)--一项横跨数学、人文和科学领域的严格评估--中,GPT-5(GPT-5 Pro)的扩展推理版在使用工具的情况下得分率为 42%。这一成绩略低于 xAI 的 Grok 4 Heavy,后者达到了 44.4%。

图片来源:OpenAIOpenAI

在博士级科学问题基准 GPQA Diamond 上,GPT-5 Pro 的首次尝试得分率为 89.4%,超过了 Claude Opus 4.1(80.9%)和 Grok 4 Heavy(88.9%)。

OpenAI 还报告称,GPT-5 在健康相关的问题上表现更好。在衡量医疗保健回复准确性的 HealthBench Hard Hallucinations(HealthBench 硬幻觉)测试中,GPT-5(带思维)仅有 1.6% 的时间出现幻觉,远低于 GPT-4o(12.9%)和 o3(15.8%)。

虽然人工智能聊天机器人不是医疗专业人员,但仍有数百万人向它们寻求健康建议。对此,OpenAI 表示,GPT-5 在标记潜在健康问题和帮助用户解读医疗信息方面更加积极主动。

此外,GPT-5 还擅长创意设计和写作等主观性较强的领域。特利指出,与竞争对手的模型相比,GPT-5 的反应更自然,在创意任务中表现出 "更好的品味"。

"Turley 说:"这款机型真的很不错。

GPT-5 也比 OpenAI 早期的模型更准确,而且幻觉(编造信息的倾向)更少。在最近的推理模型(如 o3)中,出现幻觉的比率一直在上升,OpenAI 之前一直在努力解释这一趋势。

在反应测试中,GPT-5(带思考)提供错误信息的比例为 4.8%--与 o3(22%)和 GPT-4o (20.6%)相比有了显著提高。

在衡量人工智能代理完成模拟在线任务能力的 Tau-bench 测试中,GPT-5 的成绩参差不齐。它在航空公司网站导航方面的得分是 63.5%(略低于 o3 的 64.8%),在零售网站导航方面的得分是 81.1%(低于 Claude Opus 4.1 的 82.4%)。

OpenAI 还强调,GPT-5 比其前代产品更加安全。虽然推理模型有时会表现出欺骗行为,但 GPT-5 的欺骗率较低,有助于提高用户体验的可信度。

安全研究负责人亚历克斯-比尤特尔(Alex Beutel)指出,减少欺骗行为不仅能提高安全性,还能使模型更加 "透明和诚实,让用户可以信赖"。

Beutel 补充说,GPT-5 更善于区分恶意误用和无害请求,从而更适当地拒绝不安全的查询,减少不必要地拒绝良性查询。

面向消费者和开发者的新功能

在发布 GPT-5 的同时,ChatGPT 还进行了多项用户体验升级。用户现在可以在设置中选择四种新的回复风格:愤世嫉俗者、机器人、倾听者和书呆子。这些风格可以调整 ChatGPT 的语气,而无需明确的指令。

ChatGPT Plus 用户(20 美元/月)可获得更高的 GPT-5 使用限制,而专业版用户(200 美元/月)则可获得无限制访问权和 GPT-5 专业版--一个使用额外计算来获得更好答案的增强版。团队、教育和企业用户将从下周起获得 GPT-5 作为默认模式。

对于开发者来说,GPT-5 将通过 OpenAI 的 API 提供三种尺寸--gpt-5、gpt-5-mini 和 gpt-5-nano,它们的推理深度各不相同。API 现在还包括一个冗长度控制,允许开发人员设置所需的响应长度。

基本 GPT-5 模型的价格为每百万输入词块(约 75 万字)1.25 美元,每百万输出词块 10 美元。

GPT-5 的发布紧随 OpenAI 的繁忙时期。该公司最近发布了 gpt-oss,这是一个免费的开放重量级推理模型,几乎可以与早期的顶级模型(如 o3 和 o4-mini)相媲美。不过,GPT-5 在编码等领域确立了新的基准。

尽管如此,在许多基准测试中,GPT-5 仍然具有竞争力,而不是主导地位。真实世界的性能和开发人员的采用将最终决定它是否能真正超越竞争对手的模型。

相关文章
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职 OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职 OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (1)
0/500
FrankTaylor
FrankTaylor 2026-07-25 04:00:12

So GPT-5 is finally here? I'm curious if it can actually tell the difference between a joke and a serious statement this time around 😅

OR