GPT-5 发布,揭开 OpenAI 下一代人工智能模型的神秘面纱
OpenAI 推出了新的旗舰人工智能模型 GPT-5,它将推动下一代 ChatGPT 的发展。
GPT-5 于本周四发布,是 OpenAI 的首个统一人工智能模型,融合了 o 系列模型的推理优势和 GPT 系列的快速反应能力。这一下一代模型标志着 ChatGPT 和 OpenAI 的新篇章,彰显了该公司建立人工智能系统的雄心壮志,这些系统的行为更像主动代理,而不是被动的聊天机器人。
GPT-4 使人工智能聊天机器人能够提供各种主题的智能回答,而 GPT-5 则使 ChatGPT 能够代表用户执行任务,如开发软件应用程序、管理日程安排或编制研究简报。
OpenAI 还致力于通过 GPT-5 使 ChatGPT 更易于使用。该模型不需要用户调整设置,而是包含一个实时路由器,它能确定最佳的回复方式--无论是快速回复还是花更多时间推理答案。

图片来源:OpenAIOpenAI OpenAI 首席执行官山姆-阿尔特曼(Sam Altman)在向记者介绍情况时,将 GPT-5 称作 "世界上最好的模型",称其为朝着开发在最具经济价值的工作中胜过人类的人工智能(也称为人工通用智能(AGI))迈出的 "重要一步"。
阿尔特曼补充说:"像GPT-5这样的工具在历史的任何其他时期都几乎是不可想象的。
从本周四开始,GPT-5 将成为所有免费 ChatGPT 用户的默认模型。据 OpenAI 的 ChatGPT 副总裁尼克-特利(Nick Turley)称,此举首次为免费用户提供了使用人工智能推理模型的机会。(在此之前,这种高级模型只有付费用户才能使用)。
"这是我们实现使命的方式之一--确保这些进步真正惠及每个人,"Turley 评论道,他指的是 OpenAI 致力于让最前沿的人工智能广泛普及。
Techcrunch 活动顶级科技和风险投资领袖加入 "颠覆 2025 "议程
Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等有影响力的公司都加入了 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在 8 月 7 日涨价之前最多可节省 675 美元。
顶级科技和风险投资领袖加入 Disrupt 2025 议程
Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等极具影响力的公司将加入 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在价格上涨之前最多可节省 675 美元。
旧金山|2025 年 10 月 27-29 日立即注册自 2022 年 ChatGPT 使 OpenAI 一举成名以来,GPT-5 是 OpenAI 最令人期待的发布会之一。从那时起,ChatGPT 已成为世界上使用最广泛的消费产品之一,据该公司称,现在每周有超过 7 亿用户使用,接近全球人口的 10%。
许多人认为,GPT-5 是更广泛的人工智能进步的风向标,它在硅谷的受欢迎程度可能会对大科技公司、华尔街和科技政策制定者产生重大影响。利益相关者都在关注 GPT-5 是否会像其前身 GPT-4 一样,带来人工智能能力的实质性飞跃,GPT-4 重新定义了软件所能实现的功能。
GPT-5 与竞争对手的差距微乎其微
OpenAI 声称,GPT-5 在多个领域设立了新标准,在关键基准上略微超过了 Anthropic、谷歌 DeepMind 和埃隆-马斯克的 xAI 等公司的领先模型,但在其他方面略有不足。
该公司强调了 GPT-5 的卓越编码能力;Altman 指出,该模型擅长按需生成完整的软件应用程序,这种能力通常被称为 "振动编码"。
在 SWE-bench Verified(基于 GitHub 上真实世界编码任务的测试)中,GPT-5 的首次尝试得分率为 74.9%。这使它仅次于 Anthropic 的 Claude Opus 4.1(74.5%)和 Google DeepMind 的 Gemini 2.5 Pro(59.6%)。
在 "人类最后一次考试"(Humanity's Last Exam)--一项横跨数学、人文和科学领域的严格评估--中,GPT-5(GPT-5 Pro)的扩展推理版在使用工具的情况下得分率为 42%。这一成绩略低于 xAI 的 Grok 4 Heavy,后者达到了 44.4%。

图片来源:OpenAIOpenAI 在博士级科学问题基准 GPQA Diamond 上,GPT-5 Pro 的首次尝试得分率为 89.4%,超过了 Claude Opus 4.1(80.9%)和 Grok 4 Heavy(88.9%)。
OpenAI 还报告称,GPT-5 在健康相关的问题上表现更好。在衡量医疗保健回复准确性的 HealthBench Hard Hallucinations(HealthBench 硬幻觉)测试中,GPT-5(带思维)仅有 1.6% 的时间出现幻觉,远低于 GPT-4o(12.9%)和 o3(15.8%)。
虽然人工智能聊天机器人不是医疗专业人员,但仍有数百万人向它们寻求健康建议。对此,OpenAI 表示,GPT-5 在标记潜在健康问题和帮助用户解读医疗信息方面更加积极主动。
此外,GPT-5 还擅长创意设计和写作等主观性较强的领域。特利指出,与竞争对手的模型相比,GPT-5 的反应更自然,在创意任务中表现出 "更好的品味"。
"Turley 说:"这款机型真的很不错。
GPT-5 也比 OpenAI 早期的模型更准确,而且幻觉(编造信息的倾向)更少。在最近的推理模型(如 o3)中,出现幻觉的比率一直在上升,OpenAI 之前一直在努力解释这一趋势。
在反应测试中,GPT-5(带思考)提供错误信息的比例为 4.8%--与 o3(22%)和 GPT-4o (20.6%)相比有了显著提高。
在衡量人工智能代理完成模拟在线任务能力的 Tau-bench 测试中,GPT-5 的成绩参差不齐。它在航空公司网站导航方面的得分是 63.5%(略低于 o3 的 64.8%),在零售网站导航方面的得分是 81.1%(低于 Claude Opus 4.1 的 82.4%)。
OpenAI 还强调,GPT-5 比其前代产品更加安全。虽然推理模型有时会表现出欺骗行为,但 GPT-5 的欺骗率较低,有助于提高用户体验的可信度。
安全研究负责人亚历克斯-比尤特尔(Alex Beutel)指出,减少欺骗行为不仅能提高安全性,还能使模型更加 "透明和诚实,让用户可以信赖"。
Beutel 补充说,GPT-5 更善于区分恶意误用和无害请求,从而更适当地拒绝不安全的查询,减少不必要地拒绝良性查询。
面向消费者和开发者的新功能
在发布 GPT-5 的同时,ChatGPT 还进行了多项用户体验升级。用户现在可以在设置中选择四种新的回复风格:愤世嫉俗者、机器人、倾听者和书呆子。这些风格可以调整 ChatGPT 的语气,而无需明确的指令。
ChatGPT Plus 用户(20 美元/月)可获得更高的 GPT-5 使用限制,而专业版用户(200 美元/月)则可获得无限制访问权和 GPT-5 专业版--一个使用额外计算来获得更好答案的增强版。团队、教育和企业用户将从下周起获得 GPT-5 作为默认模式。
对于开发者来说,GPT-5 将通过 OpenAI 的 API 提供三种尺寸--gpt-5、gpt-5-mini 和 gpt-5-nano,它们的推理深度各不相同。API 现在还包括一个冗长度控制,允许开发人员设置所需的响应长度。
基本 GPT-5 模型的价格为每百万输入词块(约 75 万字)1.25 美元,每百万输出词块 10 美元。
GPT-5 的发布紧随 OpenAI 的繁忙时期。该公司最近发布了 gpt-oss,这是一个免费的开放重量级推理模型,几乎可以与早期的顶级模型(如 o3 和 o4-mini)相媲美。不过,GPT-5 在编码等领域确立了新的基准。
尽管如此,在许多基准测试中,GPT-5 仍然具有竞争力,而不是主导地位。真实世界的性能和开发人员的采用将最终决定它是否能真正超越竞争对手的模型。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (1)
0/500
OpenAI 推出了新的旗舰人工智能模型 GPT-5,它将推动下一代 ChatGPT 的发展。
GPT-5 于本周四发布,是 OpenAI 的首个统一人工智能模型,融合了 o 系列模型的推理优势和 GPT 系列的快速反应能力。这一下一代模型标志着 ChatGPT 和 OpenAI 的新篇章,彰显了该公司建立人工智能系统的雄心壮志,这些系统的行为更像主动代理,而不是被动的聊天机器人。
GPT-4 使人工智能聊天机器人能够提供各种主题的智能回答,而 GPT-5 则使 ChatGPT 能够代表用户执行任务,如开发软件应用程序、管理日程安排或编制研究简报。
OpenAI 还致力于通过 GPT-5 使 ChatGPT 更易于使用。该模型不需要用户调整设置,而是包含一个实时路由器,它能确定最佳的回复方式--无论是快速回复还是花更多时间推理答案。

OpenAI 首席执行官山姆-阿尔特曼(Sam Altman)在向记者介绍情况时,将 GPT-5 称作 "世界上最好的模型",称其为朝着开发在最具经济价值的工作中胜过人类的人工智能(也称为人工通用智能(AGI))迈出的 "重要一步"。
阿尔特曼补充说:"像GPT-5这样的工具在历史的任何其他时期都几乎是不可想象的。
从本周四开始,GPT-5 将成为所有免费 ChatGPT 用户的默认模型。据 OpenAI 的 ChatGPT 副总裁尼克-特利(Nick Turley)称,此举首次为免费用户提供了使用人工智能推理模型的机会。(在此之前,这种高级模型只有付费用户才能使用)。
"这是我们实现使命的方式之一--确保这些进步真正惠及每个人,"Turley 评论道,他指的是 OpenAI 致力于让最前沿的人工智能广泛普及。
Techcrunch 活动顶级科技和风险投资领袖加入 "颠覆 2025 "议程
Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等有影响力的公司都加入了 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在 8 月 7 日涨价之前最多可节省 675 美元。
顶级科技和风险投资领袖加入 Disrupt 2025 议程
Netflix、ElevenLabs、Wayve 和红杉资本(Sequoia Capital)等极具影响力的公司将加入 Disrupt 2025 议程。他们将分享帮助初创企业成长和保持竞争力的重要见解。千万不要错过 TechCrunch Disrupt 20 周年纪念活动--一个向科技界领军人物学习的机会。现在购买门票,在价格上涨之前最多可节省 675 美元。
旧金山|2025 年 10 月 27-29 日立即注册自 2022 年 ChatGPT 使 OpenAI 一举成名以来,GPT-5 是 OpenAI 最令人期待的发布会之一。从那时起,ChatGPT 已成为世界上使用最广泛的消费产品之一,据该公司称,现在每周有超过 7 亿用户使用,接近全球人口的 10%。
许多人认为,GPT-5 是更广泛的人工智能进步的风向标,它在硅谷的受欢迎程度可能会对大科技公司、华尔街和科技政策制定者产生重大影响。利益相关者都在关注 GPT-5 是否会像其前身 GPT-4 一样,带来人工智能能力的实质性飞跃,GPT-4 重新定义了软件所能实现的功能。
GPT-5 与竞争对手的差距微乎其微
OpenAI 声称,GPT-5 在多个领域设立了新标准,在关键基准上略微超过了 Anthropic、谷歌 DeepMind 和埃隆-马斯克的 xAI 等公司的领先模型,但在其他方面略有不足。
该公司强调了 GPT-5 的卓越编码能力;Altman 指出,该模型擅长按需生成完整的软件应用程序,这种能力通常被称为 "振动编码"。
在 SWE-bench Verified(基于 GitHub 上真实世界编码任务的测试)中,GPT-5 的首次尝试得分率为 74.9%。这使它仅次于 Anthropic 的 Claude Opus 4.1(74.5%)和 Google DeepMind 的 Gemini 2.5 Pro(59.6%)。
在 "人类最后一次考试"(Humanity's Last Exam)--一项横跨数学、人文和科学领域的严格评估--中,GPT-5(GPT-5 Pro)的扩展推理版在使用工具的情况下得分率为 42%。这一成绩略低于 xAI 的 Grok 4 Heavy,后者达到了 44.4%。

在博士级科学问题基准 GPQA Diamond 上,GPT-5 Pro 的首次尝试得分率为 89.4%,超过了 Claude Opus 4.1(80.9%)和 Grok 4 Heavy(88.9%)。
OpenAI 还报告称,GPT-5 在健康相关的问题上表现更好。在衡量医疗保健回复准确性的 HealthBench Hard Hallucinations(HealthBench 硬幻觉)测试中,GPT-5(带思维)仅有 1.6% 的时间出现幻觉,远低于 GPT-4o(12.9%)和 o3(15.8%)。
虽然人工智能聊天机器人不是医疗专业人员,但仍有数百万人向它们寻求健康建议。对此,OpenAI 表示,GPT-5 在标记潜在健康问题和帮助用户解读医疗信息方面更加积极主动。
此外,GPT-5 还擅长创意设计和写作等主观性较强的领域。特利指出,与竞争对手的模型相比,GPT-5 的反应更自然,在创意任务中表现出 "更好的品味"。
"Turley 说:"这款机型真的很不错。
GPT-5 也比 OpenAI 早期的模型更准确,而且幻觉(编造信息的倾向)更少。在最近的推理模型(如 o3)中,出现幻觉的比率一直在上升,OpenAI 之前一直在努力解释这一趋势。
在反应测试中,GPT-5(带思考)提供错误信息的比例为 4.8%--与 o3(22%)和 GPT-4o (20.6%)相比有了显著提高。
在衡量人工智能代理完成模拟在线任务能力的 Tau-bench 测试中,GPT-5 的成绩参差不齐。它在航空公司网站导航方面的得分是 63.5%(略低于 o3 的 64.8%),在零售网站导航方面的得分是 81.1%(低于 Claude Opus 4.1 的 82.4%)。
OpenAI 还强调,GPT-5 比其前代产品更加安全。虽然推理模型有时会表现出欺骗行为,但 GPT-5 的欺骗率较低,有助于提高用户体验的可信度。
安全研究负责人亚历克斯-比尤特尔(Alex Beutel)指出,减少欺骗行为不仅能提高安全性,还能使模型更加 "透明和诚实,让用户可以信赖"。
Beutel 补充说,GPT-5 更善于区分恶意误用和无害请求,从而更适当地拒绝不安全的查询,减少不必要地拒绝良性查询。
面向消费者和开发者的新功能
在发布 GPT-5 的同时,ChatGPT 还进行了多项用户体验升级。用户现在可以在设置中选择四种新的回复风格:愤世嫉俗者、机器人、倾听者和书呆子。这些风格可以调整 ChatGPT 的语气,而无需明确的指令。
ChatGPT Plus 用户(20 美元/月)可获得更高的 GPT-5 使用限制,而专业版用户(200 美元/月)则可获得无限制访问权和 GPT-5 专业版--一个使用额外计算来获得更好答案的增强版。团队、教育和企业用户将从下周起获得 GPT-5 作为默认模式。
对于开发者来说,GPT-5 将通过 OpenAI 的 API 提供三种尺寸--gpt-5、gpt-5-mini 和 gpt-5-nano,它们的推理深度各不相同。API 现在还包括一个冗长度控制,允许开发人员设置所需的响应长度。
基本 GPT-5 模型的价格为每百万输入词块(约 75 万字)1.25 美元,每百万输出词块 10 美元。
GPT-5 的发布紧随 OpenAI 的繁忙时期。该公司最近发布了 gpt-oss,这是一个免费的开放重量级推理模型,几乎可以与早期的顶级模型(如 o3 和 o4-mini)相媲美。不过,GPT-5 在编码等领域确立了新的基准。
尽管如此,在许多基准测试中,GPT-5 仍然具有竞争力,而不是主导地位。真实世界的性能和开发人员的采用将最终决定它是否能真正超越竞争对手的模型。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她





首页






