OpenAI 发布 GPT-5.4 Pro 和 Thinking 版本

周四,OpenAI 推出了 GPT-5.4,这是一款被描述为“我们目前功能最强大、效率最高的面向专业工作的前沿基础模型”的新模型。除了标准版外,GPT-5.4 还推出了专注于推理的变体(GPT-5.4 Thinking)和性能优化版(GPT-5.4 Pro)。
该模型的API版本将支持高达100万令牌的上下文窗口,这标志着OpenAI迄今为止提供的最大上下文容量。
OpenAI 还强调了令牌效率的提升,指出 GPT-5.4 解决相同问题所需的令牌数量比前代模型显著减少。
该新模型在基准测试中表现大幅提升,在计算机应用基准测试 OSWorld-Verified 和 WebArena Verified 中创下纪录。此外,在 OpenAI 针对知识型工作任务的 GDPval 测试中,其得分达到 83%,同样刷新了纪录。
据 Mercor 首席执行官 Brendan Foody 的声明,GPT-5.4 在 Mercor 的 APEX-Agents 基准测试中表现领先,该测试旨在评估法律和金融领域的专业技能。
“GPT-5.4在生成幻灯片、财务模型和法律分析等长期交付成果方面表现卓越,”福迪表示,“在运行速度更快、成本更低的同时,其性能仍处于顶尖水平,超越了竞争对手的前沿模型。”
GPT-5.4延续了OpenAI在减少幻觉和事实错误方面的努力。该公司报告称,与GPT-5.2相比,新模型在单个陈述中出错的概率降低了33%,整体响应中出现错误的概率降低了18%。
作为此次发布的一部分,OpenAI 重新设计了 GPT-5.4 API 处理工具调用的方式,引入了一个名为“工具搜索”(Tool Search)的新系统。此前,系统提示必须预先定义所有可用工具——随着工具库的扩展,这一过程会消耗大量令牌。新系统允许模型按需检索工具定义,在工具众多的环境中,这使得请求处理更快且更具成本效益。
OpenAI 还新增了一项安全评估机制,用于评估其模型的“思维链”(即在多步骤任务中揭示模型推理过程的实时注释)。AI 安全研究人员长期以来一直担心,推理模型可能会歪曲其思维链,而测试证实,在某些条件下确实可能发生这种情况。
OpenAI的新评估表明,在GPT-5.4的Thinking版本中,这种欺骗行为发生的概率较低,"这表明该模型缺乏隐藏其推理过程的能力,且CoT监控仍是一种有效的安全工具。"
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (0)
0/500

周四,OpenAI 推出了 GPT-5.4,这是一款被描述为“我们目前功能最强大、效率最高的面向专业工作的前沿基础模型”的新模型。除了标准版外,GPT-5.4 还推出了专注于推理的变体(GPT-5.4 Thinking)和性能优化版(GPT-5.4 Pro)。
该模型的API版本将支持高达100万令牌的上下文窗口,这标志着OpenAI迄今为止提供的最大上下文容量。
OpenAI 还强调了令牌效率的提升,指出 GPT-5.4 解决相同问题所需的令牌数量比前代模型显著减少。
该新模型在基准测试中表现大幅提升,在计算机应用基准测试 OSWorld-Verified 和 WebArena Verified 中创下纪录。此外,在 OpenAI 针对知识型工作任务的 GDPval 测试中,其得分达到 83%,同样刷新了纪录。
据 Mercor 首席执行官 Brendan Foody 的声明,GPT-5.4 在 Mercor 的 APEX-Agents 基准测试中表现领先,该测试旨在评估法律和金融领域的专业技能。
“GPT-5.4在生成幻灯片、财务模型和法律分析等长期交付成果方面表现卓越,”福迪表示,“在运行速度更快、成本更低的同时,其性能仍处于顶尖水平,超越了竞争对手的前沿模型。”
GPT-5.4延续了OpenAI在减少幻觉和事实错误方面的努力。该公司报告称,与GPT-5.2相比,新模型在单个陈述中出错的概率降低了33%,整体响应中出现错误的概率降低了18%。
作为此次发布的一部分,OpenAI 重新设计了 GPT-5.4 API 处理工具调用的方式,引入了一个名为“工具搜索”(Tool Search)的新系统。此前,系统提示必须预先定义所有可用工具——随着工具库的扩展,这一过程会消耗大量令牌。新系统允许模型按需检索工具定义,在工具众多的环境中,这使得请求处理更快且更具成本效益。
OpenAI 还新增了一项安全评估机制,用于评估其模型的“思维链”(即在多步骤任务中揭示模型推理过程的实时注释)。AI 安全研究人员长期以来一直担心,推理模型可能会歪曲其思维链,而测试证实,在某些条件下确实可能发生这种情况。
OpenAI的新评估表明,在GPT-5.4的Thinking版本中,这种欺骗行为发生的概率较低,"这表明该模型缺乏隐藏其推理过程的能力,且CoT监控仍是一种有效的安全工具。"
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她





首页






