选项
首页
新闻
随着Sol和Luna的加入,OpenAI GPT-6在各项基准测试中将令牌成本削减了一半

随着Sol和Luna的加入,OpenAI GPT-6在各项基准测试中将令牌成本削减了一半

2026-10-04
21

据Artificial Analysis报道,GPT-6 Sol(最高配置)在智能排名中位居榜首,售价为48美元。图片来源:Getty Images

在OpenAI发布GPT-6 Sol和Luna之后,解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》解释了这些新模型如何为企业提供更强的运营灵活性。

OpenAI 近期推出了 GPT-6 Astra,并将其描述为“全球最智能、最契合需求的模型”。随后,这家人工智能实验室又发布了 GPT-6 Sol 和 GPT-6 Luna,这两款高性价比的变体模型采用与旗舰模型 GPT-6 Astra 类似的训练方法。

随着对代币使用成本不断攀升的担忧日益加剧,人工智能公司之间的价格竞争愈发激烈,尤其是当中国开放式大模型正威胁着抢占企业客户市场之际。

基准测试公司Artificial Analysis指出,GPT-6 Sol和Luna与GPT-5.6 Sol及Luna相比,成本降低了50%,正在“推动成本效率的边界”。

OpenAI 解决方案工程主管马特·韦弗(Matt Weaver)向《AI Magazine》表示:“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。”

OpenAI 解决方案工程主管马特·韦弗。图片来源:马特·韦弗/LinkedIn

将模型与工作流程相匹配

OpenAI 声称其 GPT-6 模型在成本-智能曲线上处于领先地位,通过专为高效、大规模部署设计的基础设施,在所有层级上均提供卓越的能力。

该公司指出,缓存和推理技术的进步使得这些模型能够以更低的成本提供服务,与 GPT-5.6 的促销价格相比,Sol 和 Luna 的 API 价格降低了 50%,从而将节省的成本直接惠及用户。

在解释各AI模型的独特作用时,Matt补充道:“GPT-6 Astra专为要求最严苛的项目而设计,在这些项目中,最大性能至关重要。

OpenAI GPT-6 在各项基准测试中将 Sol 和 Luna 的代币成本减半

Matt 解释道:“GPT-6 Sol 专为复杂的专业任务而设计,包括繁复的业务工作流和编码;而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的解决方案。

“Sol 和 Luna 将 Astra 在专业工作、事实准确性、编码和计算机应用方面的进步,融入到更快、更经济实惠的模型中。随着 AI 从实验阶段过渡到核心业务运营,为每种任务类型选择合适的模型至关重要。

“我们的目标是让先进的人工智能在各组织中得到实际应用——帮助团队加快工作节奏、做出更明智的决策,并将更多时间投入到更高价值的工作中。”

关键事实

  • OpenAI 将 GPT-6 Sol 和 Luna 的 API 价格较 GPT-5.6 下调了 50%
  • GPT-6 Sol 在 AutomationBench 上的表现超越了 Claude Opus 5,而成本仅为其 9%
  • GPT-6 Sol(最高配置)的输出速度达到每秒 131 个令牌
  • Intelligence Index 任务成本降至 Sol 版 1.06 美元、Luna 版 0.07 美元
  • GPT-6 Sol和Luna在AA-Omniscience基准测试中均表现出更低的幻觉率。

模型性能分析

OpenAI强调,在跨应用程序测试业务工作流的AutomationBench平台上,GPT-6 Sol在“xhigh”努力级别下的表现优于Claude Opus 5在“max”努力级别下的表现,而其每项任务的成本仅为Opus 5的9%。

该公司指出,在“高”努力级别下,GPT-6 Luna 的表现较其前代产品提升了 5.4 个百分点,而每任务成本降低了 58%。

OpenAI 指出,在评估代理在复杂专业工作流中表现的“Agents’ Last Exam”测试中,以“最大努力”模式运行的 GPT-6 Sol 得分达到 56.4%,超过了 Claude Opus 5 在该评估中的最高得分,且每任务成本降低了 61%。

该公司指出,在评估编码代理生成的代码变更是否可直接合并到真实代码库的“FrontierCode”测试中,GPT-6 Sol 相较于 GPT-5.6 Sol 表现出了显著提升,且以更低的成本达到了与 Claude Fable 5.1 xhigh 相当的水平。

这两款模型在“AA-Omniscience”(Artificial Analysis 用于评估知识和幻觉的基准测试)中的幻觉率均有所降低。

“借助 GPT-6 Sol 和 Luna,我们为企业提供了更大的灵活性,使其能够根据具体工作需求选择合适的模型。

”——OpenAI 解决方案工程主管

Matt

Weaver

每项智能指数任务的成本。图片来源:Artificial Analysis

这家基准测试公司解释称,GPT-6 Sol 版本包含六个模型,每个模型在智能水平、性能和定价方面均具有鲜明的特点。通过对比这六个模型的关键指标,Artificial Analysis 发现:

  • 在智能方面,GPT-6 Sol系列的顶级模型是GPT-6 Sol (max),其智能指数为48。
  • 在输出速度方面,最快的模型是 GPT-6 Sol (max),达到 131 t/s。
  • 在延迟方面,GPT-6 Sol (Non-reasoning) 以 0.93 秒的首次回答令牌响应时间表现最佳。
  • 在定价方面,GPT-6 Sol (low) 的单任务成本最低,为 0.13 美元。各模型之间的价格差异最高可达 8 倍。

该公司发现,在所有模型中,智能指数和编码代理指数的得分与 GPT-5.6 保持一致,部分评估指标有所进步,而另一些则出现退步。

GPT-6 Sol 专为高难度专业工作而设计——从复杂的业务工作流到编程——而 GPT-6 Luna 则为文档摘要或信息提取等高吞吐量、定义明确的任务提供了更高效的选项

。——OpenAI 解决方案工程主管 Matt Weaver

在 FrontierCode 1.1 Main⁠ 中,AI 代理编写的代码不仅按正确性评分,还会根据“可合并性”进行评分:例如测试质量、范围规范、代码风格以及对代码库标准的遵守情况。图片来源:OpenAI

成本效率的重要性

围绕AI模型定价的竞争日益激烈,这往往是由低成本的中国模型推动的。 正如布鲁金斯学会的凯尔·陈(Kyle Chan)在博客中指出的,中国模型大多是开源的,这使用户能够定制模型,并以更低的价格获得相当于美国模型 90% 性能的模型。因此,这些模型正在以成本为导向的企业中迅速占据一席之地。

OpenAI正积极调整战略以保持竞争力;尽管新模型每项任务的输出令牌量略有增加,但运行“人工智能分析指数”的成本却显著降低:

  • GPT-6 Sol(最高配置):每项任务成本为1.06美元(较GPT-5.6 Sol的1.99美元下降约50%),尽管输出令牌量从GPT-5.6的2.9万增至3.1万。
  • GPT-6 Luna(最高配置):每项任务成本为0.07美元(较GPT-5.6 Luna的0.18美元下降约60%),尽管输出令牌量从GPT-5.6的4.1万增加至5.1万。

Artificial Analysis 指出,这两款产品的发布使 OpenAI 能够占据成本效益帕累托前沿(即在不相应提高价格的情况下无法进一步提升性能的最佳边界)的相当大一部分。

通过在不牺牲性能的前提下降低准入门槛,OpenAI 正致力于解决企业面临的“令牌疲劳”问题,同时抵御低成本市场竞争对手的挑战。

相关文章
斯坦福大学的研究人员如何利用人工智能设计出一种合成病毒 斯坦福大学的研究人员如何利用人工智能设计出一种合成病毒 人工智能领域的领军人物已指出具备生物能力的AI模型可能带来的风险。图片来源:CDC/Unsplash美国研究人员利用人工智能设计出了首个针对大肠杆菌的合成病毒,而Anthropic首席执行官达里奥·阿莫代伊则对人工智能引发的生物威胁表示担忧。美国斯坦福大学的科学家们利用人工智能设计出了自然界中不存在的病毒。该团队的研究基于Evo 2生成的基因组,这是一种生成式人工智能模型,旨在通过提出新型DNA序
Hexagon:超过半数的成年人对机器人充满热情 Hexagon:超过半数的成年人对机器人充满热情 机器人正越来越多地融入企业运营。图片来源:HumanoidHexagon的数据表明,59%的成年人对与机器人共事感到兴奋,但正在崛起的“机器人一代”儿童对人工智能工作场所的期待更为强烈Hexagon的最新数据显示,超过半数的成年人对与机器人共事的前景感到兴奋。该数据将成年人的观点与儿童的观点进行了对比,后者持有不同看法,并将引领下一代。数据显示,五分之四的儿童(80%)表示对机器人充满期待,而成年
AI坟场:一份不断更新的失败项目与初创公司清单 AI坟场:一份不断更新的失败项目与初创公司清单 Relay 是一家定位为 Zapier 替代方案的人工智能驱动工作流自动化平台,已于周一停止运营。该服务曾允许用户通过人工智能代理实现电子邮件和任务工作流的自动化,但随着 OpenAI、谷歌等主要平台将类似的自动化功能直接整合到其生态系统中,这家成立五年的 Relay 难以证明其作为独立产品的存在价值。Relay这家被大型平台超越的初创公司,反映了当前行业格局的一个侧面。然而,许多人工智能项目甚至
相关专题推荐
音乐创作 用于音乐创作的AI歌词创意工具
用于音乐创作的AI歌词创意工具

2026年最新、最受欢迎、评价最高的AI歌词创意工具现已登陆XIX.AI!这份精心精选的合集汇集了多款功能强大、颠覆性的工具,它们均经过实际测试,能够快速提供高质量的歌词创意,帮助用户激发创造力并优化音乐创作流程。 您还可以获取免费版与付费版的对比概览。立即探索,发现最适合您的工具!

16 个工具
xix.ai
漫画创作 用于漫画世界构建的AI角色设定表工具
用于漫画世界构建的AI角色设定表工具

2026 年最新最佳顶级评分 AI 角色表工具,助力漫画世界构建,现已登陆 XIX.AI!本精选列表收录了经过严格现实测试的强大且具颠覆性的选项。您将看到免费与付费版本的对比,以及每周更新的排行榜,助您发掘那些能激发创意并简化世界构建任务的必备工具。立即探索,解锁您的 AI 优势!

13 个工具
xix.ai
自动化 n8n 人工智能自动化工具,适用于内部运维、数据同步和多步骤代理流程
n8n 人工智能自动化工具,适用于内部运维、数据同步和多步骤代理流程

2026年最新最佳n8n AI自动化工具——适用于内部运营、数据同步和多步骤代理流程——现已发布!XIX.AI精心甄选了一系列广受好评、功能强大的颠覆性工具,可提升所有工作任务的生产力。 每款工具均经过严格的实际应用测试以确保可靠性,并附有详细的免费版与付费版对比分析及每周更新的排行榜。这些必试选项能助您发挥人工智能优势,轻松优化工作流程。立即探索,发现最适合您的工具!

11 个工具
xix.ai
提示词 适合多模型团队的最佳提示词管理工具
适合多模型团队的最佳提示词管理工具

2026年最新最佳、评分最高的面向多模型团队的提示词管理工具! XIX.AI 精心精选了一系列功能强大、颠覆性的必试工具,提供免费与付费版本对比、实际应用测试及详细排名。这些广受好评的解决方案通过优化工作流程、消除重复劳动并在所有团队项目中激发创造力,能显著提升工作效率。立即探索,发现最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
会议助理 适用于远程团队的 AI 会议摘要工具
适用于远程团队的 AI 会议摘要工具

2026年最新最受欢迎的远程团队AI会议摘要工具!XIX.AI精心挑选了一系列功能强大、颠覆性的必试工具,这些工具均经过实际测试,可提供准确的会议记录和可操作的洞察。 您将看到免费版与付费版的对比数据以及详细排名,助您挑选出最适合的方案,从而提升工作效率并优化团队沟通。立即探索,释放您的AI优势!

13 个工具
xix.ai
软件开发 最佳 AI DevOps 辅助工具:监控部署、日志及故障事件
最佳 AI DevOps 辅助工具:监控部署、日志及故障事件

2026年最新、最优秀、评分最高的AI DevOps辅助工具汇总,专为监控部署流程、日志记录及故障处理而设计。XIX.AI通过实际应用测试与严格的评分体系,提供了极具突破性的强大工具,能够显著提升工作效率。您可以查看免费版与付费版的对比信息,找到最适合您工作流程的理想解决方案。立即探索,让AI优势助力您的业务发展。

7 个工具
xix.ai
评论 (0)
0/500
OR