Grok 4.6 正式发布,性能与 GPT-5.6 相当,成本降低超过 60%

xAI 已推出 Grok 4.6,在人工智能智能指数中取得 61 分,与 GPT-5.6 Sol (Max) 持平,并略低于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一表现使 Grok 4.6 跻身全球顶级模型行列,直接挑战来自 OpenAI 和 Anthropic 的旗舰产品。该模型基于 Grok 4.5 的基础构建,引入了推理能力和高级技术概念训练方面的核心增强,利用由模型自身生成的精选数据,以及高质量工程数据集和优化后的训练算法。
训练方法的一个关键转变涉及自我强化的数据循环:Grok 4.5 被用于重新生成监督微调轨迹,重点涵盖推理、智能体工具利用以及科学、技术、工程和数学(STEM)、软件工程及知识工作等领域。该模型还接受了广泛的基于智能体的强化学习任务训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计——这一策略显然旨在应对新兴“智能体时代”的主要工作负载。
智能体基准测试取得了显著改进,大幅降低了复杂长期任务所需的精力。
在智能体相关的基准评估中,Grok 4.6 展现了卓越的性能。它在 GDPval-AA v2 上取得了 1753 的 Elo 分数,仅次于 Claude Opus 5。DeepSWE v1.1 的得分提升至 65.9%,相比 Grok 4.5 的 54% 有显著增长,而 APEX-Agents 则从 47.1% 跃升至 57.5%。Terminal-Bench v3.0 从 15.7% 提升至 26%,同时在 CursorBench v3.2 上取得 69.9% 和 FrontierCode v1.1 上取得 61.3% 的优异结果,标志着在编码和智能体能力方面均取得了重大突破。
值得注意的是,Grok 4.6 具有独特的成本效益优势。其定价为每百万输入令牌 2 美元,每百万输出令牌 6 美元,比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)便宜超过 60%。在 AA-Briefcase 长期知识工作基准测试中,Grok 4.6 平均仅需 53 轮即可完成任务,消耗约 5 亿个输入令牌;而 Claude Opus 5 则需要大约 103 轮和 20 亿个令牌。这意味着 Grok 4.6 以不到四分之一的资源消耗实现了相当的结果,凸显了明显的成本性能优势。该模型现已通过 Cursor、Grok Build、API、OpenRouter、Vercel 和 Cloudflare 提供访问服务。在其上线的第一周,用户在 Grok Build 和 Cursor 上将获得双倍使用额度。凭借 50 万个令牌的大上下文窗口,一场聚焦于“同等智能、更低价格”的竞争格局已正式开启。
相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
评论 (0)
0/500

xAI 已推出 Grok 4.6,在人工智能智能指数中取得 61 分,与 GPT-5.6 Sol (Max) 持平,并略低于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一表现使 Grok 4.6 跻身全球顶级模型行列,直接挑战来自 OpenAI 和 Anthropic 的旗舰产品。该模型基于 Grok 4.5 的基础构建,引入了推理能力和高级技术概念训练方面的核心增强,利用由模型自身生成的精选数据,以及高质量工程数据集和优化后的训练算法。
训练方法的一个关键转变涉及自我强化的数据循环:Grok 4.5 被用于重新生成监督微调轨迹,重点涵盖推理、智能体工具利用以及科学、技术、工程和数学(STEM)、软件工程及知识工作等领域。该模型还接受了广泛的基于智能体的强化学习任务训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计——这一策略显然旨在应对新兴“智能体时代”的主要工作负载。
智能体基准测试取得了显著改进,大幅降低了复杂长期任务所需的精力。
在智能体相关的基准评估中,Grok 4.6 展现了卓越的性能。它在 GDPval-AA v2 上取得了 1753 的 Elo 分数,仅次于 Claude Opus 5。DeepSWE v1.1 的得分提升至 65.9%,相比 Grok 4.5 的 54% 有显著增长,而 APEX-Agents 则从 47.1% 跃升至 57.5%。Terminal-Bench v3.0 从 15.7% 提升至 26%,同时在 CursorBench v3.2 上取得 69.9% 和 FrontierCode v1.1 上取得 61.3% 的优异结果,标志着在编码和智能体能力方面均取得了重大突破。
值得注意的是,Grok 4.6 具有独特的成本效益优势。其定价为每百万输入令牌 2 美元,每百万输出令牌 6 美元,比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)便宜超过 60%。在 AA-Briefcase 长期知识工作基准测试中,Grok 4.6 平均仅需 53 轮即可完成任务,消耗约 5 亿个输入令牌;而 Claude Opus 5 则需要大约 103 轮和 20 亿个令牌。这意味着 Grok 4.6 以不到四分之一的资源消耗实现了相当的结果,凸显了明显的成本性能优势。该模型现已通过 Cursor、Grok Build、API、OpenRouter、Vercel 和 Cloudflare 提供访问服务。在其上线的第一周,用户在 Grok Build 和 Cursor 上将获得双倍使用额度。凭借 50 万个令牌的大上下文窗口,一场聚焦于“同等智能、更低价格”的竞争格局已正式开启。
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码





首页






