xAI Grok 4.20 实现了业界最低的幻觉率,将完整性置于性能之上
当人工智能巨头们争先恐后地投入资源以追求最高性能分数时,埃隆·马斯克旗下的xAI却采取了不同的策略,将重点放在该领域最棘手的问题上:信息造假。 今日,xAI正式发布了Grok4.20Beta版本。尽管其在绝对智能分数上仍落后于顶级模型,但在“真实性”这一关键指标上却创下了新的行业纪录。

根据Artificial Analysis的最新评估,Grok4.20在推理模式下的智能指数得分为48分。虽然其得分落后于 和 (两者均为57分),但其事实可靠性表现尤为突出:
低幻觉率:在AA全知测试中,Grok4.20实现了78%的“无幻觉率”,创下新纪录。
知己所不知:当面对无法回答的问题时,该模型不再倾向于编造虚假事实,而是更准确地承认“我不知道”。这种诚实对于严谨的办公和研究环境至关重要。
技术架构:三合一 API 矩阵
为满足多样化需求,xAI 推出了三种 API 变体:
推理模式:优先考虑深度逻辑思考而非速度,这是此次打破“幻觉”纪录的关键。
标准模式:针对快速响应和常规交互进行了优化。
多智能体模式:支持多个 AI 实例协同工作以处理复杂任务。
市场策略:更多内容,无需额外付费
除了独特的性能表现外,Grok 4.20 还推出了一项激进的商业策略:
大上下文:支持高达200万令牌的上下文窗口,可一次性处理整本书或大型代码库。
价格优势:每百万令牌定价在 2 至 6 美元之间,不仅比前代版本 Grok4 更便宜,在当前西方主流模型中也极具竞争力。
Grok4.20的发布反映了xAI的战略转变——不再执着于通向AGI的总分竞赛,而是精准瞄准“企业级可靠性”这一痛点。 正如评估机构所言,如果其他模型都在努力成为“全知先知”,那么 Grok4.20 则致力于成为“永不撒谎的助手”。
对于对数据准确性要求极高的用户而言,除了 OpenAI 和谷歌之外,Grok4.20 可能会成为第三个主要选择。
相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
评论 (0)
0/500
当人工智能巨头们争先恐后地投入资源以追求最高性能分数时,埃隆·马斯克旗下的xAI却采取了不同的策略,将重点放在该领域最棘手的问题上:信息造假。 今日,xAI正式发布了Grok4.20Beta版本。尽管其在绝对智能分数上仍落后于顶级模型,但在“真实性”这一关键指标上却创下了新的行业纪录。

根据Artificial Analysis的最新评估,Grok4.20在推理模式下的智能指数得分为48分。虽然其得分落后于
低幻觉率:在AA全知测试中,Grok4.20实现了78%的“无幻觉率”,创下新纪录。
知己所不知:当面对无法回答的问题时,该模型不再倾向于编造虚假事实,而是更准确地承认“我不知道”。这种诚实对于严谨的办公和研究环境至关重要。
技术架构:三合一 API 矩阵
为满足多样化需求,xAI 推出了三种 API 变体:
推理模式:优先考虑深度逻辑思考而非速度,这是此次打破“幻觉”纪录的关键。
标准模式:针对快速响应和常规交互进行了优化。
多智能体模式:支持多个 AI 实例协同工作以处理复杂任务。
市场策略:更多内容,无需额外付费
除了独特的性能表现外,Grok 4.20 还推出了一项激进的商业策略:
大上下文:支持高达200万令牌的上下文窗口,可一次性处理整本书或大型代码库。
价格优势:每百万令牌定价在 2 至 6 美元之间,不仅比前代版本 Grok4 更便宜,在当前西方主流模型中也极具竞争力。
Grok4.20的发布反映了xAI的战略转变——不再执着于通向AGI的总分竞赛,而是精准瞄准“企业级可靠性”这一痛点。 正如评估机构所言,如果其他模型都在努力成为“全知先知”,那么 Grok4.20 则致力于成为“永不撒谎的助手”。
对于对数据准确性要求极高的用户而言,除了 OpenAI 和谷歌之外,Grok4.20 可能会成为第三个主要选择。
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码





首页






