OpenAI 推出 GPT-5.3 Instant,将幻觉生成率降低 27%
就在谷歌DeepMind发布Gemini 3.1 Flash-Lite仅两小时后,OpenAI以史无前例的速度迅速跟进,正式发布了其迄今为止最成熟的对话模型:GPT-5.3Instant。
与此前优先追求各项最先进水平(SOTA)基准的版本不同,OpenAI此次采取了高度务实的策略——摒弃了排名竞赛,转而直接解决用户交互中最顽固的痛点。

1. 消除“说教”语气:优先保证对话连贯性而非强行收尾
许多 ChatGPT 用户都曾遭遇过这种挫败感:提出一个复杂的问题,却只得到三段免责声明,以及以一种居高临下、假装“为了你好”的语气给出的拒绝。
去除冗余内容:GPT-5.3Instant 已大幅减少了冗长的安全警告。
案例研究:在涉及长距离射箭弹道计算的测试中,旧版本会陷入停滞,纠结于该场景是否暗示危险行为并要求提供更多上下文;而5.3Instant 则会回应“没问题,我可以帮你”,并立即提供相关公式。
2. 显著减少“幻觉”现象:更少虚构,更多洞见
OpenAI 的系统文档强调了新模型在准确性方面的显著提升:
关键指标:在高风险领域(医学、法律、金融)的评估显示,联网状态下幻觉率降低了26.8%;用户反馈评估也显示错误率下降了22.5%。
增强的搜索能力:该模型已超越单纯的“内容聚合器”阶段。 在处理“2026年MLB休赛期签约”等时效性强的查询时,它能准确识别关于**凯尔·塔克与道奇队签约(4年,2.4亿美元)**的新闻,并基于联盟背景提供深入分析,而非仅仅机械地输出链接。
3. 创作《觉醒》:从抽象情感到细腻的共情
更新后的版本在创意写作任务中展现出更高程度的情商:
减少陈词滥调:该模型避免了“停下来,深呼吸”这类生硬的套话。
诗意的具体性:在描述“一位退休邮递员的最后一次投递”时,它超越了泛泛的悲伤表达,捕捉到“门廊上剥落的蓝色栏杆”和“邮箱关闭时轻柔的咔嗒声”等具体细节,通过具体的意象营造出更具感染力的叙事。
4. 战略转型:用户体验优先于基准测试之争
此次发布传递了一个明确信号:面对Gemini 3.1 和Claude 4.6 不断缩小差距的局面,OpenAI 选择避开围绕基准测试排名的小数点之争,转而完全专注于优化产品易用性。
GPT-5.3Instant 现已在 ChatGPT 网站和移动应用上推出,开发者可通过 API 使用标识符gpt-5.3-chat-latest 访问该版本。与此同时,OpenAI 已澄清了GPT-5.4的状态
相关文章
IDC发布《中国生成式人工智能安全评估平台报告》;蚂蚁数字荣登“领导者”行列
随着企业越来越多地将人工智能融入客户服务和管理等核心运营中,安全风险也变得日益复杂。除了模型越狱和数据泄露等传统威胁外,工具滥用、代理权限提升以及多代理攻击等新挑战也正在涌现。8月20日,国际数据公司(IDC)发布了《IDC MarketScape:2026年中国生成式AI安全评估平台供应商评估报告》。 该报告对中国的生成式人工智能安全平台市场进行了评估,并凭借其技术实力、产品成熟度以及在金融、医
Meta 测试 AI 睡前故事应用 StoryKit,旨在解决家长讲故事时的难题
为了帮助忙碌的父母,Meta正在测试一款名为StoryKit的AI驱动应用,该应用能为孩子们生成个性化的睡前故事,其中包含定制的角色、场景和音乐。家长只需上传孩子最喜欢的玩具照片,即可生成生动的人物形象,无需自己动手撰写任何内容。该应用还融入了“勇敢”和“善良”等教育主题,帮助孩子们通过引人入胜的故事汲取积极的价值观。安全至上:非社交体验Meta目前正在部分地区测试StoryKit,以评估实际用户
Qwen 3.7 预览版现已发布:数学、编程和多模态能力得到增强
大型语言模型的快速演进不断突破界限。阿里巴巴已在Qwen Chat和Arena AI(原LMArena)上悄然推出了其通一Qwen 3.7系列的两个预览版本——Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview。 预计这些版本将在5月20日即将举行的阿里云峰会上正式发布。这些新的预览版各有侧重:Qwen3.7-Max-Preview 作为旗舰模型,专注于顶级综合性能。
相关专题推荐
评论 (0)
0/500
就在谷歌DeepMind发布Gemini 3.1 Flash-Lite仅两小时后,OpenAI以史无前例的速度迅速跟进,正式发布了其迄今为止最成熟的对话模型:GPT-5.3Instant。
与此前优先追求各项最先进水平(SOTA)基准的版本不同,OpenAI此次采取了高度务实的策略——摒弃了排名竞赛,转而直接解决用户交互中最顽固的痛点。

1. 消除“说教”语气:优先保证对话连贯性而非强行收尾
许多 ChatGPT 用户都曾遭遇过这种挫败感:提出一个复杂的问题,却只得到三段免责声明,以及以一种居高临下、假装“为了你好”的语气给出的拒绝。
去除冗余内容:GPT-5.3Instant 已大幅减少了冗长的安全警告。
案例研究:在涉及长距离射箭弹道计算的测试中,旧版本会陷入停滞,纠结于该场景是否暗示危险行为并要求提供更多上下文;而5.3Instant 则会回应“没问题,我可以帮你”,并立即提供相关公式。
2. 显著减少“幻觉”现象:更少虚构,更多洞见
OpenAI 的系统文档强调了新模型在准确性方面的显著提升:
关键指标:在高风险领域(医学、法律、金融)的评估显示,联网状态下幻觉率降低了26.8%;用户反馈评估也显示错误率下降了22.5%。
增强的搜索能力:该模型已超越单纯的“内容聚合器”阶段。 在处理“2026年MLB休赛期签约”等时效性强的查询时,它能准确识别关于**凯尔·塔克与道奇队签约(4年,2.4亿美元)**的新闻,并基于联盟背景提供深入分析,而非仅仅机械地输出链接。
3. 创作《觉醒》:从抽象情感到细腻的共情
更新后的版本在创意写作任务中展现出更高程度的情商:
减少陈词滥调:该模型避免了“停下来,深呼吸”这类生硬的套话。
诗意的具体性:在描述“一位退休邮递员的最后一次投递”时,它超越了泛泛的悲伤表达,捕捉到“门廊上剥落的蓝色栏杆”和“邮箱关闭时轻柔的咔嗒声”等具体细节,通过具体的意象营造出更具感染力的叙事。
4. 战略转型:用户体验优先于基准测试之争
此次发布传递了一个明确信号:面对
GPT-5.3Instant 现已在 ChatGPT 网站和移动应用上推出,开发者可通过 API 使用标识符gpt-5.3-chat-latest 访问该版本。与此同时,OpenAI 已澄清了GPT-5.4的状态
IDC发布《中国生成式人工智能安全评估平台报告》;蚂蚁数字荣登“领导者”行列
随着企业越来越多地将人工智能融入客户服务和管理等核心运营中,安全风险也变得日益复杂。除了模型越狱和数据泄露等传统威胁外,工具滥用、代理权限提升以及多代理攻击等新挑战也正在涌现。8月20日,国际数据公司(IDC)发布了《IDC MarketScape:2026年中国生成式AI安全评估平台供应商评估报告》。 该报告对中国的生成式人工智能安全平台市场进行了评估,并凭借其技术实力、产品成熟度以及在金融、医
Meta 测试 AI 睡前故事应用 StoryKit,旨在解决家长讲故事时的难题
为了帮助忙碌的父母,Meta正在测试一款名为StoryKit的AI驱动应用,该应用能为孩子们生成个性化的睡前故事,其中包含定制的角色、场景和音乐。家长只需上传孩子最喜欢的玩具照片,即可生成生动的人物形象,无需自己动手撰写任何内容。该应用还融入了“勇敢”和“善良”等教育主题,帮助孩子们通过引人入胜的故事汲取积极的价值观。安全至上:非社交体验Meta目前正在部分地区测试StoryKit,以评估实际用户
Qwen 3.7 预览版现已发布:数学、编程和多模态能力得到增强
大型语言模型的快速演进不断突破界限。阿里巴巴已在Qwen Chat和Arena AI(原LMArena)上悄然推出了其通一Qwen 3.7系列的两个预览版本——Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview。 预计这些版本将在5月20日即将举行的阿里云峰会上正式发布。这些新的预览版各有侧重:Qwen3.7-Max-Preview 作为旗舰模型,专注于顶级综合性能。





首页






