智谱发布GLM-5.3:7400亿参数不变,通过后训练编程能力方法实现50%性能提升
智谱于8月14日正式发布GLM-5.3,其参数量保持与前代GLM-5.3一致的740亿,跳过了此前传闻的万亿参数升级,该升级可能留待GLM-5.5版本。通过先进的后训练技术,智谱将GLM-5.3的性能提升了50%,在多个主流基准测试中位居当前开源模型前列。其代码生成与智能体(Agent)能力可与Claude Opus 4.8相媲美,在编程效率方面超越其他国内模型。
关键基准测试的提升凸显了模型能力的增强。在评估真实终端环境中复杂任务完成的Terminal-Bench 3.0上,得分从4.6飙升至28.3。在专注于长期软件工程与持续代码修改的DeepSWE v1.1中,性能从46.2提升至66.9。在涵盖多种专业场景、强调跨工具协作与长期任务的Agents’ Last Exam中,得分从23.8提升至28.5。此外,GLM-5.3在涵盖44个职业领域、评估高价值知识工作的GDPval-AA v2中取得了1,769分,展现出基于编程技能的强大专业任务执行能力。总体而言,该模型在复杂软件工程、终端操作及更广泛的现实世界智能体任务方面取得了显著进步。

最具说服力的证据来自智谱自研的Z.ai Code Bench评测套件。该套件将模型置于真实的本地开发环境中,在各种推理模式下执行端到端任务,高度模拟使用代码智能体的体验。结果表明,GLM-5.3在有效性与Token效率之间实现了最佳平衡:在High模式下,其准确率达到31.4%,优于Claude Opus 4.8最大模式的29.5%,而每任务平均仅消耗约50,000个Token,相比之下Opus 4.8需消耗120,000个Token。这表明GLM-5.3能够以显著更短的执行路径完成相同任务。

关于产品可用性,GLM-5.3现已在智谱官方编码工具ZCode及生产力工具AutoClaw上开放使用,面向所有GLM Coding Plan用户及订阅者开放。包括TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode和OpenCode在内的第三方编码平台也已提供早期访问权限。API即将上线,所有模型权重将在完成必要的安全增强后于两周内开源。智谱的策略侧重于限制模型的潜在攻击能力,同时保留其防御价值。今日13:00,所有GLM Coding Plan用户的配额已重置,后端使用统计数据显示所有人的限制已恢复。
相关文章
Tesollo 在人手机器人研发之际启动 IPO 发行
Tesollo 正在研发兼容任何仿人平台的高自由度机械手。| 图片来源:Tesollo机器人机械手创新企业 Tesollo Inc. 在成功完成 B 轮融资以支持全球扩张后,已正式启动计划于明年进行的首次公开募股(IPO)准备工作。该公司总部位于韩国仁川,专注于制造核心机器人部件、先进末端执行器以及旨在提升机器人自主性和实现人机无缝协作的系统。“通过我们的 IPO,我们旨在建立全球客户信赖的企业基础,并加速我们在海外市场的扩张,”Tesollo 首席执行官 Kim Young-Jin 表示。“通
由里德·霍夫曼和马克·平库斯联合创立的新AI实验室Prentis,正在洽谈筹集1亿美元资金。
据两位知情人士透露,专注于计算机使用模型的新兴AI研究实验室Prentis,由连续创业者Ritankar Das与科技行业资深人士Reid Hoffman和Mark Pincus联合创立,目前正在谈判以10亿美元的估值筹集1亿美元资金。自今年4月推出以来,Prentis一直在训练模型,使其掌握办公人员在各种文档和系统中处理的常规工作流程,旨在创建能够控制计算机以自动化这些任务的AI代理。Prentis计划开发针对特定客户需求定制的代理,例如处理保险索赔和自动化关税退税例外情况,从而消除人类手
AIR 筹集 5000 万美元,助力企业审核 AI 智能体使用的技能与附加组件
随着企业越来越多地允许 AI 智能体访问其内部系统,围绕这些智能体所依赖的工具——包括技能、插件、MCP 服务器以及实现互联网交互的附加组件——正在形成一个新的软件供应链。AI 安全初创公司 AIR 认为,企业需要一种监控该供应链的方法,目前该公司已结束隐身状态,通过两轮种子轮融资筹集了 5000 万美元,以开发必要的产品。AIR 由 Yair Saban(首席执行官)和 Niv Hoffman(首席技术官)创立,两人均为以色列 8200 情报部队的前成员,专注于进攻性网络安全。AIR 提供
相关专题推荐
评论 (0)
0/500
智谱于8月14日正式发布GLM-5.3,其参数量保持与前代GLM-5.3一致的740亿,跳过了此前传闻的万亿参数升级,该升级可能留待GLM-5.5版本。通过先进的后训练技术,智谱将GLM-5.3的性能提升了50%,在多个主流基准测试中位居当前开源模型前列。其代码生成与智能体(Agent)能力可与Claude Opus 4.8相媲美,在编程效率方面超越其他国内模型。
关键基准测试的提升凸显了模型能力的增强。在评估真实终端环境中复杂任务完成的Terminal-Bench 3.0上,得分从4.6飙升至28.3。在专注于长期软件工程与持续代码修改的DeepSWE v1.1中,性能从46.2提升至66.9。在涵盖多种专业场景、强调跨工具协作与长期任务的Agents’ Last Exam中,得分从23.8提升至28.5。此外,GLM-5.3在涵盖44个职业领域、评估高价值知识工作的GDPval-AA v2中取得了1,769分,展现出基于编程技能的强大专业任务执行能力。总体而言,该模型在复杂软件工程、终端操作及更广泛的现实世界智能体任务方面取得了显著进步。

最具说服力的证据来自智谱自研的Z.ai Code Bench评测套件。该套件将模型置于真实的本地开发环境中,在各种推理模式下执行端到端任务,高度模拟使用代码智能体的体验。结果表明,GLM-5.3在有效性与Token效率之间实现了最佳平衡:在High模式下,其准确率达到31.4%,优于Claude Opus 4.8最大模式的29.5%,而每任务平均仅消耗约50,000个Token,相比之下Opus 4.8需消耗120,000个Token。这表明GLM-5.3能够以显著更短的执行路径完成相同任务。

关于产品可用性,GLM-5.3现已在智谱官方编码工具ZCode及生产力工具AutoClaw上开放使用,面向所有GLM Coding Plan用户及订阅者开放。包括TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode和OpenCode在内的第三方编码平台也已提供早期访问权限。API即将上线,所有模型权重将在完成必要的安全增强后于两周内开源。智谱的策略侧重于限制模型的潜在攻击能力,同时保留其防御价值。今日13:00,所有GLM Coding Plan用户的配额已重置,后端使用统计数据显示所有人的限制已恢复。
Tesollo 在人手机器人研发之际启动 IPO 发行
Tesollo 正在研发兼容任何仿人平台的高自由度机械手。| 图片来源:Tesollo机器人机械手创新企业 Tesollo Inc. 在成功完成 B 轮融资以支持全球扩张后,已正式启动计划于明年进行的首次公开募股(IPO)准备工作。该公司总部位于韩国仁川,专注于制造核心机器人部件、先进末端执行器以及旨在提升机器人自主性和实现人机无缝协作的系统。“通过我们的 IPO,我们旨在建立全球客户信赖的企业基础,并加速我们在海外市场的扩张,”Tesollo 首席执行官 Kim Young-Jin 表示。“通
由里德·霍夫曼和马克·平库斯联合创立的新AI实验室Prentis,正在洽谈筹集1亿美元资金。
据两位知情人士透露,专注于计算机使用模型的新兴AI研究实验室Prentis,由连续创业者Ritankar Das与科技行业资深人士Reid Hoffman和Mark Pincus联合创立,目前正在谈判以10亿美元的估值筹集1亿美元资金。自今年4月推出以来,Prentis一直在训练模型,使其掌握办公人员在各种文档和系统中处理的常规工作流程,旨在创建能够控制计算机以自动化这些任务的AI代理。Prentis计划开发针对特定客户需求定制的代理,例如处理保险索赔和自动化关税退税例外情况,从而消除人类手
AIR 筹集 5000 万美元,助力企业审核 AI 智能体使用的技能与附加组件
随着企业越来越多地允许 AI 智能体访问其内部系统,围绕这些智能体所依赖的工具——包括技能、插件、MCP 服务器以及实现互联网交互的附加组件——正在形成一个新的软件供应链。AI 安全初创公司 AIR 认为,企业需要一种监控该供应链的方法,目前该公司已结束隐身状态,通过两轮种子轮融资筹集了 5000 万美元,以开发必要的产品。AIR 由 Yair Saban(首席执行官)和 Niv Hoffman(首席技术官)创立,两人均为以色列 8200 情报部队的前成员,专注于进攻性网络安全。AIR 提供





首页






