智普发布GLM-5.1高速版:400个令牌/秒创下全球API新纪录

5月22日,智普(02513.HK)在资本市场和科技行业引发了轰动。 其股价在交易时段内飙升逾22%,市值突破4500亿港元。同日,该公司面向企业客户推出了一款重磅新产品:GLM-5.1高速API(GLM-5.1-highspeed)。
在实际测试中,该模型展现出了400 tokens/s(每秒400个令牌)的惊人速度,突破了全球主要大模型供应商官方API的现有速度上限。换言之:创作者此前需要连续工作数天才能产出的文本量,现在仅需一分钟即可完成。 一项原本需要工程师花费三天时间手动编写代码的系统重构任务,如今只需喝一杯咖啡的时间即可完全执行完毕。
核心亮点:
打破常规:传统上,业界认为“快”就意味着“小”或“轻量级”。智普是国内首家实现**“全规模旗舰级能力”与“极低延迟”**无缝结合的大模型供应商。
硬核成就:输出速度达400令牌/秒,支持20万令牌长的上下文窗口,单次最大输出可达12.8万令牌。
底层黑科技:该模型由智普GLM团队与TileRT团队深度协作开发,重构了整个系统级推理生态系统。
定向试点:现已通过智普的 MaaS(模型即服务)开放平台向部分企业客户开放。
“即时响应”究竟是怎样的体验?速度敏感场景中的突破
过去一年间,国内大模型在编码(编程)与智能代理协作能力方面取得了显著进展。但“速度”始终是长链、高频交互任务的核心瓶颈。 智普指出,当处理速度达到400个令牌/秒时,大模型从“工具”向“实时伙伴”的转变将真正带来革命性变革:
AI编程(编码代理):传统智能代理通常需要数十次跨文件调用和长文本对齐。 单轮响应延迟几秒,就可能导致整个任务耗时超过十分钟。借助高速版本,编写代码仿佛以10倍速运行——函数、接口及底层调用链会在用户输入时即时展开,彻底消除了大规模工程重构的等待时间。
实时交互与3D游戏:极低的延迟使模型能够处理游戏世界中的实时动态生成、即时Web UI构建,以及基于持续用户输入的即时系统状态变更——所有操作均无延迟。
商业决策集群:在多智能体并行仿真和实时大数据分析中,高速版本支持在30秒内完成复杂的Web智能体集群多人格并行响应,显著提升了高频量化与仿真的效率上限。
无缝实时语音:在AI辅导和智能客服场景中,超快响应将从语音识别(ASR)到语音合成(TTS)的延迟降至接近零,呈现真正自然、节奏一致的类人对话流程。
解读三大“黑科技”层:我们如何实现400令牌/秒?
这一全球速度纪录主要得益于智普GLM团队与TileRT团队共同开发的系统级工程优化。400 tokens/s并非一闪而过的“巅峰时刻”——而是一项稳定且可投入生产的能力。其底层优化逻辑可分解为三个层次:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推理引擎层(TileRT深度定制):基于GLM-5.1独特的网络架构,团队彻底重写了最关键的推理路径和底层运算子,使单张GPU的吞吐量和硬件执行效率逼近物理极限。
调度系统层(智能合并):引入了极具前瞻性的动态批处理、请求合并技术以及突破性的KV缓存调度优化,有效解决了传统模型在高并发和多用户请求下面临的尾部延迟问题。
基础设施层(集群协作):围绕网络部署、网络链路拓扑以及推理集群的超高频负载均衡,进行了全面的硬件级协同优化,确保计算能力在整个管道中无损传输。
行业重新评估:AI的下半场关乎“价值与时间”的博弈
正如瑞银(UBS)等国际顶级分析机构在近期香港科技股论坛上所强调的,本轮由AI驱动的行业重新评估,与移动互联网时代的“流量和时间变现”有着根本性的不同。 AI的营收与生存哲学不在于将用户困在软件中,而在于“帮助用户和企业节省时间、提高效率,并分享所创造的价值”。
智普的GLM-5.1高速版直接解决了这一痛点。 通过将生成每个令牌的成本和时间压缩至原来的几分之一,它使企业无需再在“高智能(选择大模型但速度慢)”与“速度(选择小模型但功能单调)”之间进行痛苦的权衡。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500

5月22日,智普(02513.HK)在资本市场和科技行业引发了轰动。 其股价在交易时段内飙升逾22%,市值突破4500亿港元。同日,该公司面向企业客户推出了一款重磅新产品:GLM-5.1高速API(GLM-5.1-highspeed)。
在实际测试中,该模型展现出了400 tokens/s(每秒400个令牌)的惊人速度,突破了全球主要大模型供应商官方API的现有速度上限。换言之:创作者此前需要连续工作数天才能产出的文本量,现在仅需一分钟即可完成。 一项原本需要工程师花费三天时间手动编写代码的系统重构任务,如今只需喝一杯咖啡的时间即可完全执行完毕。
核心亮点:
打破常规:传统上,业界认为“快”就意味着“小”或“轻量级”。智普是国内首家实现**“全规模旗舰级能力”与“极低延迟”**无缝结合的大模型供应商。
硬核成就:输出速度达400令牌/秒,支持20万令牌长的上下文窗口,单次最大输出可达12.8万令牌。
底层黑科技:该模型由智普GLM团队与TileRT团队深度协作开发,重构了整个系统级推理生态系统。
定向试点:现已通过智普的 MaaS(模型即服务)开放平台向部分企业客户开放。
“即时响应”究竟是怎样的体验?速度敏感场景中的突破
过去一年间,国内大模型在编码(编程)与智能代理协作能力方面取得了显著进展。但“速度”始终是长链、高频交互任务的核心瓶颈。 智普指出,当处理速度达到400个令牌/秒时,大模型从“工具”向“实时伙伴”的转变将真正带来革命性变革:
AI编程(编码代理):传统智能代理通常需要数十次跨文件调用和长文本对齐。 单轮响应延迟几秒,就可能导致整个任务耗时超过十分钟。借助高速版本,编写代码仿佛以10倍速运行——函数、接口及底层调用链会在用户输入时即时展开,彻底消除了大规模工程重构的等待时间。
实时交互与3D游戏:极低的延迟使模型能够处理游戏世界中的实时动态生成、即时Web UI构建,以及基于持续用户输入的即时系统状态变更——所有操作均无延迟。
商业决策集群:在多智能体并行仿真和实时大数据分析中,高速版本支持在30秒内完成复杂的Web智能体集群多人格并行响应,显著提升了高频量化与仿真的效率上限。
无缝实时语音:在AI辅导和智能客服场景中,超快响应将从语音识别(ASR)到语音合成(TTS)的延迟降至接近零,呈现真正自然、节奏一致的类人对话流程。
解读三大“黑科技”层:我们如何实现400令牌/秒?
这一全球速度纪录主要得益于智普GLM团队与TileRT团队共同开发的系统级工程优化。400 tokens/s并非一闪而过的“巅峰时刻”——而是一项稳定且可投入生产的能力。其底层优化逻辑可分解为三个层次:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推理引擎层(TileRT深度定制):基于GLM-5.1独特的网络架构,团队彻底重写了最关键的推理路径和底层运算子,使单张GPU的吞吐量和硬件执行效率逼近物理极限。
调度系统层(智能合并):引入了极具前瞻性的动态批处理、请求合并技术以及突破性的KV缓存调度优化,有效解决了传统模型在高并发和多用户请求下面临的尾部延迟问题。
基础设施层(集群协作):围绕网络部署、网络链路拓扑以及推理集群的超高频负载均衡,进行了全面的硬件级协同优化,确保计算能力在整个管道中无损传输。
行业重新评估:AI的下半场关乎“价值与时间”的博弈
正如瑞银(UBS)等国际顶级分析机构在近期香港科技股论坛上所强调的,本轮由AI驱动的行业重新评估,与移动互联网时代的“流量和时间变现”有着根本性的不同。 AI的营收与生存哲学不在于将用户困在软件中,而在于“帮助用户和企业节省时间、提高效率,并分享所创造的价值”。
智普的GLM-5.1高速版直接解决了这一痛点。 通过将生成每个令牌的成本和时间压缩至原来的几分之一,它使企业无需再在“高智能(选择大模型但速度慢)”与“速度(选择小模型但功能单调)”之间进行痛苦的权衡。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






