ZhiPu 和 TileRT 推出 GLM-5.1 高速 API,处理速度达 400 个令牌/秒,创下新的全球纪录
智普今日正式面向部分企业客户推出了 GLM-5.1 高速 API(GLM-5.1-highspeed) 。该模型实现了高达 400 个令牌/秒的惊人输出速度,超越了当前大型模型 API 的全球速度纪录。
这挑战了业界长期以来的固有观念,即“高性能模型必然伴随高延迟”或“快速模型必然是轻量级的”。 GLM-5.1 Highspeed 版本是国内首个在生产环境中同时提供顶级模型能力和超低延迟的大型模型,使用户无需在模型质量和速度之间做出取舍。

重塑对速度要求严苛场景下的用户体验
在长距离任务和复杂的生产环境中,速度的提升从根本上改变了产品设计的方式:
AI编程(代码生成代理):依托GLM-5.1的强大能力,该新模型可即时响应查询。它既能理解工程背景,又能持续生成代码并优化解决方案。在需要数十次调用重建的项目中,它消除了累计长达数分钟的等待时间。
实时动态建模:在3D地图实地测试中,玩家控制角色移动并输入文本,模型会即时完成建模,并实时动态更新场景。
智能体群并行调度:在长距离任务中,该模型能在30秒内处理复杂的网页内容,并立即调度50种不同个性的人工智能智能体并行响应,展现了新一代操作系统的原型。
核心技术深度解析:TileRT高性能推理引擎
400 TPS的稳定生产级吞吐量得益于智浦GLM团队和TileRT团队实施的系统级优化:
推理引擎层(TileRT 编译期 AOT 静态调度):
传统主流框架以运算子(operator/kernel)作为基本调度单元。在单令牌和小批量场景下,这会放大调度、内存访问和同步的开销。TileRT彻底消除了运行时层的动态调度,转而将整个计算图静态调度到持久化的GPU中 persistent Engine Kernel 。在单块 GPU 内,计算、异步 I/O 和通信被分解为瓦片级微任务。整个推理过程仅启动一个内核,中间结果通过寄存器、共享内存和 L2 缓存直接传递,无需写回全局内存。
调度系统层:
通过动态批处理、请求合并和KV缓存调度优化,显著降低了高并发场景下的尾部延迟。
基础设施层:
在多显卡规模下,TileRT 将 Warp Specialization 扩展到整个8卡NVL拓扑中。根据计算密度和数据依赖关系,将不同的GPU rank专门化为不同的工作者,并结合网络链接和负载均衡进行协同优化,从而确保高性能和稳定运行。
可用性与访问
GLM-5.1 高速版非常适合需要极低响应延迟的 AI 编程、实时交互、商业决策和实时语音应用。该服务现已在智浦 MaaS 平台 正式上线,并向部分企业客户开放
相关文章
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
相关专题推荐
评论 (0)
0/500
智普今日正式面向部分企业客户推出了
这挑战了业界长期以来的固有观念,即“高性能模型必然伴随高延迟”或“快速模型必然是轻量级的”。 GLM-5.1 Highspeed 版本是国内首个在生产环境中同时提供顶级模型能力和超低延迟的大型模型,使用户无需在模型质量和速度之间做出取舍。

重塑对速度要求严苛场景下的用户体验
在长距离任务和复杂的生产环境中,速度的提升从根本上改变了产品设计的方式:
AI编程(代码生成代理):依托GLM-5.1的强大能力,该新模型可即时响应查询。它既能理解工程背景,又能持续生成代码并优化解决方案。在需要数十次调用重建的项目中,它消除了累计长达数分钟的等待时间。
实时动态建模:在3D地图实地测试中,玩家控制角色移动并输入文本,模型会即时完成建模,并实时动态更新场景。
智能体群并行调度:在长距离任务中,该模型能在30秒内处理复杂的网页内容,并立即调度50种不同个性的人工智能智能体并行响应,展现了新一代操作系统的原型。
核心技术深度解析:TileRT高性能推理引擎
400 TPS的稳定生产级吞吐量得益于智浦GLM团队和TileRT团队实施的系统级优化:
推理引擎层(TileRT 编译期 AOT 静态调度):
传统主流框架以运算子(operator/kernel)作为基本调度单元。在单令牌和小批量场景下,这会放大调度、内存访问和同步的开销。TileRT彻底消除了运行时层的动态调度,转而将整个计算图静态调度到持久化的GPU中 persistent Engine Kernel 。在单块 GPU 内,计算、异步 I/O 和通信被分解为瓦片级微任务。整个推理过程仅启动一个内核,中间结果通过寄存器、共享内存和 L2 缓存直接传递,无需写回全局内存。
调度系统层:
通过动态批处理、请求合并和KV缓存调度优化,显著降低了高并发场景下的尾部延迟。
基础设施层:
在多显卡规模下,TileRT 将 Warp Specialization 扩展到整个8卡NVL拓扑中。根据计算密度和数据依赖关系,将不同的GPU rank专门化为不同的工作者,并结合网络链接和负载均衡进行协同优化,从而确保高性能和稳定运行。
可用性与访问
GLM-5.1 高速版非常适合需要极低响应延迟的 AI 编程、实时交互、商业决策和实时语音应用。该服务现已在
字节跳动旗下 Seed 启动全球校园招聘,以虚拟股份争夺顶尖大模型人才
在大型语言模型的竞争格局中,争夺顶尖人才仍然是最关键的战略资产。4月1日,字节跳动宣布启动Seed全球校园招聘计划,作为其大模型人才培养项目的一部分。该活动面向2027届毕业生及现有实习生,旨在全球范围内发掘并锁定AI领域的精英研发与工程人才。规模扩张:全球甄选100名“AI种子”在技术快速进步的背景下,字节跳动有限公司今年大幅增加了对基础AI人才的投入:招聘范围: 该计划旨在从全球范围内招聘约100名专注于大模型的杰出候选人,对象为2027届毕业生。发展路径: Seed计划将核心业务
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码





首页






