ZhiPu 與 TileRT 推出每秒 400 個標記的 GLM-5.1 高速 API,創下全球新紀錄
智普今日正式向部分企業客戶推出 GLM-5.1 高速 API(GLM-5.1-highspeed) 。該模型實現了每秒 400 個標記的驚人輸出速度,超越了當前大型模型 API 的全球速度紀錄。
這挑戰了業界長期以來的普遍認知,即「高性能模型必然伴隨高延遲」,或是「快速模型必然是輕量級的」。 GLM-5.1 Highspeed 版本是國內首個能在生產環境中同時提供頂級模型能力與超低延遲的大型模型,讓使用者無需在模型品質與速度之間做出取捨。

徹底改變對速度要求嚴苛情境下的使用者體驗
在長程任務與複雜的生產環境中,這項速度提升已從根本上改變了產品設計的方式:
AI 程式設計(程式碼生成代理):憑藉 GLM-5.1 的強大能力,新模型能即時回應查詢。它既能理解工程情境,又能持續生成程式碼並優化解決方案。在需要數十次呼叫的重建專案中,它消除了累計長達數分鐘的等待時間。
即時動態建模:在 3D 地圖實地測試中,玩家控制角色移動並輸入文字,模型會立即完成建模,並即時動態更新場景。
代理群平行調度:在長程任務中,該模型能在 30 秒內處理複雜網頁,並立即調度 50 種不同個性的人工智慧代理並行回應,展現了新一代作業系統的原型。
核心技術深度解析:TileRT 高效能推論引擎
400 TPS 的穩定生產級吞吐量,源自智浦 GLM 團隊與 TileRT 團隊所進行的系統級優化:
推論引擎層(TileRT 編譯期 AOT 靜態調度):
傳統主流框架以運算子(operator/kernel)作為基本調度單位。在單令牌與小批次情境下,這會放大調度、記憶體存取及同步的開銷。TileRT 徹底消除執行時層面的動態調度,轉而將整個計算圖在編譯期間(AOT)靜態調度至持久的 GPU persistent Engine Kernel 。在單一 GPU 內,運算、非同步 I/O 及通訊均被分解為瓦片級微任務。整個推論過程僅啟動一個核心,中間結果直接透過寄存器、共享記憶體及 L2 快取傳輸,無需寫回全域記憶體。
調度系統層:
透過動態批次處理、請求合併及 KV 快取調度優化,大幅降低了高並發情境下的尾部延遲。
基礎架構層:
在多卡規模下,TileRT 將 Warp Specialization 概念,將其從單一 SM 擴展至整個 8 張卡的 NVL 拓撲。根據運算密度與資料依賴性,將不同的 GPU 排級專門化為不同的工作節點,並結合網路連結與負載平衡進行協同優化,確保高效能與穩定運作。
可用性與存取
GLM-5.1 高速版非常適合用於 AI 程式設計、即時互動、商業決策,以及需要極低回應延遲的即時語音應用。該服務現已於智浦 MaaS 平台 正式上線,並向精選企業客戶開放
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500
智普今日正式向部分企業客戶推出
這挑戰了業界長期以來的普遍認知,即「高性能模型必然伴隨高延遲」,或是「快速模型必然是輕量級的」。 GLM-5.1 Highspeed 版本是國內首個能在生產環境中同時提供頂級模型能力與超低延遲的大型模型,讓使用者無需在模型品質與速度之間做出取捨。

徹底改變對速度要求嚴苛情境下的使用者體驗
在長程任務與複雜的生產環境中,這項速度提升已從根本上改變了產品設計的方式:
AI 程式設計(程式碼生成代理):憑藉 GLM-5.1 的強大能力,新模型能即時回應查詢。它既能理解工程情境,又能持續生成程式碼並優化解決方案。在需要數十次呼叫的重建專案中,它消除了累計長達數分鐘的等待時間。
即時動態建模:在 3D 地圖實地測試中,玩家控制角色移動並輸入文字,模型會立即完成建模,並即時動態更新場景。
代理群平行調度:在長程任務中,該模型能在 30 秒內處理複雜網頁,並立即調度 50 種不同個性的人工智慧代理並行回應,展現了新一代作業系統的原型。
核心技術深度解析:TileRT 高效能推論引擎
400 TPS 的穩定生產級吞吐量,源自智浦 GLM 團隊與 TileRT 團隊所進行的系統級優化:
推論引擎層(TileRT 編譯期 AOT 靜態調度):
傳統主流框架以運算子(operator/kernel)作為基本調度單位。在單令牌與小批次情境下,這會放大調度、記憶體存取及同步的開銷。TileRT 徹底消除執行時層面的動態調度,轉而將整個計算圖在編譯期間(AOT)靜態調度至持久的 GPU persistent Engine Kernel 。在單一 GPU 內,運算、非同步 I/O 及通訊均被分解為瓦片級微任務。整個推論過程僅啟動一個核心,中間結果直接透過寄存器、共享記憶體及 L2 快取傳輸,無需寫回全域記憶體。
調度系統層:
透過動態批次處理、請求合併及 KV 快取調度優化,大幅降低了高並發情境下的尾部延遲。
基礎架構層:
在多卡規模下,TileRT 將 Warp Specialization 概念,將其從單一 SM 擴展至整個 8 張卡的 NVL 拓撲。根據運算密度與資料依賴性,將不同的 GPU 排級專門化為不同的工作節點,並結合網路連結與負載平衡進行協同優化,確保高效能與穩定運作。
可用性與存取
GLM-5.1 高速版非常適合用於 AI 程式設計、即時互動、商業決策,以及需要極低回應延遲的即時語音應用。該服務現已於
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






