智普推出 GLM-5.1 高速版本:400 個標記/秒 創下全球 API 新紀錄

5月22日,智普(02513.HK)在資本市場與科技業界掀起軒然大波。 其股價在交易時段內飆升逾22%,使公司市值突破4,500億港元。同日,該公司為企業客戶推出了一款重要新產品:GLM-5.1 高速 API(GLM-5.1-highspeed)。
在實際測試中,該模型展現出每秒 400 個標記(400 tokens/s)的驚人速度,打破了全球主要大型模型供應商官方 API 的現行速度上限。換言之:創作者過去需要連續工作數天才能產出的文字量,現在僅需一分鐘即可完成。 一項原本需要工程師花費三天時間手動編寫的系統重構任務,現在只需喝一杯咖啡的時間就能完全執行完畢。
重點亮點:
打破常規:傳統上,業界普遍認為「快速」等同於「小巧或輕量級」。智普是國內首家成功將**「全規格旗艦級能力」與「極低延遲」**無縫結合的大型模型供應商。
硬核成就:輸出速度達 400 個標記/秒,支援長達 200K 的上下文視窗,且單次最大輸出量可達 128K 個標記。
底層黑科技:此模型由智普的 GLM 團隊與 TileRT 團隊深度合作開發,重新構建了整個系統級推論生態系統。
目標導向的試點測試:現已透過智普的 MaaS(模型即服務)開放平台,向部分企業客戶開放。
「即時回應」究竟是什麼感覺?速度敏感型情境的突破
過去一年間,國內大型模型在編碼(程式設計)與代理(智慧)協作能力方面取得了顯著進展。但「速度」始終是長鏈、高頻互動任務的核心瓶頸。 智普指出,當處理速度達到 400 個標記/秒時,大型模型從「工具」轉變為「即時夥伴」的轉變將真正發揮變革性作用:
AI 程式設計(程式設計代理):傳統的智慧代理通常需要進行數十次跨檔案呼叫,並進行長文本對齊。 單一回合的回應若延遲數秒,便可能將整個任務拖延至十多分鐘。透過高速版本,編寫程式碼的體驗彷彿以 10 倍速運行——隨著使用者輸入,函式、介面及底層呼叫鏈會即時展開,徹底消除大規模工程重構所需的任何等待時間。
即時互動與 3D 遊戲:極低的延遲使模型能夠在遊戲世界中處理即時動態生成、瞬間建構網頁使用者介面,並根據持續的使用者輸入即時變更系統狀態——所有操作皆無延遲。
商業決策叢集:在多代理平行模擬與即時大數據分析中,高速版本支援於 30 秒內完成複雜的網路代理叢集多人格平行回應,顯著提升高頻量化與模擬的效率上限。
無縫即時語音:在 AI 輔導與智慧客服情境中,超快速回應將從語音辨識(ASR)到語音合成(TTS)的延遲降至接近零,呈現真正自然、節奏一致且類人般的對話流程。
解密三層黑科技:我們如何達到 400 令牌/秒?
這項全球速度紀錄,主要歸功於智普的 GLM 團隊與 TileRT 團隊共同開發的系統級工程優化。每秒 400 個標記並非僅是炫目的「巔峰時刻」——而是穩定且可投入生產的實戰能力。其底層的優化邏輯可細分為三個層級:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推論引擎層(TileRT 深度客製化):基於 GLM-5.1 獨特的網路架構,團隊徹底重寫了最關鍵的推論路徑與底層運算子,使單張 GPU 的吞吐量與硬體執行效率逼近物理極限。
調度系統層(智慧型合併):導入極具侵略性的動態批次處理、請求合併技術,以及突破性的 KV 快取調度優化,有效解決傳統模型在高並發與多用戶請求下所面臨的尾部延遲問題。
基礎架構層(叢集協作):針對網路部署、網路鏈路拓撲以及推論叢集的超高頻率負載平衡,進行全面的硬體層級協作優化,確保運算能力在整個處理流程中無損傳遞。
產業重新評估:AI 的第二階段在於「價值與時間」的平衡
正如瑞銀(UBS)等國際頂尖分析機構在近期香港科技股論壇上所強調的,這輪由 AI 驅動的產業重新評估,與行動網路時代的「流量與時間變現」在根本上有所不同。 AI 的營收與生存哲學,不在於將用戶困在軟體中——而在於「協助用戶與企業節省時間、提升效率,並共享所創造的價值」。
智普的 GLM-5.1 高速版正是針對此痛點而設計。 透過將每個標記的生成成本與時間壓縮至原來的幾分之一,它讓企業無需再在「高智慧(選擇大型模型但速度慢)」與「速度(選擇小型模型但功能單薄)」之間進行痛苦的取捨。
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500

5月22日,智普(02513.HK)在資本市場與科技業界掀起軒然大波。 其股價在交易時段內飆升逾22%,使公司市值突破4,500億港元。同日,該公司為企業客戶推出了一款重要新產品:GLM-5.1 高速 API(GLM-5.1-highspeed)。
在實際測試中,該模型展現出每秒 400 個標記(400 tokens/s)的驚人速度,打破了全球主要大型模型供應商官方 API 的現行速度上限。換言之:創作者過去需要連續工作數天才能產出的文字量,現在僅需一分鐘即可完成。 一項原本需要工程師花費三天時間手動編寫的系統重構任務,現在只需喝一杯咖啡的時間就能完全執行完畢。
重點亮點:
打破常規:傳統上,業界普遍認為「快速」等同於「小巧或輕量級」。智普是國內首家成功將**「全規格旗艦級能力」與「極低延遲」**無縫結合的大型模型供應商。
硬核成就:輸出速度達 400 個標記/秒,支援長達 200K 的上下文視窗,且單次最大輸出量可達 128K 個標記。
底層黑科技:此模型由智普的 GLM 團隊與 TileRT 團隊深度合作開發,重新構建了整個系統級推論生態系統。
目標導向的試點測試:現已透過智普的 MaaS(模型即服務)開放平台,向部分企業客戶開放。
「即時回應」究竟是什麼感覺?速度敏感型情境的突破
過去一年間,國內大型模型在編碼(程式設計)與代理(智慧)協作能力方面取得了顯著進展。但「速度」始終是長鏈、高頻互動任務的核心瓶頸。 智普指出,當處理速度達到 400 個標記/秒時,大型模型從「工具」轉變為「即時夥伴」的轉變將真正發揮變革性作用:
AI 程式設計(程式設計代理):傳統的智慧代理通常需要進行數十次跨檔案呼叫,並進行長文本對齊。 單一回合的回應若延遲數秒,便可能將整個任務拖延至十多分鐘。透過高速版本,編寫程式碼的體驗彷彿以 10 倍速運行——隨著使用者輸入,函式、介面及底層呼叫鏈會即時展開,徹底消除大規模工程重構所需的任何等待時間。
即時互動與 3D 遊戲:極低的延遲使模型能夠在遊戲世界中處理即時動態生成、瞬間建構網頁使用者介面,並根據持續的使用者輸入即時變更系統狀態——所有操作皆無延遲。
商業決策叢集:在多代理平行模擬與即時大數據分析中,高速版本支援於 30 秒內完成複雜的網路代理叢集多人格平行回應,顯著提升高頻量化與模擬的效率上限。
無縫即時語音:在 AI 輔導與智慧客服情境中,超快速回應將從語音辨識(ASR)到語音合成(TTS)的延遲降至接近零,呈現真正自然、節奏一致且類人般的對話流程。
解密三層黑科技:我們如何達到 400 令牌/秒?
這項全球速度紀錄,主要歸功於智普的 GLM 團隊與 TileRT 團隊共同開發的系統級工程優化。每秒 400 個標記並非僅是炫目的「巔峰時刻」——而是穩定且可投入生產的實戰能力。其底層的優化邏輯可細分為三個層級:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推論引擎層(TileRT 深度客製化):基於 GLM-5.1 獨特的網路架構,團隊徹底重寫了最關鍵的推論路徑與底層運算子,使單張 GPU 的吞吐量與硬體執行效率逼近物理極限。
調度系統層(智慧型合併):導入極具侵略性的動態批次處理、請求合併技術,以及突破性的 KV 快取調度優化,有效解決傳統模型在高並發與多用戶請求下所面臨的尾部延遲問題。
基礎架構層(叢集協作):針對網路部署、網路鏈路拓撲以及推論叢集的超高頻率負載平衡,進行全面的硬體層級協作優化,確保運算能力在整個處理流程中無損傳遞。
產業重新評估:AI 的第二階段在於「價值與時間」的平衡
正如瑞銀(UBS)等國際頂尖分析機構在近期香港科技股論壇上所強調的,這輪由 AI 驅動的產業重新評估,與行動網路時代的「流量與時間變現」在根本上有所不同。 AI 的營收與生存哲學,不在於將用戶困在軟體中——而在於「協助用戶與企業節省時間、提升效率,並共享所創造的價值」。
智普的 GLM-5.1 高速版正是針對此痛點而設計。 透過將每個標記的生成成本與時間壓縮至原來的幾分之一,它讓企業無需再在「高智慧(選擇大型模型但速度慢)」與「速度(選擇小型模型但功能單薄)」之間進行痛苦的取捨。
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






