ZhiPuとTileRTが、400トークン/秒のGLM-5.1高速APIをリリースし、世界新記録を樹立
Zhipuは本日、一部の法人顧客向けに「GLM-5.1 Highspeed API(GLM-5.1-highspeed) 」を正式にリリースしました。このモデルは、400トークン/秒という驚異的な出力速度を達成し、大規模モデルAPIにおける現在の世界最速記録を更新しました。
これは、「高性能なモデルには高いレイテンシが伴う」あるいは「高速なモデルは必然的に軽量である」という、業界で長らく信じられてきた通説に異を唱えるものです。 GLM-5.1 Highspeed版は、国内初となる、本番環境において優れたモデル性能と超低レイテンシを両立させた大規模モデルであり、ユーザーはもはやモデルの品質と速度のトレードオフを強いられる必要がなくなりました。

速度が重要なシナリオにおけるユーザー体験の変革
長期にわたるタスクや複雑な本番環境において、この速度向上は製品の設計方法を根本的に変えました:
AIプログラミング(コーディングエージェント):GLM-5.1の強力な機能を活用し、この新モデルはクエリに対して即座に回答を提供します。エンジニアリングの文脈を理解しつつ、継続的にコードを生成し、ソリューションを洗練させます。数十回の呼び出しを必要とする再構築プロジェクトにおいて、数分に及ぶ累積待ち時間を解消します。
リアルタイム動的モデリング:3Dマップのフィールドテストにおいて、プレイヤーがキャラクターの移動を制御しテキストを入力すると、モデルは即座にモデリングを完了し、シーンをリアルタイムで動的に更新します。
エージェント・スウォーム並列スケジューリング:長時間のタスクにおいて、本モデルは複雑なウェブページを30秒以内に処理し、50種類の異なるパーソナリティを即座に並列で回答させるようスケジューリングを行い、新しいオペレーティングシステムのプロトタイプを実証します。
中核技術の詳細解説:TileRT 高性能推論エンジン
400 TPSという安定した実運用レベルのスループットは、Zhipu GLMチームとTileRTチームによるシステムレベルの最適化によって実現されました:
推論エンジン層(TileRT コンパイル時 AOT 静的スケジューリング):
従来の主流フレームワークでは、演算子(オペレーター/カーネル)を基本的なスケジューリング単位として使用しています。単一トークンや小バッチのシナリオでは、これによりスケジューリング、メモリアクセス、および同期のオーバーヘッドが増大します。TileRTは、実行時レイヤーでの動的スケジューリングを完全に排除し、代わりにコンパイル時(AOT)に計算グラフ全体を永続的なGPU persistent Engine Kernel に静的にスケジューリングします。単一のGPU内では、演算、非同期I/O、および通信がタイルレベルのマイクロタスクに分解されます。推論プロセス全体で起動されるカーネルは1つだけであり、中間結果はグローバルメモリへの書き込みを伴わずに、レジスタ、共有メモリ、およびL2キャッシュを介して直接伝達されます。
スケジューリングシステム層:
動的なバッチ処理、リクエストの統合、およびKVキャッシュのスケジューリング最適化により、高並行性シナリオにおけるテールレイテンシが大幅に低減されます。
インフラストラクチャ層:
マルチカード規模において、TileRTは Warp Specialization 単一のSM内での概念を、8枚のカードからなるNVLトポロジー全体へと拡張します。異なるGPUランクは、計算密度とデータ依存性に基づいて異なるワーカーに特化され、ネットワークリンクや負荷分散と組み合わせて協調的な最適化を行うことで、高性能かつ安定した動作を保証します。
利用可能性とアクセス
GLM-5.1 Highspeedバージョンは、AIプログラミング、リアルタイムインタラクション、ビジネス上の意思決定、および極めて低い応答レイテンシが求められるリアルタイム音声アプリケーションに最適です。本サービスは現在、Zhipu MaaSプラットフォーム 上で正式に提供されており、選定された企業顧客向けに公開されています 。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
Zhipuは本日、一部の法人顧客向けに「
これは、「高性能なモデルには高いレイテンシが伴う」あるいは「高速なモデルは必然的に軽量である」という、業界で長らく信じられてきた通説に異を唱えるものです。 GLM-5.1 Highspeed版は、国内初となる、本番環境において優れたモデル性能と超低レイテンシを両立させた大規模モデルであり、ユーザーはもはやモデルの品質と速度のトレードオフを強いられる必要がなくなりました。

速度が重要なシナリオにおけるユーザー体験の変革
長期にわたるタスクや複雑な本番環境において、この速度向上は製品の設計方法を根本的に変えました:
AIプログラミング(コーディングエージェント):GLM-5.1の強力な機能を活用し、この新モデルはクエリに対して即座に回答を提供します。エンジニアリングの文脈を理解しつつ、継続的にコードを生成し、ソリューションを洗練させます。数十回の呼び出しを必要とする再構築プロジェクトにおいて、数分に及ぶ累積待ち時間を解消します。
リアルタイム動的モデリング:3Dマップのフィールドテストにおいて、プレイヤーがキャラクターの移動を制御しテキストを入力すると、モデルは即座にモデリングを完了し、シーンをリアルタイムで動的に更新します。
エージェント・スウォーム並列スケジューリング:長時間のタスクにおいて、本モデルは複雑なウェブページを30秒以内に処理し、50種類の異なるパーソナリティを即座に並列で回答させるようスケジューリングを行い、新しいオペレーティングシステムのプロトタイプを実証します。
中核技術の詳細解説:TileRT 高性能推論エンジン
400 TPSという安定した実運用レベルのスループットは、Zhipu GLMチームとTileRTチームによるシステムレベルの最適化によって実現されました:
推論エンジン層(TileRT コンパイル時 AOT 静的スケジューリング):
従来の主流フレームワークでは、演算子(オペレーター/カーネル)を基本的なスケジューリング単位として使用しています。単一トークンや小バッチのシナリオでは、これによりスケジューリング、メモリアクセス、および同期のオーバーヘッドが増大します。TileRTは、実行時レイヤーでの動的スケジューリングを完全に排除し、代わりにコンパイル時(AOT)に計算グラフ全体を永続的なGPU persistent Engine Kernel に静的にスケジューリングします。単一のGPU内では、演算、非同期I/O、および通信がタイルレベルのマイクロタスクに分解されます。推論プロセス全体で起動されるカーネルは1つだけであり、中間結果はグローバルメモリへの書き込みを伴わずに、レジスタ、共有メモリ、およびL2キャッシュを介して直接伝達されます。
スケジューリングシステム層:
動的なバッチ処理、リクエストの統合、およびKVキャッシュのスケジューリング最適化により、高並行性シナリオにおけるテールレイテンシが大幅に低減されます。
インフラストラクチャ層:
マルチカード規模において、TileRTは Warp Specialization 単一のSM内での概念を、8枚のカードからなるNVLトポロジー全体へと拡張します。異なるGPUランクは、計算密度とデータ依存性に基づいて異なるワーカーに特化され、ネットワークリンクや負荷分散と組み合わせて協調的な最適化を行うことで、高性能かつ安定した動作を保証します。
利用可能性とアクセス
GLM-5.1 Highspeedバージョンは、AIプログラミング、リアルタイムインタラクション、ビジネス上の意思決定、および極めて低い応答レイテンシが求められるリアルタイム音声アプリケーションに最適です。本サービスは現在
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






