ZhipuがGLM-5.1スピードバージョンを発表:400トークン/秒で世界の新API記録を樹立

5月22日、Zhipu(02513.HK)は資本市場とテクノロジー業界の両方で大きな話題を呼んだ。 同社の株価は取引時間中に22%以上急騰し、時価総額は4,500億香港ドルを突破した。同日、同社は企業顧客向けの主要新製品「GLM-5.1 Highspeed API(GLM-5.1-highspeed)」を発表した。
実環境でのテストにおいて、このモデルは400トークン/秒(400 tokens per second)という驚異的な処理速度を実現し、世界の主要な大規模モデルプロバイダーが提供する公式APIの現行の速度上限を打ち破りました。これを具体的に説明すると、クリエイターが数日間休みなく作業しても生成しきれなかった量のテキストが、今ではわずか1分で完了できるようになったということです。 エンジニアが3日間かけて手入力で作業していたシステム再設計のタスクも、コーヒー1杯を飲む間に完全に実行できるようになりました。
主な特長:
常識の打破:従来、業界では「高速」といえば「小型または軽量」であることを意味すると考えられてきました。Zhipuは、**「フルスケールのフラッグシップ機能」と「極めて低いレイテンシ」**をシームレスに融合させた、国内初の大規模モデルプロバイダーです。
驚異的な成果:出力速度は400トークン/秒に達し、20万トークンの長いコンテキストウィンドウに対応し、最大12万8千トークンの単一出力が可能です。
基盤となるブラックテクノロジー:ZhipuのGLMチームとTileRTチームの緊密な連携により開発されたこのモデルは、システムレベルの推論エコシステム全体を再構築します。
対象を絞ったパイロットテスト:現在、ZhipuのMaaS(Model as a Service)オープンプラットフォームを通じて、選定された企業顧客向けに提供されています。
「瞬時の応答」とは実際にどのようなものか? 速度が重要なシナリオにおける画期的な進歩
この1年間で、国内の大型モデルにおけるコーディング(プログラミング)とエージェント(知能)の連携機能は飛躍的な進歩を遂げました。しかし、「速度」は、長チェーンかつ高頻度のインタラクションタスクにおける中核的なボトルネックであり続けています。 Zhipuは、大規模モデルが「ツール」から「リアルタイムのパートナー」へと移行する変革が、400トークン/秒の処理速度で真に実現されると指摘しています:
AIプログラミング(コーディングエージェント):従来のインテリジェントエージェントでは、多くの場合、数十回のファイル間呼び出しや長文の整合処理が必要となる。 たった1回の応答に数秒の遅れが生じるだけで、タスク全体が10分以上に及ぶことがあります。高速版では、コードを書くことがまるで10倍の速度で走っているかのように感じられます。ユーザーがタイプするにつれて、関数、インターフェース、そして基盤となる呼び出しチェーンが瞬時に展開され、大規模なエンジニアリングのやり直しに伴う待ち時間が一切なくなります。
リアルタイムインタラクションと3Dゲーム:極めて低いレイテンシにより、モデルはゲームワールド内でのリアルタイムな動的生成、Web UIの瞬時構築、継続的なユーザー入力に基づく即時のシステム状態変更を、すべてラグなく処理できます。
ビジネス意思決定クラスター:マルチエージェント並列シミュレーションやリアルタイムビッグデータ分析において、高速版は複雑なWebエージェントクラスターによる多人格並列応答を30秒以内に完了することをサポートし、高頻度の定量化およびシミュレーションにおける効率の限界を大幅に引き上げます。
シームレスなリアルタイム音声:AIコーチングやスマートカスタマーサービスのシナリオにおいて、超高速な応答により、音声認識(ASR)から音声合成(TTS)までの遅延をほぼゼロに抑え、真に自然で、ペースの揃った人間のような会話の流れを実現します。
「ブラックテクノロジー」の3つの層を解き明かす:いかにして400トークン/秒を達成したのか?
この世界速度記録は、主にZhipuのGLMチームとTileRTチームが共同で開発したシステムレベルのエンジニアリング最適化によるものです。400トークン/秒という数値は、単なる派手な「ピーク時の記録」ではなく、安定しており、実運用に耐えうる能力です。その根底にある最適化ロジックは、以下の3つの層に分けられます:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推論エンジン層(TileRTの高度なカスタマイズ):GLM-5.1独自のネットワークアーキテクチャに基づき、チームは最も重要な推論パスと基盤となる演算子を完全に書き直しました。これにより、単一GPUのスループットとハードウェア実行効率を物理的限界に近づけることが可能になりました。
スケジューリングシステム層(インテリジェントなマージ):極めて積極的な動的バッチ処理、リクエストマージ技術、そして画期的なKVキャッシュスケジューリング最適化を導入し、高い同時実行数や複数のユーザーリクエスト下で従来のモデルが直面するテールレイテンシの問題を効果的に解決しました。
インフラストラクチャ層(クラスタ連携):ネットワーク展開、ネットワークリンクトポロジー、および推論クラスタの超高頻度ロードバランシングに関する包括的なハードウェアレベルの連携最適化により、パイプライン全体を通じて計算能力が損失なく伝達されることを保証します。
業界の再評価:AIの後半戦は「価値と時間」の決着
UBSなどの国際的な主要分析機関が最近の香港株式テクノロジーフォーラムで強調したように、今回のAI主導による業界の再評価は、モバイルインターネット時代の「トラフィックと時間の収益化」とは根本的に異なります。 AIの収益化と存続の哲学は、ユーザーをソフトウェアに閉じ込めることではなく、「ユーザーや企業が時間を節約し、効率を向上させ、創出された価値を共有できるよう支援すること」にある。
ZhipuのGLM-5.1高速版は、まさにこの課題に直接対処するものだ。 各トークンの生成にかかるコストと時間を従来の数分の1に圧縮することで、企業は「高い知能(大規模モデルだが処理が遅い)」と「速度(小規模モデルだが処理能力が低い)」の間で苦渋のトレードオフを迫られる状況から脱却できる。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500

5月22日、Zhipu(02513.HK)は資本市場とテクノロジー業界の両方で大きな話題を呼んだ。 同社の株価は取引時間中に22%以上急騰し、時価総額は4,500億香港ドルを突破した。同日、同社は企業顧客向けの主要新製品「GLM-5.1 Highspeed API(GLM-5.1-highspeed)」を発表した。
実環境でのテストにおいて、このモデルは400トークン/秒(400 tokens per second)という驚異的な処理速度を実現し、世界の主要な大規模モデルプロバイダーが提供する公式APIの現行の速度上限を打ち破りました。これを具体的に説明すると、クリエイターが数日間休みなく作業しても生成しきれなかった量のテキストが、今ではわずか1分で完了できるようになったということです。 エンジニアが3日間かけて手入力で作業していたシステム再設計のタスクも、コーヒー1杯を飲む間に完全に実行できるようになりました。
主な特長:
常識の打破:従来、業界では「高速」といえば「小型または軽量」であることを意味すると考えられてきました。Zhipuは、**「フルスケールのフラッグシップ機能」と「極めて低いレイテンシ」**をシームレスに融合させた、国内初の大規模モデルプロバイダーです。
驚異的な成果:出力速度は400トークン/秒に達し、20万トークンの長いコンテキストウィンドウに対応し、最大12万8千トークンの単一出力が可能です。
基盤となるブラックテクノロジー:ZhipuのGLMチームとTileRTチームの緊密な連携により開発されたこのモデルは、システムレベルの推論エコシステム全体を再構築します。
対象を絞ったパイロットテスト:現在、ZhipuのMaaS(Model as a Service)オープンプラットフォームを通じて、選定された企業顧客向けに提供されています。
「瞬時の応答」とは実際にどのようなものか? 速度が重要なシナリオにおける画期的な進歩
この1年間で、国内の大型モデルにおけるコーディング(プログラミング)とエージェント(知能)の連携機能は飛躍的な進歩を遂げました。しかし、「速度」は、長チェーンかつ高頻度のインタラクションタスクにおける中核的なボトルネックであり続けています。 Zhipuは、大規模モデルが「ツール」から「リアルタイムのパートナー」へと移行する変革が、400トークン/秒の処理速度で真に実現されると指摘しています:
AIプログラミング(コーディングエージェント):従来のインテリジェントエージェントでは、多くの場合、数十回のファイル間呼び出しや長文の整合処理が必要となる。 たった1回の応答に数秒の遅れが生じるだけで、タスク全体が10分以上に及ぶことがあります。高速版では、コードを書くことがまるで10倍の速度で走っているかのように感じられます。ユーザーがタイプするにつれて、関数、インターフェース、そして基盤となる呼び出しチェーンが瞬時に展開され、大規模なエンジニアリングのやり直しに伴う待ち時間が一切なくなります。
リアルタイムインタラクションと3Dゲーム:極めて低いレイテンシにより、モデルはゲームワールド内でのリアルタイムな動的生成、Web UIの瞬時構築、継続的なユーザー入力に基づく即時のシステム状態変更を、すべてラグなく処理できます。
ビジネス意思決定クラスター:マルチエージェント並列シミュレーションやリアルタイムビッグデータ分析において、高速版は複雑なWebエージェントクラスターによる多人格並列応答を30秒以内に完了することをサポートし、高頻度の定量化およびシミュレーションにおける効率の限界を大幅に引き上げます。
シームレスなリアルタイム音声:AIコーチングやスマートカスタマーサービスのシナリオにおいて、超高速な応答により、音声認識(ASR)から音声合成(TTS)までの遅延をほぼゼロに抑え、真に自然で、ペースの揃った人間のような会話の流れを実現します。
「ブラックテクノロジー」の3つの層を解き明かす:いかにして400トークン/秒を達成したのか?
この世界速度記録は、主にZhipuのGLMチームとTileRTチームが共同で開発したシステムレベルのエンジニアリング最適化によるものです。400トークン/秒という数値は、単なる派手な「ピーク時の記録」ではなく、安定しており、実運用に耐えうる能力です。その根底にある最適化ロジックは、以下の3つの層に分けられます:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
推論エンジン層(TileRTの高度なカスタマイズ):GLM-5.1独自のネットワークアーキテクチャに基づき、チームは最も重要な推論パスと基盤となる演算子を完全に書き直しました。これにより、単一GPUのスループットとハードウェア実行効率を物理的限界に近づけることが可能になりました。
スケジューリングシステム層(インテリジェントなマージ):極めて積極的な動的バッチ処理、リクエストマージ技術、そして画期的なKVキャッシュスケジューリング最適化を導入し、高い同時実行数や複数のユーザーリクエスト下で従来のモデルが直面するテールレイテンシの問題を効果的に解決しました。
インフラストラクチャ層(クラスタ連携):ネットワーク展開、ネットワークリンクトポロジー、および推論クラスタの超高頻度ロードバランシングに関する包括的なハードウェアレベルの連携最適化により、パイプライン全体を通じて計算能力が損失なく伝達されることを保証します。
業界の再評価:AIの後半戦は「価値と時間」の決着
UBSなどの国際的な主要分析機関が最近の香港株式テクノロジーフォーラムで強調したように、今回のAI主導による業界の再評価は、モバイルインターネット時代の「トラフィックと時間の収益化」とは根本的に異なります。 AIの収益化と存続の哲学は、ユーザーをソフトウェアに閉じ込めることではなく、「ユーザーや企業が時間を節約し、効率を向上させ、創出された価値を共有できるよう支援すること」にある。
ZhipuのGLM-5.1高速版は、まさにこの課題に直接対処するものだ。 各トークンの生成にかかるコストと時間を従来の数分の1に圧縮することで、企業は「高い知能(大規模モデルだが処理が遅い)」と「速度(小規模モデルだが処理能力が低い)」の間で苦渋のトレードオフを迫られる状況から脱却できる。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






