Heim
ZhiPu und TileRT bringen die Hochgeschwindigkeits-API „GLM-5.1“ mit 400 Tokens/s auf den Markt und stellen damit einen neuen Weltrekord auf
Zhipu hat heute offiziell die GLM-5.1 Highspeed-API (GLM-5.1-highspeed) für ausgewählte Unternehmenskunden eingeführt. Dieses Modell erreicht eine bemerkenswerte Ausgabegeschwindigkeit von 400 Tokens/s und übertrifft damit den aktuellen weltweiten Geschwindigkeitsrekord für APIs mit großen Modellen.
Dies stellt die seit langem in der Branche vorherrschende Überzeugung in Frage, dass „leistungsstarke Modelle mit hoher Latenz einhergehen“ oder „schnelle Modelle zwangsläufig leichtgewichtig sind“. Die GLM-5.1-Highspeed-Version ist das erste inländische Großmodell, das in der Produktion erstklassige Modellfähigkeiten und extrem niedrige Latenzzeit vereint, sodass Nutzer nicht mehr gezwungen sind, Modellqualität zugunsten der Geschwindigkeit einzubüßen.

Neugestaltung der Benutzererfahrung für geschwindigkeitskritische Szenarien
Bei langfristigen Aufgaben und in komplexen Produktionsumgebungen hat die Geschwindigkeitssteigerung die Art und Weise, wie Produkte entwickelt werden, grundlegend verändert:
KI-Programmierung (Coding Agent): Das neue Modell nutzt die leistungsstarken Fähigkeiten von GLM-5.1 und liefert sofortige Antworten auf Anfragen. Es versteht den technischen Kontext, während es kontinuierlich Code generiert und Lösungen verfeinert. Bei Rekonstruktionsprojekten, die Dutzende von Aufrufen erfordern, entfällt die kumulierte Wartezeit von mehreren Minuten.
Dynamische Modellierung in Echtzeit: Bei Feldtests mit 3D-Karten steuern Spieler die Bewegung eines Charakters und geben Text ein, woraufhin das Modell die Modellierung sofort abschließt und die Szene dynamisch in Echtzeit aktualisiert.
Parallele Planung eines Agentenschwarms: Bei langwierigen Aufgaben verarbeitet das Modell komplexe Webseiten innerhalb von 30 Sekunden und plant sofort 50 verschiedene Persönlichkeiten so ein, dass sie parallel antworten – ein Prototyp eines neuen Betriebssystems.
Ein tiefer Einblick in die Kerntechnologie: Die hochleistungsfähige Inferenz-Engine von TileRT
Der stabile Durchsatz auf Produktionsniveau von 400 TPS ist das Ergebnis von Optimierungen auf Systemebene, die vom Zhipu-GLM-Team und dem TileRT-Team durchgeführt wurden:
Inferenz-Engine-Ebene (TileRT-Kompilierungsphase, AOT-Statische Planung):
Herkömmliche Mainstream-Frameworks verwenden Operatoren (Operator/Kernel) als grundlegende Scheduling-Einheit. In Szenarien mit einzelnen Tokens und kleinen Batches verstärkt dies den Overhead bei der Planung, beim Speicherzugriff und bei der Synchronisation. TileRT eliminiert das dynamische Scheduling auf der Laufzeitebene vollständig und plant stattdessen den gesamten Berechnungsgraphen statisch in eine persistente GPU persistent Engine Kernel wird. Innerhalb einer einzelnen GPU werden Berechnung, asynchrone E/A und Kommunikation in Mikrotasks auf Tile-Ebene zerlegt. Der gesamte Inferenzprozess startet nur einen Kernel, wobei Zwischenergebnisse direkt über Register, Shared Memory und den L2-Cache übertragen werden, ohne in den globalen Speicher zurückgeschrieben zu werden.
Planungssystemebene:
Durch dynamisches Batching, das Zusammenführen von Anfragen und die Optimierung der KV-Cache-Planung wird die Tail-Latenz in Szenarien mit hoher Parallelität deutlich reduziert.
Infrastruktur-Ebene:
Im Multi-Karten-Maßstab erweitert TileRT das Konzept Warp Specialization innerhalb eines einzelnen SM auf die gesamte 8-Karten-NVL-Topologie aus. Verschiedene GPU-Ranks werden basierend auf Rechendichte und Datenabhängigkeiten auf unterschiedliche Worker spezialisiert und mit Netzwerkverbindungen sowie Lastenausgleich für eine kollaborative Optimierung kombiniert, wodurch ein leistungsstarker und stabiler Betrieb gewährleistet wird.
Verfügbarkeit und Zugriff
Die GLM-5.1-Highspeed-Version eignet sich ideal für KI-Programmierung, Echtzeit-Interaktion, geschäftliche Entscheidungsfindung und Echtzeit-Sprachanwendungen, die extrem niedrige Antwortlatenzen erfordern. Der Dienst ist nun offiziell auf der Zhipu MaaS-Plattform verfügbar und steht ausgewählten Unternehmenskunden offen.
Verwandter Artikel
ByteDances Seed startet globale Campus-Werbung und bietet virtuelle Aktien, um Top-Talente für große Modelle zu gewinnen
Im wettbewerbsintensiven Umfeld der großen Sprachmodelle bleibt die Sicherung erstklassiger Talente das wichtigste strategische Asset.Am 1. April ByteDance gab die Einführung seiner globalen Campus-Rekrutierungsinitiative Seed bekannt, die Teil seine
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Zhipu hat heute offiziell die
Dies stellt die seit langem in der Branche vorherrschende Überzeugung in Frage, dass „leistungsstarke Modelle mit hoher Latenz einhergehen“ oder „schnelle Modelle zwangsläufig leichtgewichtig sind“. Die GLM-5.1-Highspeed-Version ist das erste inländische Großmodell, das in der Produktion erstklassige Modellfähigkeiten und extrem niedrige Latenzzeit vereint, sodass Nutzer nicht mehr gezwungen sind, Modellqualität zugunsten der Geschwindigkeit einzubüßen.

Neugestaltung der Benutzererfahrung für geschwindigkeitskritische Szenarien
Bei langfristigen Aufgaben und in komplexen Produktionsumgebungen hat die Geschwindigkeitssteigerung die Art und Weise, wie Produkte entwickelt werden, grundlegend verändert:
KI-Programmierung (Coding Agent): Das neue Modell nutzt die leistungsstarken Fähigkeiten von GLM-5.1 und liefert sofortige Antworten auf Anfragen. Es versteht den technischen Kontext, während es kontinuierlich Code generiert und Lösungen verfeinert. Bei Rekonstruktionsprojekten, die Dutzende von Aufrufen erfordern, entfällt die kumulierte Wartezeit von mehreren Minuten.
Dynamische Modellierung in Echtzeit: Bei Feldtests mit 3D-Karten steuern Spieler die Bewegung eines Charakters und geben Text ein, woraufhin das Modell die Modellierung sofort abschließt und die Szene dynamisch in Echtzeit aktualisiert.
Parallele Planung eines Agentenschwarms: Bei langwierigen Aufgaben verarbeitet das Modell komplexe Webseiten innerhalb von 30 Sekunden und plant sofort 50 verschiedene Persönlichkeiten so ein, dass sie parallel antworten – ein Prototyp eines neuen Betriebssystems.
Ein tiefer Einblick in die Kerntechnologie: Die hochleistungsfähige Inferenz-Engine von TileRT
Der stabile Durchsatz auf Produktionsniveau von 400 TPS ist das Ergebnis von Optimierungen auf Systemebene, die vom Zhipu-GLM-Team und dem TileRT-Team durchgeführt wurden:
Inferenz-Engine-Ebene (TileRT-Kompilierungsphase, AOT-Statische Planung):
Herkömmliche Mainstream-Frameworks verwenden Operatoren (Operator/Kernel) als grundlegende Scheduling-Einheit. In Szenarien mit einzelnen Tokens und kleinen Batches verstärkt dies den Overhead bei der Planung, beim Speicherzugriff und bei der Synchronisation. TileRT eliminiert das dynamische Scheduling auf der Laufzeitebene vollständig und plant stattdessen den gesamten Berechnungsgraphen statisch in eine persistente GPU persistent Engine Kernel wird. Innerhalb einer einzelnen GPU werden Berechnung, asynchrone E/A und Kommunikation in Mikrotasks auf Tile-Ebene zerlegt. Der gesamte Inferenzprozess startet nur einen Kernel, wobei Zwischenergebnisse direkt über Register, Shared Memory und den L2-Cache übertragen werden, ohne in den globalen Speicher zurückgeschrieben zu werden.
Planungssystemebene:
Durch dynamisches Batching, das Zusammenführen von Anfragen und die Optimierung der KV-Cache-Planung wird die Tail-Latenz in Szenarien mit hoher Parallelität deutlich reduziert.
Infrastruktur-Ebene:
Im Multi-Karten-Maßstab erweitert TileRT das Konzept Warp Specialization innerhalb eines einzelnen SM auf die gesamte 8-Karten-NVL-Topologie aus. Verschiedene GPU-Ranks werden basierend auf Rechendichte und Datenabhängigkeiten auf unterschiedliche Worker spezialisiert und mit Netzwerkverbindungen sowie Lastenausgleich für eine kollaborative Optimierung kombiniert, wodurch ein leistungsstarker und stabiler Betrieb gewährleistet wird.
Verfügbarkeit und Zugriff
Die GLM-5.1-Highspeed-Version eignet sich ideal für KI-Programmierung, Echtzeit-Interaktion, geschäftliche Entscheidungsfindung und Echtzeit-Sprachanwendungen, die extrem niedrige Antwortlatenzen erfordern. Der Dienst ist nun offiziell auf der
ByteDances Seed startet globale Campus-Werbung und bietet virtuelle Aktien, um Top-Talente für große Modelle zu gewinnen
Im wettbewerbsintensiven Umfeld der großen Sprachmodelle bleibt die Sicherung erstklassiger Talente das wichtigste strategische Asset.Am 1. April ByteDance gab die Einführung seiner globalen Campus-Rekrutierungsinitiative Seed bekannt, die Teil seine
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc











