Heim
Das weltweit erste auf Ereignisebene basierende Weltmodell für verkörperte Intelligenz macht dem frameweisen Lernen für Roboter ein Ende
Am 29. Mai stellte das Team von Variable Robot WALL-WM vor, das weltweit erste Weltmodell mit verkörperter Intelligenz, das auf „Vorhersagen auf Ereignisebene“ basiert. Dieses Modell löst sich von herkömmlichen großen Modellen der verkörperten Intelligenz, die Aktionen im Laufe der Zeit Frame für Frame lernen, und verlagert stattdessen die Vorhersageeinheit des Weltmodells auf semantische Ereignisse. Es markiert eine neue Etappe in der Art und Weise, wie Roboter Aufgaben verstehen und ausführen.

In der aktuellen Branche der verkörperten Intelligenz verwenden gängige Vision-Language-Action-Modelle (VLA) in der Regel ein aktuelles Bild und eine Anweisung, um einen Aktionsblock fester Länge vorherzusagen. Dieser Frame-für-Frame-Trainingsansatz führt oft dazu, dass sich Roboter auf kleine körperliche Bewegungen konzentrieren und dabei das eigentliche Ziel der Aktion aus den Augen verlieren. In Szenarien wie dem Wechseln von Tassen oder Tischen scheitern Roboter häufig aufgrund mangelnder Generalisierungsfähigkeit. Um diesen Schwachpunkt der Branche anzugehen, wies das Variable-Team in seiner wissenschaftlichen Arbeit darauf hin, dass Text-, Bild- und Handlungsinformationen in der realen Welt naturgemäß auf unterschiedlichen Zeitskalen und in vielfältigen Geometrien existieren. Werden diese in einen einzigen gemeinsamen Raum gezwängt, kann dies leicht die vortrainierte geometrische Priorität beeinträchtigen.
Um diese Herausforderung zu bewältigen, führt das WALL-WM-Weltmodell einen innovativen ereigniszentrierten Trainings- und Ausführungsmechanismus ein. Es zerlegt komplexe Aufgaben in semantisch klare Ereignisverbindungen wie Greifen, Ergreifen und Bewegen. Im Betrieb berechnet das Modell den nächsten Bildframe nicht mehr starr. Stattdessen simuliert es zunächst, wie sich die Welt durch das nächste Ereignis verändern wird, und übersetzt diese visuelle Veränderung dann präzise in die Bewegungsbahn des Roboterarms.

Um sicherzustellen, dass diese neue Architektur zuverlässig in der physischen Welt eingesetzt werden kann, führte das Variable-Robot-Team eine Reihe umfassender technischer Überarbeitungen durch. Das System unterstützt den flexiblen Wechsel zwischen dem „Ereignismodus“ (mit Aktionsausgabe variabler Länge) und dem „Unified-Modus“ (mit Echtzeit-Regelung) auf Basis derselben Grundgewichte. Außerdem erreicht es eine Einwegkopplung zwischen Videomodellen und Aktionsmodellen, wodurch verhindert wird, dass wertvolle dynamische Vorinformationen aus Internetvideos vorzeitig durch Aktionsdaten verzerrt werden. Für die geometrische Wahrnehmung über mehrere Kameras hinweg führt das Modell Frustum-Masken und röhrenförmige Masken ein, wodurch die KI gezwungen wird, eine sichtfeldübergreifende, echte dreidimensionale geometrische Entsprechung zu entwickeln. Um die Entscheidungslatenz zu verringern, wird eine neue „Stepped Chain-of-Thought Decoding“-Technik eingesetzt, die die Dekodierungsverzögerung deutlich reduziert und gleichzeitig die logische Interpretierbarkeit gewährleistet.

Verwandter Artikel
ByteDance erhöht die Kern-KI-Anreize, während Doubao um 14,6 % steigt
ByteDance hat kürzlich ein Equity-Briefing für DouBao abgehalten, um neue Anreizrichtlinien für Mitarbeiter der DouBao-Sparte vorzustellen. Der Ausübungspreis für DouBao-Anteile wurde von 14,85 US-Dollar im Juni 2026 auf 17,02 US-Dollar angehoben, wa
MiniMax stellt 10x-Teamprogramm vor, um globale KI-Experten zu motivieren
MiniMax (Xiyu Technology), das General Artificial Intelligence Lab, hat offiziell „10x Team“ gestartet, eine globale Initiative zur Talentsuche und Zusammenarbeit. Dieses Programm zielt darauf ab, führende Experten aus verschiedenen Branchen zu rekru
Südkorea beginnt mit dem Bau des nationalen KI-Rechenzentrums und investiert 2,5 Billionen Won mit einem Zieljahr von 2028
Der südkoreanische Ableger von EtNews berichtet, dass am 3. August im Solar City-Datenzentrumspark in Sunan, Provinz Jeollanam-do, der Grundstein für das Korea AI Computing Center (KOACC) gelegt wurde. Mit einer Gesamtinvestition von 2,5 Billionen KR
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
Am 29. Mai stellte das Team von Variable Robot WALL-WM vor, das weltweit erste Weltmodell mit verkörperter Intelligenz, das auf „Vorhersagen auf Ereignisebene“ basiert. Dieses Modell löst sich von herkömmlichen großen Modellen der verkörperten Intelligenz, die Aktionen im Laufe der Zeit Frame für Frame lernen, und verlagert stattdessen die Vorhersageeinheit des Weltmodells auf semantische Ereignisse. Es markiert eine neue Etappe in der Art und Weise, wie Roboter Aufgaben verstehen und ausführen.

In der aktuellen Branche der verkörperten Intelligenz verwenden gängige Vision-Language-Action-Modelle (VLA) in der Regel ein aktuelles Bild und eine Anweisung, um einen Aktionsblock fester Länge vorherzusagen. Dieser Frame-für-Frame-Trainingsansatz führt oft dazu, dass sich Roboter auf kleine körperliche Bewegungen konzentrieren und dabei das eigentliche Ziel der Aktion aus den Augen verlieren. In Szenarien wie dem Wechseln von Tassen oder Tischen scheitern Roboter häufig aufgrund mangelnder Generalisierungsfähigkeit. Um diesen Schwachpunkt der Branche anzugehen, wies das Variable-Team in seiner wissenschaftlichen Arbeit darauf hin, dass Text-, Bild- und Handlungsinformationen in der realen Welt naturgemäß auf unterschiedlichen Zeitskalen und in vielfältigen Geometrien existieren. Werden diese in einen einzigen gemeinsamen Raum gezwängt, kann dies leicht die vortrainierte geometrische Priorität beeinträchtigen.
Um diese Herausforderung zu bewältigen, führt das WALL-WM-Weltmodell einen innovativen ereigniszentrierten Trainings- und Ausführungsmechanismus ein. Es zerlegt komplexe Aufgaben in semantisch klare Ereignisverbindungen wie Greifen, Ergreifen und Bewegen. Im Betrieb berechnet das Modell den nächsten Bildframe nicht mehr starr. Stattdessen simuliert es zunächst, wie sich die Welt durch das nächste Ereignis verändern wird, und übersetzt diese visuelle Veränderung dann präzise in die Bewegungsbahn des Roboterarms.

Um sicherzustellen, dass diese neue Architektur zuverlässig in der physischen Welt eingesetzt werden kann, führte das Variable-Robot-Team eine Reihe umfassender technischer Überarbeitungen durch. Das System unterstützt den flexiblen Wechsel zwischen dem „Ereignismodus“ (mit Aktionsausgabe variabler Länge) und dem „Unified-Modus“ (mit Echtzeit-Regelung) auf Basis derselben Grundgewichte. Außerdem erreicht es eine Einwegkopplung zwischen Videomodellen und Aktionsmodellen, wodurch verhindert wird, dass wertvolle dynamische Vorinformationen aus Internetvideos vorzeitig durch Aktionsdaten verzerrt werden. Für die geometrische Wahrnehmung über mehrere Kameras hinweg führt das Modell Frustum-Masken und röhrenförmige Masken ein, wodurch die KI gezwungen wird, eine sichtfeldübergreifende, echte dreidimensionale geometrische Entsprechung zu entwickeln. Um die Entscheidungslatenz zu verringern, wird eine neue „Stepped Chain-of-Thought Decoding“-Technik eingesetzt, die die Dekodierungsverzögerung deutlich reduziert und gleichzeitig die logische Interpretierbarkeit gewährleistet.

ByteDance erhöht die Kern-KI-Anreize, während Doubao um 14,6 % steigt
ByteDance hat kürzlich ein Equity-Briefing für DouBao abgehalten, um neue Anreizrichtlinien für Mitarbeiter der DouBao-Sparte vorzustellen. Der Ausübungspreis für DouBao-Anteile wurde von 14,85 US-Dollar im Juni 2026 auf 17,02 US-Dollar angehoben, wa
MiniMax stellt 10x-Teamprogramm vor, um globale KI-Experten zu motivieren
MiniMax (Xiyu Technology), das General Artificial Intelligence Lab, hat offiziell „10x Team“ gestartet, eine globale Initiative zur Talentsuche und Zusammenarbeit. Dieses Programm zielt darauf ab, führende Experten aus verschiedenen Branchen zu rekru
Südkorea beginnt mit dem Bau des nationalen KI-Rechenzentrums und investiert 2,5 Billionen Won mit einem Zieljahr von 2028
Der südkoreanische Ableger von EtNews berichtet, dass am 3. August im Solar City-Datenzentrumspark in Sunan, Provinz Jeollanam-do, der Grundstein für das Korea AI Computing Center (KOACC) gelegt wurde. Mit einer Gesamtinvestition von 2,5 Billionen KR
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











