Maison
Le premier modèle mondial d'intelligence incarnée au niveau des événements met fin à l'apprentissage image par image pour les robots
Le 29 mai, l'équipe de Variable Robot a dévoilé WALL-WM, le premier modèle du monde doté d'une intelligence incarnée au monde, fondé sur la « prédiction au niveau des événements ». Ce modèle s'affranchit des grands modèles incarnés conventionnels qui apprennent les actions image par image au fil du temps, en orientant plutôt l'unité de prédiction du modèle du monde vers des événements sémantiques. Il marque une nouvelle étape dans la manière dont les robots comprennent et exécutent les tâches.

Dans le secteur actuel de l’intelligence incarnée, les modèles VLA (vision-langage-action) dominants utilisent généralement une image et une instruction du moment pour prédire un bloc d’action de longueur fixe. Cette approche d’entraînement image par image conduit souvent les robots à se concentrer sur des mouvements physiques mineurs tout en perdant de vue l’objectif final de l’action. Face à des scénarios tels que le changement de tasses ou de tables, les robots échouent fréquemment en raison d’un manque de généralisation. Pour remédier à ce problème majeur du secteur, l’équipe de Variable a souligné dans son article scientifique que les informations textuelles, visuelles et d’action existent naturellement à différentes échelles de temps et dans des géométries multiples dans le monde réel. Les forcer à cohabiter dans un seul espace commun peut facilement endommager le modèle géométrique pré-entraîné.
Pour relever ce défi, le modèle du monde WALL-WM introduit un mécanisme innovant d’entraînement et d’exécution centré sur les événements. Il décompose les tâches complexes en événements sémantiquement clairs, tels que tendre le bras, saisir et déplacer. En fonctionnement, le modèle ne calcule plus de manière rigide l'image suivante. Au lieu de cela, il simule d'abord comment le monde va changer en raison de l'événement suivant, puis traduit précisément ce changement visuel en trajectoire de mouvement du bras robotique.

Pour garantir que cette nouvelle architecture puisse être déployée de manière fiable dans le monde physique, l'équipe de Variable Robot a procédé à une série de révisions techniques approfondies. Le système prend en charge une commutation flexible entre le « mode événement » (avec une sortie d'action de longueur variable) et le « mode unifié » (avec un contrôle en boucle fermée en temps réel) sur les mêmes poids de base. Il réalise également un couplage unidirectionnel entre les modèles vidéo et les modèles d’action, empêchant ainsi que les précieuses informations a priori dynamiques issues des vidéos Internet ne soient prématurément biaisées par les données d’action. Pour la perception géométrique à partir de plusieurs caméras, le modèle introduit des masques de frustum et des masques tubulaires, forçant l'IA à développer une correspondance géométrique tridimensionnelle réelle entre les différentes vues. Pour remédier à la latence de décision, il utilise une nouvelle technique de « décodage par chaîne de pensée par étapes » qui réduit considérablement le délai de décodage tout en conservant l'interprétabilité logique.

Article connexe
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Recommandations de sujets spéciaux liés
commentaires (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
Le 29 mai, l'équipe de Variable Robot a dévoilé WALL-WM, le premier modèle du monde doté d'une intelligence incarnée au monde, fondé sur la « prédiction au niveau des événements ». Ce modèle s'affranchit des grands modèles incarnés conventionnels qui apprennent les actions image par image au fil du temps, en orientant plutôt l'unité de prédiction du modèle du monde vers des événements sémantiques. Il marque une nouvelle étape dans la manière dont les robots comprennent et exécutent les tâches.

Dans le secteur actuel de l’intelligence incarnée, les modèles VLA (vision-langage-action) dominants utilisent généralement une image et une instruction du moment pour prédire un bloc d’action de longueur fixe. Cette approche d’entraînement image par image conduit souvent les robots à se concentrer sur des mouvements physiques mineurs tout en perdant de vue l’objectif final de l’action. Face à des scénarios tels que le changement de tasses ou de tables, les robots échouent fréquemment en raison d’un manque de généralisation. Pour remédier à ce problème majeur du secteur, l’équipe de Variable a souligné dans son article scientifique que les informations textuelles, visuelles et d’action existent naturellement à différentes échelles de temps et dans des géométries multiples dans le monde réel. Les forcer à cohabiter dans un seul espace commun peut facilement endommager le modèle géométrique pré-entraîné.
Pour relever ce défi, le modèle du monde WALL-WM introduit un mécanisme innovant d’entraînement et d’exécution centré sur les événements. Il décompose les tâches complexes en événements sémantiquement clairs, tels que tendre le bras, saisir et déplacer. En fonctionnement, le modèle ne calcule plus de manière rigide l'image suivante. Au lieu de cela, il simule d'abord comment le monde va changer en raison de l'événement suivant, puis traduit précisément ce changement visuel en trajectoire de mouvement du bras robotique.

Pour garantir que cette nouvelle architecture puisse être déployée de manière fiable dans le monde physique, l'équipe de Variable Robot a procédé à une série de révisions techniques approfondies. Le système prend en charge une commutation flexible entre le « mode événement » (avec une sortie d'action de longueur variable) et le « mode unifié » (avec un contrôle en boucle fermée en temps réel) sur les mêmes poids de base. Il réalise également un couplage unidirectionnel entre les modèles vidéo et les modèles d’action, empêchant ainsi que les précieuses informations a priori dynamiques issues des vidéos Internet ne soient prématurément biaisées par les données d’action. Pour la perception géométrique à partir de plusieurs caméras, le modèle introduit des masques de frustum et des masques tubulaires, forçant l'IA à développer une correspondance géométrique tridimensionnelle réelle entre les différentes vues. Pour remédier à la latence de décision, il utilise une nouvelle technique de « décodage par chaîne de pensée par étapes » qui réduit considérablement le délai de décodage tout en conservant l'interprétabilité logique.

ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











