Maison
AntGroup met en open source LingBot-Video, le premier modèle de base vidéo dédié à l'intelligence incarnée
Le 9 juillet, Ant Group a mis en open source LingBot-Video, le premier modèle de base open source au monde dédié à la génération de vidéos, reposant sur l’architecture « Mixture-of-Experts » (MoE) et spécialement conçu pour l’intelligence incarnée. Ce modèle redéfinit le pré-entraînement vidéo en se concentrant sur les besoins fondamentaux des robots et de l’intelligence incarnée, ce qui se traduit par des gains systématiques en termes d’efficacité du raisonnement, de plausibilité physique, de compréhension des actions et d’exécution des tâches. Il offre une nouvelle base open source permettant aux modèles de base vidéo d’aller au-delà de la création de contenu numérique pour s’orienter vers l’intelligence incarnée.
Sur le benchmark RBench, développé conjointement par l’université de Pékin et ByteDance, LingBot-Video a obtenu un score de 0,620, surpassant ainsi Wan2.6 (0,607), Seedance1.5Pro (0,584) et Cosmos3Super (0,581). RBench, un benchmark d’évaluation complet dédié aux vidéos de manipulation robotique, évalue spécifiquement si un modèle est capable de générer des comportements robotiques conformes aux lois de la physique du monde réel. Ce résultat indique que LingBot-Video parvient mieux à préserver la rationalité des actions et l’intégrité de l’exécution des tâches lors de la génération de vidéos liées à la robotique.

(Légende de la figure : LingBot-Video obtient les meilleures performances sur RBench)
Afin de vérifier plus en détail la capacité de LingBot-Video à modéliser les changements dans le monde physique, Ant Group l’a évalué à l’aide d’un benchmark interne selon deux dimensions : la qualité générale et le domaine incarné. Les résultats montrent que, par rapport à cinq modèles open source — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 et LTX-2.3 —, LingBot-Video surpasse les principaux modèles de référence dans le domaine incarné.

(Légende de la figure : Une évaluation exhaustive montre que LingBot-Video fait preuve d’une meilleure compréhension physique et d’une plus grande cohérence des actions dans des scénarios incarnés)
Ces dernières années, les modèles de génération vidéo ont connu des progrès rapides en termes de qualité visuelle, de fluidité et d’expression créative. Cependant, en matière d’intelligence incarnée, une vidéo qui semble réaliste et dont les mouvements sont fluides peut ne pas refléter les lois physiques réelles, ce qui rend difficile la prédiction continue, la planification et l’exécution de tâches pour les robots. Parallèlement, l’intelligence incarnée exige également une plus grande efficacité de raisonnement pour s’adapter aux interactions en temps réel et aux boucles de contrôle.
Cela a conduit la génération de vidéos à évoluer selon deux voies distinctes : l’une vers le cinéma, au service de la création de contenu ; l’autre vers la robotique, au service de la compréhension, de la prédiction et de l’interaction avec le monde physique. LingBot-Video représente l’exploration majeure menée par Ant Group d’une nouvelle voie pour la génération de vidéos adaptée à l’intelligence incarnée.
LingBot-Video introduit des innovations systématiques en matière d’architecture, de données et d’entraînement.
Sur le plan architectural, LingBot-Video utilise une conception DiT + MoE, remplaçant les architectures denses traditionnelles par le MoE. Cela permet au modèle d’augmenter sa capacité tout en maintenant les coûts d’inférence à un niveau raisonnable. Avec 30 milliards de paramètres, le modèle n’en active qu’environ 3 milliards lors de la génération, offrant ainsi une efficacité de raisonnement environ trois fois supérieure à celle d’une architecture dense de même taille. Cette conception confère au modèle une expressivité visuelle grâce à ses paramètres à grande échelle, tout en répondant mieux aux exigences d’efficacité de l’intelligence incarnée.
En ce qui concerne les données, LingBot-Video a développé un moteur de profilage des données, intégrant des données liées aux robots telles que VLA, VLN et Ego en complément d’une vaste collection de vidéos issues d’Internet, couvrant des scénarios incluant la manipulation de précision, la mobilité des robots et les interactions à la première personne, pour un total de 70 000 heures de données incarnées. Ces données aident le modèle à apprendre la relation entre les actions et les changements environnementaux, plutôt que de se limiter à la texture de surface et au style visuel des vidéos.

Lors de l’entraînement, LingBot-Video a introduit un système de récompense d’apprentissage par renforcement multidimensionnel. Au-delà des métriques conventionnelles telles que l’esthétique, le respect des consignes et la cohérence des mouvements, le modèle tient également compte de la plausibilité physique et de l’accomplissement des tâches, rendant ainsi les résultats générés plus conformes à la physique du monde réel et plus proches des besoins des robots effectuant des tâches dans le monde réel.
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)
Le 9 juillet, Ant Group a mis en open source LingBot-Video, le premier modèle de base open source au monde dédié à la génération de vidéos, reposant sur l’architecture « Mixture-of-Experts » (MoE) et spécialement conçu pour l’intelligence incarnée. Ce modèle redéfinit le pré-entraînement vidéo en se concentrant sur les besoins fondamentaux des robots et de l’intelligence incarnée, ce qui se traduit par des gains systématiques en termes d’efficacité du raisonnement, de plausibilité physique, de compréhension des actions et d’exécution des tâches. Il offre une nouvelle base open source permettant aux modèles de base vidéo d’aller au-delà de la création de contenu numérique pour s’orienter vers l’intelligence incarnée.
Sur le benchmark RBench, développé conjointement par l’université de Pékin et ByteDance, LingBot-Video a obtenu un score de 0,620, surpassant ainsi Wan2.6 (0,607), Seedance1.5Pro (0,584) et Cosmos3Super (0,581). RBench, un benchmark d’évaluation complet dédié aux vidéos de manipulation robotique, évalue spécifiquement si un modèle est capable de générer des comportements robotiques conformes aux lois de la physique du monde réel. Ce résultat indique que LingBot-Video parvient mieux à préserver la rationalité des actions et l’intégrité de l’exécution des tâches lors de la génération de vidéos liées à la robotique.

(Légende de la figure : LingBot-Video obtient les meilleures performances sur RBench)
Afin de vérifier plus en détail la capacité de LingBot-Video à modéliser les changements dans le monde physique, Ant Group l’a évalué à l’aide d’un benchmark interne selon deux dimensions : la qualité générale et le domaine incarné. Les résultats montrent que, par rapport à cinq modèles open source — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 et LTX-2.3 —, LingBot-Video surpasse les principaux modèles de référence dans le domaine incarné.

(Légende de la figure : Une évaluation exhaustive montre que LingBot-Video fait preuve d’une meilleure compréhension physique et d’une plus grande cohérence des actions dans des scénarios incarnés)
Ces dernières années, les modèles de génération vidéo ont connu des progrès rapides en termes de qualité visuelle, de fluidité et d’expression créative. Cependant, en matière d’intelligence incarnée, une vidéo qui semble réaliste et dont les mouvements sont fluides peut ne pas refléter les lois physiques réelles, ce qui rend difficile la prédiction continue, la planification et l’exécution de tâches pour les robots. Parallèlement, l’intelligence incarnée exige également une plus grande efficacité de raisonnement pour s’adapter aux interactions en temps réel et aux boucles de contrôle.
Cela a conduit la génération de vidéos à évoluer selon deux voies distinctes : l’une vers le cinéma, au service de la création de contenu ; l’autre vers la robotique, au service de la compréhension, de la prédiction et de l’interaction avec le monde physique. LingBot-Video représente l’exploration majeure menée par Ant Group d’une nouvelle voie pour la génération de vidéos adaptée à l’intelligence incarnée.
LingBot-Video introduit des innovations systématiques en matière d’architecture, de données et d’entraînement.
Sur le plan architectural, LingBot-Video utilise une conception DiT + MoE, remplaçant les architectures denses traditionnelles par le MoE. Cela permet au modèle d’augmenter sa capacité tout en maintenant les coûts d’inférence à un niveau raisonnable. Avec 30 milliards de paramètres, le modèle n’en active qu’environ 3 milliards lors de la génération, offrant ainsi une efficacité de raisonnement environ trois fois supérieure à celle d’une architecture dense de même taille. Cette conception confère au modèle une expressivité visuelle grâce à ses paramètres à grande échelle, tout en répondant mieux aux exigences d’efficacité de l’intelligence incarnée.
En ce qui concerne les données, LingBot-Video a développé un moteur de profilage des données, intégrant des données liées aux robots telles que VLA, VLN et Ego en complément d’une vaste collection de vidéos issues d’Internet, couvrant des scénarios incluant la manipulation de précision, la mobilité des robots et les interactions à la première personne, pour un total de 70 000 heures de données incarnées. Ces données aident le modèle à apprendre la relation entre les actions et les changements environnementaux, plutôt que de se limiter à la texture de surface et au style visuel des vidéos.

Lors de l’entraînement, LingBot-Video a introduit un système de récompense d’apprentissage par renforcement multidimensionnel. Au-delà des métriques conventionnelles telles que l’esthétique, le respect des consignes et la cohérence des mouvements, le modèle tient également compte de la plausibilité physique et de l’accomplissement des tâches, rendant ainsi les résultats générés plus conformes à la physique du monde réel et plus proches des besoins des robots effectuant des tâches dans le monde réel.
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











