Hogar
AntGroup publica en código abierto LingBot-Video, el primer modelo base de vídeo para la inteligencia incorporada
El 9 de julio, Ant Group publicó en código abierto LingBot-Video, el primer modelo base de generación de vídeo de código abierto del mundo, basado en la arquitectura «Mixture-of-Experts» (MoE) y diseñado específicamente para la inteligencia incorporada. El modelo redefine el preentrenamiento de vídeo al centrarse en las necesidades fundamentales de los robots y la inteligencia encarnada, lo que aporta mejoras sistemáticas en la eficiencia del razonamiento, la verosimilitud física, la comprensión de las acciones y la realización de tareas. Ofrece una nueva base de código abierto para que los modelos base de vídeo vayan más allá de la creación de contenido digital y se adentren en el ámbito de la inteligencia encarnada.
En el banco de pruebas RBench, desarrollado conjuntamente por la Universidad de Pekín y ByteDance, LingBot-Video obtuvo una puntuación de 0,620, superando a Wan2.6 (0,607), Seedance1.5Pro (0,584) y Cosmos3Super (0,581). RBench, un banco de pruebas de evaluación exhaustivo para vídeos de manipulación robótica, evalúa específicamente si un modelo es capaz de generar comportamientos robóticos que se ajusten a las leyes de la física del mundo real. Este resultado indica que LingBot-Video es más eficaz a la hora de preservar la racionalidad de las acciones y la integridad en la ejecución de tareas al generar vídeos relacionados con la robótica.

(Pie de foto: LingBot-Video alcanza el mejor rendimiento en RBench)
Para verificar aún más la capacidad de LingBot-Video para modelar los cambios en el mundo físico, Ant Group lo evaluó en un banco de pruebas interno en dos dimensiones: calidad general y dominio incorporado. Los resultados muestran que, en comparación con cinco modelos de código abierto —NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 y LTX-2.3—, LingBot-Video supera a los principales modelos de referencia en el ámbito encarnado.

(Pie de foto: Una evaluación exhaustiva muestra que LingBot-Video presenta una mayor comprensión física y coherencia en las acciones en escenarios incorporados)
En los últimos años, los modelos de generación de vídeo han avanzado rápidamente en cuanto a calidad visual, fluidez y expresión creativa. Sin embargo, en el caso de la inteligencia incorporada, un vídeo que parezca realista y se mueva con fluidez puede no reflejar las leyes físicas reales, lo que dificulta la predicción continua, la planificación y la ejecución de tareas por parte de los robots. Al mismo tiempo, la inteligencia incorporada también exige una mayor eficiencia en el razonamiento para adaptarse a la interacción en tiempo real y a los bucles de control.
Esto ha impulsado la evolución de la generación de vídeo por dos vías distintas: una hacia el cine, al servicio de la creación de contenidos; y otra hacia los robots, al servicio de la comprensión, la predicción y la interacción con el mundo físico. LingBot-Video representa la importante exploración de Ant Group de una nueva vía para la generación de vídeo adaptada a la inteligencia incorporada.
LingBot-Video introduce innovaciones sistemáticas en arquitectura, datos y entrenamiento.
Desde el punto de vista arquitectónico, LingBot-Video emplea un diseño DiT + MoE, sustituyendo las arquitecturas densas tradicionales por MoE. Esto permite al modelo ampliar su capacidad al tiempo que mantiene los costes de inferencia dentro de unos límites razonables. Con 30 000 millones de parámetros, el modelo activa solo unos 3 000 millones durante la generación, lo que ofrece aproximadamente el triple de eficiencia de razonamiento que una arquitectura densa del mismo tamaño. Este diseño dota al modelo de expresividad visual gracias a los parámetros a gran escala, al tiempo que satisface mejor las exigencias de eficiencia de la inteligencia incorporada.
En cuanto a los datos, LingBot-Video ha creado un motor de perfilado de datos que incorpora datos relacionados con la robótica —como VLA, VLN y Ego— además de una enorme cantidad de vídeos de Internet, cubriendo escenarios que incluyen la manipulación diestra, la movilidad de los robots y las interacciones en primera persona, lo que suma un total de 70 000 horas de datos incorporados. Estos datos ayudan al modelo a aprender la relación entre las acciones y los cambios ambientales, en lugar de limitarse únicamente a la textura superficial y el estilo visual de los vídeos.

Durante el entrenamiento, LingBot-Video introdujo un sistema de recompensas de aprendizaje por refuerzo multidimensional. Más allá de métricas convencionales como la estética, el seguimiento de indicaciones y la coherencia del movimiento, el modelo también tiene en cuenta la plausibilidad física y la finalización de tareas, lo que hace que los resultados generados sean más coherentes con la física del mundo real y más cercanos a las necesidades de los robots que realizan tareas en el mundo real.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 9 de julio, Ant Group publicó en código abierto LingBot-Video, el primer modelo base de generación de vídeo de código abierto del mundo, basado en la arquitectura «Mixture-of-Experts» (MoE) y diseñado específicamente para la inteligencia incorporada. El modelo redefine el preentrenamiento de vídeo al centrarse en las necesidades fundamentales de los robots y la inteligencia encarnada, lo que aporta mejoras sistemáticas en la eficiencia del razonamiento, la verosimilitud física, la comprensión de las acciones y la realización de tareas. Ofrece una nueva base de código abierto para que los modelos base de vídeo vayan más allá de la creación de contenido digital y se adentren en el ámbito de la inteligencia encarnada.
En el banco de pruebas RBench, desarrollado conjuntamente por la Universidad de Pekín y ByteDance, LingBot-Video obtuvo una puntuación de 0,620, superando a Wan2.6 (0,607), Seedance1.5Pro (0,584) y Cosmos3Super (0,581). RBench, un banco de pruebas de evaluación exhaustivo para vídeos de manipulación robótica, evalúa específicamente si un modelo es capaz de generar comportamientos robóticos que se ajusten a las leyes de la física del mundo real. Este resultado indica que LingBot-Video es más eficaz a la hora de preservar la racionalidad de las acciones y la integridad en la ejecución de tareas al generar vídeos relacionados con la robótica.

(Pie de foto: LingBot-Video alcanza el mejor rendimiento en RBench)
Para verificar aún más la capacidad de LingBot-Video para modelar los cambios en el mundo físico, Ant Group lo evaluó en un banco de pruebas interno en dos dimensiones: calidad general y dominio incorporado. Los resultados muestran que, en comparación con cinco modelos de código abierto —NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 y LTX-2.3—, LingBot-Video supera a los principales modelos de referencia en el ámbito encarnado.

(Pie de foto: Una evaluación exhaustiva muestra que LingBot-Video presenta una mayor comprensión física y coherencia en las acciones en escenarios incorporados)
En los últimos años, los modelos de generación de vídeo han avanzado rápidamente en cuanto a calidad visual, fluidez y expresión creativa. Sin embargo, en el caso de la inteligencia incorporada, un vídeo que parezca realista y se mueva con fluidez puede no reflejar las leyes físicas reales, lo que dificulta la predicción continua, la planificación y la ejecución de tareas por parte de los robots. Al mismo tiempo, la inteligencia incorporada también exige una mayor eficiencia en el razonamiento para adaptarse a la interacción en tiempo real y a los bucles de control.
Esto ha impulsado la evolución de la generación de vídeo por dos vías distintas: una hacia el cine, al servicio de la creación de contenidos; y otra hacia los robots, al servicio de la comprensión, la predicción y la interacción con el mundo físico. LingBot-Video representa la importante exploración de Ant Group de una nueva vía para la generación de vídeo adaptada a la inteligencia incorporada.
LingBot-Video introduce innovaciones sistemáticas en arquitectura, datos y entrenamiento.
Desde el punto de vista arquitectónico, LingBot-Video emplea un diseño DiT + MoE, sustituyendo las arquitecturas densas tradicionales por MoE. Esto permite al modelo ampliar su capacidad al tiempo que mantiene los costes de inferencia dentro de unos límites razonables. Con 30 000 millones de parámetros, el modelo activa solo unos 3 000 millones durante la generación, lo que ofrece aproximadamente el triple de eficiencia de razonamiento que una arquitectura densa del mismo tamaño. Este diseño dota al modelo de expresividad visual gracias a los parámetros a gran escala, al tiempo que satisface mejor las exigencias de eficiencia de la inteligencia incorporada.
En cuanto a los datos, LingBot-Video ha creado un motor de perfilado de datos que incorpora datos relacionados con la robótica —como VLA, VLN y Ego— además de una enorme cantidad de vídeos de Internet, cubriendo escenarios que incluyen la manipulación diestra, la movilidad de los robots y las interacciones en primera persona, lo que suma un total de 70 000 horas de datos incorporados. Estos datos ayudan al modelo a aprender la relación entre las acciones y los cambios ambientales, en lugar de limitarse únicamente a la textura superficial y el estilo visual de los vídeos.

Durante el entrenamiento, LingBot-Video introdujo un sistema de recompensas de aprendizaje por refuerzo multidimensional. Más allá de métricas convencionales como la estética, el seguimiento de indicaciones y la coherencia del movimiento, el modelo también tiene en cuenta la plausibilidad física y la finalización de tareas, lo que hace que los resultados generados sean más coherentes con la física del mundo real y más cercanos a las necesidades de los robots que realizan tareas en el mundo real.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











