Hogar
El primer modelo mundial de inteligencia incorporada a nivel de eventos pone fin al aprendizaje fotograma a fotograma para los robots
El 29 de mayo, el equipo de Variable Robot presentó WALL-WM, el primer modelo del mundo de inteligencia incorporada basado en la «predicción a nivel de eventos». Este modelo se aleja de los grandes modelos de inteligencia incorporada convencionales, que aprenden acciones fotograma a fotograma a lo largo del tiempo, y cambia la unidad de predicción del modelo del mundo a eventos semánticos. Esto marca una nueva etapa en la forma en que los robots comprenden y llevan a cabo tareas.

En la industria actual de la inteligencia incorporada, los modelos dominantes de visión-lenguaje-acción (VLA) suelen tomar una imagen y una instrucción actuales para predecir un bloque de acción de longitud fija. Este enfoque de entrenamiento fotograma a fotograma a menudo hace que los robots se centren en movimientos físicos menores, perdiendo de vista el objetivo final de la acción. Cuando se enfrentan a situaciones como el cambio de tazas o mesas, los robots suelen fallar debido a la falta de generalización. Para abordar este punto débil del sector, el equipo de Variable señaló en su artículo académico que la información de texto, visión y acción existe de forma natural en diferentes escalas temporales y geometrías múltiples en el mundo real. Forzarlas a un único espacio compartido puede dañar fácilmente el prior geométrico preentrenado.
Para hacer frente a este reto, el modelo de mundo WALL-WM introduce un innovador mecanismo de entrenamiento y ejecución centrado en eventos. Desglosa tareas complejas en eventos semánticamente claros, como alcanzar, agarrar y mover. En funcionamiento, el modelo ya no calcula de forma rígida el siguiente fotograma de la imagen. En su lugar, primero simula cómo cambiará el mundo debido al siguiente evento y, a continuación, traduce con precisión ese cambio visual en la trayectoria de movimiento del brazo robótico.

Para garantizar que esta nueva arquitectura pueda implementarse de forma fiable en el mundo físico, el equipo de Variable Robot llevó a cabo una serie de revisiones de ingeniería exhaustivas. El sistema admite el cambio flexible entre el «modo de eventos» (con salida de acciones de longitud variable) y el «modo unificado» (con control de bucle cerrado en tiempo real) sobre los mismos pesos base. También logra un acoplamiento unidireccional entre los modelos de vídeo y los modelos de acción, lo que evita que los valiosos datos dinámicos previos de los vídeos de Internet se vean sesgados prematuramente por los datos de acción. Para la percepción geométrica a través de múltiples cámaras, el modelo introduce máscaras de frustum y máscaras tubulares, lo que obliga a la IA a desarrollar una correspondencia geométrica tridimensional verdadera entre vistas. Para abordar la latencia en la toma de decisiones, emplea una nueva técnica de «decodificación por cadena de pensamiento escalonada» que reduce significativamente el retraso en la decodificación al tiempo que mantiene la interpretabilidad lógica.

Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
El 29 de mayo, el equipo de Variable Robot presentó WALL-WM, el primer modelo del mundo de inteligencia incorporada basado en la «predicción a nivel de eventos». Este modelo se aleja de los grandes modelos de inteligencia incorporada convencionales, que aprenden acciones fotograma a fotograma a lo largo del tiempo, y cambia la unidad de predicción del modelo del mundo a eventos semánticos. Esto marca una nueva etapa en la forma en que los robots comprenden y llevan a cabo tareas.

En la industria actual de la inteligencia incorporada, los modelos dominantes de visión-lenguaje-acción (VLA) suelen tomar una imagen y una instrucción actuales para predecir un bloque de acción de longitud fija. Este enfoque de entrenamiento fotograma a fotograma a menudo hace que los robots se centren en movimientos físicos menores, perdiendo de vista el objetivo final de la acción. Cuando se enfrentan a situaciones como el cambio de tazas o mesas, los robots suelen fallar debido a la falta de generalización. Para abordar este punto débil del sector, el equipo de Variable señaló en su artículo académico que la información de texto, visión y acción existe de forma natural en diferentes escalas temporales y geometrías múltiples en el mundo real. Forzarlas a un único espacio compartido puede dañar fácilmente el prior geométrico preentrenado.
Para hacer frente a este reto, el modelo de mundo WALL-WM introduce un innovador mecanismo de entrenamiento y ejecución centrado en eventos. Desglosa tareas complejas en eventos semánticamente claros, como alcanzar, agarrar y mover. En funcionamiento, el modelo ya no calcula de forma rígida el siguiente fotograma de la imagen. En su lugar, primero simula cómo cambiará el mundo debido al siguiente evento y, a continuación, traduce con precisión ese cambio visual en la trayectoria de movimiento del brazo robótico.

Para garantizar que esta nueva arquitectura pueda implementarse de forma fiable en el mundo físico, el equipo de Variable Robot llevó a cabo una serie de revisiones de ingeniería exhaustivas. El sistema admite el cambio flexible entre el «modo de eventos» (con salida de acciones de longitud variable) y el «modo unificado» (con control de bucle cerrado en tiempo real) sobre los mismos pesos base. También logra un acoplamiento unidireccional entre los modelos de vídeo y los modelos de acción, lo que evita que los valiosos datos dinámicos previos de los vídeos de Internet se vean sesgados prematuramente por los datos de acción. Para la percepción geométrica a través de múltiples cámaras, el modelo introduce máscaras de frustum y máscaras tubulares, lo que obliga a la IA a desarrollar una correspondencia geométrica tridimensional verdadera entre vistas. Para abordar la latencia en la toma de decisiones, emplea una nueva técnica de «decodificación por cadena de pensamiento escalonada» que reduce significativamente el retraso en la decodificación al tiempo que mantiene la interpretabilidad lógica.

Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











