Hogar
PhiZero es pionera en el lenguaje físico, lo que permite que los modelos del mundo de la IA piensen como los humanos
En el panorama actual de los modelos a gran escala, la generación de vídeo se considera cada vez más como el simulador fundamental para la inteligencia encarnada. Sin embargo, la mayoría de los enfoques habituales se basan en la predicción directa en el espacio de píxeles, lo que a menudo da lugar a leyes físicas inestables o incoherentes. Para resolver este reto crítico del sector, nuestro equipo de investigación ha presentado oficialmente PhiZero , un nuevo modelo del mundo físico. Más allá de la predicción ciega tradicional, PhiZero incorpora de forma innovadora el «lenguaje físico», lo que permite a la IA llevar a cabo un razonamiento físico explícito antes de la generación de vídeo.
En esencia, PhiZero introduce una representación discreta conocida como «lenguaje físico». Mediante el aprendizaje autosupervisado sobre amplios conjuntos de datos de vídeo en exteriores, este lenguaje extrae patrones de transición de estados, captando reglas de evolución dinámica en diversos contextos visuales. Aprovechando esto, el modelo adopta una arquitectura de «primero razonamiento, luego renderización»: primero infiere de forma autónoma las trayectorias de evolución futura del mundo dentro del espacio del lenguaje físico y, a continuación, las transmite a un decodificador de difusión especializado para la síntesis de vídeo de alta definición. Esta separación entre la simulación de la dinámica subyacente y la síntesis a nivel de píxel mejora significativamente la coherencia física.

Técnicamente, el sistema consta de dos módulos clave: un tokenizador y un razonador. El tokenizador del lenguaje físico emplea un Q-Former a nivel de transición para captar los cambios entre estados adyacentes, generando símbolos discretos compactos mediante una cuantificación escalar limitada. A continuación, el decodificador de difusión reconstruye imágenes detalladas basándose en el fotograma inicial y en estos símbolos discretos. Por su parte, el razonador de lenguaje físico, inicializado con un modelo de visión-lenguaje preentrenado, predice con precisión futuras secuencias de lenguaje físico a partir del primer fotograma y de las intenciones de acción basadas en texto.

Las evaluaciones comparativas confirman que PhiZero alcanza un rendimiento de vanguardia en múltiples pruebas de razonamiento físico y generación de vídeo, entre las que se incluyen Physics-IQ Verified, PhyGround y WorldModelBench. Ya sea al gestionar el desplazamiento de objetos debido a colisiones, la deformación provocada por la gravedad o complejas reacciones en cadena, el modelo muestra una plausibilidad física altamente realista.
A medida que avanzan la inteligencia incorporada y la robótica, el lanzamiento de PhiZero abre un nuevo camino para la modelización de mundos controlables e interactivos. Está llamado a desempeñar un papel fundamental en escenarios de simulación a largo plazo y de transferencia de movimiento.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En el panorama actual de los modelos a gran escala, la generación de vídeo se considera cada vez más como el simulador fundamental para la inteligencia encarnada. Sin embargo, la mayoría de los enfoques habituales se basan en la predicción directa en el espacio de píxeles, lo que a menudo da lugar a leyes físicas inestables o incoherentes. Para resolver este reto crítico del sector, nuestro equipo de investigación ha presentado oficialmente
En esencia,

Técnicamente, el sistema consta de dos módulos clave: un tokenizador y un razonador. El tokenizador del lenguaje físico emplea un Q-Former a nivel de transición para captar los cambios entre estados adyacentes, generando símbolos discretos compactos mediante una cuantificación escalar limitada. A continuación, el decodificador de difusión reconstruye imágenes detalladas basándose en el fotograma inicial y en estos símbolos discretos. Por su parte, el razonador de lenguaje físico, inicializado con un modelo de visión-lenguaje preentrenado, predice con precisión futuras secuencias de lenguaje físico a partir del primer fotograma y de las intenciones de acción basadas en texto.

Las evaluaciones comparativas confirman que
A medida que avanzan la inteligencia incorporada y la robótica, el lanzamiento de
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











