Lar
A PhiZero é pioneira na linguagem física, permitindo que modelos do mundo baseados em IA pensem como seres humanos
No cenário atual dos grandes modelos, a geração de vídeo é cada vez mais vista como o simulador fundamental para a inteligência incorporada. No entanto, a maioria das abordagens convencionais depende da previsão direta no espaço de pixels, o que muitas vezes resulta em leis físicas instáveis ou inconsistentes. Para resolver esse desafio crítico do setor, nossa equipe de pesquisa apresentou oficialmente o PhiZero , um novo modelo do mundo físico. Indo além da previsão cega tradicional, o PhiZero incorpora de forma inovadora a “linguagem física”, capacitando a IA a realizar um raciocínio físico explícito antes da geração de vídeo.
Em sua essência, o PhiZero introduz uma representação discreta conhecida como “linguagem física”. Por meio do aprendizado auto-supervisionado em vastos conjuntos de dados de vídeos ao ar livre, essa linguagem extrai padrões de transição de estado, capturando regras de evolução dinâmica em diversos contextos visuais. Aproveitando isso, o modelo adota uma arquitetura do tipo “primeiro o raciocínio, depois a renderização”: ele primeiro infere de forma autônoma as trajetórias futuras de evolução do mundo dentro do espaço da linguagem física e, em seguida, repassa essas informações a um decodificador de difusão especializado para a síntese de vídeo em alta definição. Essa separação entre a simulação da dinâmica subjacente e a síntese no nível do pixel aumenta significativamente a consistência física.

Tecnicamente, o sistema é composto por dois módulos principais: um tokenizador e um razonador. O tokenizador da linguagem física emprega um Q-Former no nível de transição para capturar mudanças entre estados adjacentes, gerando símbolos discretos compactos por meio de quantização escalar limitada. O decodificador de difusão, então, reconstrói imagens detalhadas com base no quadro inicial e nesses símbolos discretos. Enquanto isso, o razonador de linguagem física, inicializado com um modelo de visão-linguagem pré-treinado, prevê com precisão sequências futuras da linguagem física a partir do primeiro quadro e das intenções de ação baseadas em texto.

Avaliações de benchmark confirmam que o PhiZero alcança desempenho de ponta em vários testes de raciocínio físico e geração de vídeo, incluindo Physics-IQ Verified, PhyGround e WorldModelBench. Seja ao lidar com o deslocamento de objetos devido a colisões, deformações causadas pela gravidade ou reações em cadeia complexas, o modelo exibe uma plausibilidade física altamente realista.
À medida que a inteligência incorporada e a robótica avançam, o lançamento do PhiZero abre um novo caminho para a modelagem controlável e interativa do mundo. Ele está pronto para desempenhar um papel fundamental em cenários de simulação de longo prazo e transferência de movimento.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
No cenário atual dos grandes modelos, a geração de vídeo é cada vez mais vista como o simulador fundamental para a inteligência incorporada. No entanto, a maioria das abordagens convencionais depende da previsão direta no espaço de pixels, o que muitas vezes resulta em leis físicas instáveis ou inconsistentes. Para resolver esse desafio crítico do setor, nossa equipe de pesquisa apresentou oficialmente
Em sua essência,

Tecnicamente, o sistema é composto por dois módulos principais: um tokenizador e um razonador. O tokenizador da linguagem física emprega um Q-Former no nível de transição para capturar mudanças entre estados adjacentes, gerando símbolos discretos compactos por meio de quantização escalar limitada. O decodificador de difusão, então, reconstrói imagens detalhadas com base no quadro inicial e nesses símbolos discretos. Enquanto isso, o razonador de linguagem física, inicializado com um modelo de visão-linguagem pré-treinado, prevê com precisão sequências futuras da linguagem física a partir do primeiro quadro e das intenções de ação baseadas em texto.

Avaliações de benchmark confirmam que
À medida que a inteligência incorporada e a robótica avançam, o lançamento do
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











