Lar
Modelo mundial de inteligência incorporada em nível de evento, inédito no mundo, põe fim ao aprendizado quadro a quadro para robôs
Em 29 de maio, a equipe da Variable Robot apresentou o WALL-WM, o primeiro modelo de mundo com inteligência incorporada do mundo baseado em “previsão em nível de evento”. Esse modelo rompe com os grandes modelos incorporados convencionais, que aprendem ações quadro a quadro ao longo do tempo, mudando, em vez disso, a unidade de previsão do modelo do mundo para eventos semânticos. Isso marca uma nova etapa na forma como os robôs compreendem e executam tarefas.

Na indústria atual de inteligência incorporada, os modelos convencionais de visão-linguagem-ação (VLA) normalmente utilizam uma imagem atual e uma instrução para prever um bloco de ação de duração fixa. Essa abordagem de treinamento quadro a quadro frequentemente faz com que os robôs se concentrem em movimentos físicos menores, perdendo de vista o objetivo final da ação. Quando confrontados com cenários como a troca de copos ou mesas, os robôs frequentemente falham devido à falta de generalização. Para resolver esse ponto fraco do setor, a equipe da Variable destacou em seu artigo acadêmico que as informações de texto, visão e ação existem naturalmente em diferentes escalas de tempo e geometrias múltiplas no mundo real. Forçá-las a um único espaço compartilhado pode facilmente prejudicar o prior geométrico pré-treinado.
Para enfrentar esse desafio, o modelo de mundo WALL-WM introduz um mecanismo inovador de treinamento e execução centrado em eventos. Ele divide tarefas complexas em junções de eventos semanticamente claras, como alcançar, agarrar e mover. Em operação, o modelo não calcula mais rigidamente o próximo quadro de imagem. Em vez disso, ele primeiro simula como o mundo mudará devido ao próximo evento e, em seguida, traduz com precisão essa mudança visual na trajetória de movimento do braço robótico.

Para garantir que essa nova arquitetura possa ser implantada de forma confiável no mundo físico, a equipe do Variable Robot realizou uma série de reformulações de engenharia de ponta. O sistema suporta a alternância flexível entre o “modo de evento” (com saída de ação de comprimento variável) e o “modo unificado” (com controle de malha fechada em tempo real) nos mesmos pesos de base. Ele também alcança um acoplamento unidirecional entre modelos de vídeo e modelos de ação, evitando que valiosas informações dinâmicas prévias de vídeos da internet sejam prematuramente influenciadas pelos dados de ação. Para a percepção geométrica entre múltiplas câmeras, o modelo introduz máscaras de frustum e máscaras tubulares, forçando a IA a desenvolver uma correspondência geométrica tridimensional verdadeira entre as visões. Para lidar com a latência de decisão, ele emprega uma nova técnica de “decodificação em cadeia de pensamento escalonada” que reduz significativamente o atraso na decodificação, mantendo a interpretabilidade lógica.

Artigo relacionado
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro
Recomendações de tópicos especiais relacionados
Comentários (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
Em 29 de maio, a equipe da Variable Robot apresentou o WALL-WM, o primeiro modelo de mundo com inteligência incorporada do mundo baseado em “previsão em nível de evento”. Esse modelo rompe com os grandes modelos incorporados convencionais, que aprendem ações quadro a quadro ao longo do tempo, mudando, em vez disso, a unidade de previsão do modelo do mundo para eventos semânticos. Isso marca uma nova etapa na forma como os robôs compreendem e executam tarefas.

Na indústria atual de inteligência incorporada, os modelos convencionais de visão-linguagem-ação (VLA) normalmente utilizam uma imagem atual e uma instrução para prever um bloco de ação de duração fixa. Essa abordagem de treinamento quadro a quadro frequentemente faz com que os robôs se concentrem em movimentos físicos menores, perdendo de vista o objetivo final da ação. Quando confrontados com cenários como a troca de copos ou mesas, os robôs frequentemente falham devido à falta de generalização. Para resolver esse ponto fraco do setor, a equipe da Variable destacou em seu artigo acadêmico que as informações de texto, visão e ação existem naturalmente em diferentes escalas de tempo e geometrias múltiplas no mundo real. Forçá-las a um único espaço compartilhado pode facilmente prejudicar o prior geométrico pré-treinado.
Para enfrentar esse desafio, o modelo de mundo WALL-WM introduz um mecanismo inovador de treinamento e execução centrado em eventos. Ele divide tarefas complexas em junções de eventos semanticamente claras, como alcançar, agarrar e mover. Em operação, o modelo não calcula mais rigidamente o próximo quadro de imagem. Em vez disso, ele primeiro simula como o mundo mudará devido ao próximo evento e, em seguida, traduz com precisão essa mudança visual na trajetória de movimento do braço robótico.

Para garantir que essa nova arquitetura possa ser implantada de forma confiável no mundo físico, a equipe do Variable Robot realizou uma série de reformulações de engenharia de ponta. O sistema suporta a alternância flexível entre o “modo de evento” (com saída de ação de comprimento variável) e o “modo unificado” (com controle de malha fechada em tempo real) nos mesmos pesos de base. Ele também alcança um acoplamento unidirecional entre modelos de vídeo e modelos de ação, evitando que valiosas informações dinâmicas prévias de vídeos da internet sejam prematuramente influenciadas pelos dados de ação. Para a percepção geométrica entre múltiplas câmeras, o modelo introduz máscaras de frustum e máscaras tubulares, forçando a IA a desenvolver uma correspondência geométrica tridimensional verdadeira entre as visões. Para lidar com a latência de decisão, ele emprega uma nova técnica de “decodificação em cadeia de pensamento escalonada” que reduz significativamente o atraso na decodificação, mantendo a interpretabilidade lógica.

A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











