Lar
O AntGroup torna o LingBot-Video, o primeiro modelo de base de vídeo para inteligência incorporada, de código aberto
Em 9 de julho, o Ant Group disponibilizou como código aberto o LingBot-Video, o primeiro modelo de base de geração de vídeo de código aberto do mundo, construído com base na arquitetura Mixture-of-Experts (MoE) e desenvolvido especificamente para a inteligência incorporada. O modelo redefine o pré-treinamento de vídeo ao se concentrar nas necessidades centrais dos robôs e da inteligência incorporada, proporcionando ganhos sistemáticos em eficiência de raciocínio, plausibilidade física, compreensão de ações e conclusão de tarefas. Ele oferece uma nova base de código aberto para que os modelos fundamentais de vídeo vão além da criação de conteúdo digital e avancem para a inteligência incorporada.
No benchmark RBench, desenvolvido em conjunto pela Universidade de Pequim e pela ByteDance, o LingBot-Video obteve uma pontuação de 0,620, superando o Wan2.6 (0,607), o Seedance1.5Pro (0,584) e o Cosmos3Super (0,581). O RBench, um benchmark de avaliação abrangente para vídeos de manipulação robótica, avalia especificamente se um modelo é capaz de gerar comportamentos robóticos que sigam as leis da física do mundo real. Esse resultado indica que o LingBot-Video é mais eficaz em preservar a racionalidade das ações e a integridade da execução de tarefas ao gerar vídeos relacionados a robôs.

(Legenda da figura: O LingBot-Video alcança o melhor desempenho no RBench)
Para verificar ainda mais a capacidade do LingBot-Video de modelar mudanças no mundo físico, o Ant Group o avaliou em um benchmark interno em duas dimensões: qualidade geral e domínio incorporado. Os resultados mostram que, em comparação com cinco modelos de código aberto — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 e LTX-2.3 —, o LingBot-Video supera os principais modelos de referência no domínio incorporado.

(Legenda da figura: Avaliação abrangente mostra que o LingBot-Video apresenta maior compreensão física e consistência de ação em cenários incorporados)
Nos últimos anos, os modelos de geração de vídeo avançaram rapidamente em termos de qualidade visual, fluidez e expressão criativa. No entanto, para a inteligência incorporada, um vídeo que pareça realista e tenha movimentos suaves pode não refletir as leis físicas reais, dificultando o suporte à previsão contínua, ao planejamento e à execução de tarefas por robôs. Ao mesmo tempo, a inteligência incorporada também exige maior eficiência de raciocínio para se adaptar à interação em tempo real e aos ciclos de controle.
Isso levou a geração de vídeos a evoluir por dois caminhos distintos: um voltado para o cinema, voltado à criação de conteúdo; o outro voltado para robôs, voltado à compreensão, previsão e interação com o mundo físico. O LingBot-Video representa uma exploração significativa do Ant Group em um novo caminho para a geração de vídeos adaptados à inteligência incorporada.
O LingBot-Video introduz inovações sistemáticas em arquitetura, dados e treinamento.
Em termos de arquitetura, o LingBot-Video emprega um design DiT + MoE, substituindo as arquiteturas densas tradicionais pelo MoE. Isso permite que o modelo amplie sua capacidade, mantendo os custos de inferência controláveis. Com 30 bilhões de parâmetros, o modelo ativa apenas cerca de 3 bilhões durante a geração, oferecendo aproximadamente três vezes a eficiência de raciocínio de uma arquitetura densa do mesmo tamanho. Esse projeto confere ao modelo expressividade visual a partir de parâmetros em grande escala, ao mesmo tempo em que atende melhor às demandas de eficiência da inteligência incorporada.
Quanto aos dados, o LingBot-Video desenvolveu um mecanismo de perfilagem de dados, incorporando dados relacionados a robôs, como VLA, VLN e Ego, além de uma enorme quantidade de vídeos da internet, abrangendo cenários que incluem manipulação hábil, mobilidade robótica e interações em primeira pessoa, totalizando 70.000 horas de dados incorporados. Esses dados ajudam o modelo a aprender a relação entre ações e mudanças ambientais, em vez de apenas a textura superficial e o estilo visual dos vídeos.

No treinamento, o LingBot-Video introduziu um sistema de recompensa de aprendizado por reforço multidimensional. Além de métricas convencionais como estética, obediência a comandos e consistência de movimento, o modelo também leva em conta a plausibilidade física e a conclusão de tarefas, tornando os resultados gerados mais consistentes com a física do mundo real e mais próximos das necessidades dos robôs que realizam tarefas no mundo real.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 9 de julho, o Ant Group disponibilizou como código aberto o LingBot-Video, o primeiro modelo de base de geração de vídeo de código aberto do mundo, construído com base na arquitetura Mixture-of-Experts (MoE) e desenvolvido especificamente para a inteligência incorporada. O modelo redefine o pré-treinamento de vídeo ao se concentrar nas necessidades centrais dos robôs e da inteligência incorporada, proporcionando ganhos sistemáticos em eficiência de raciocínio, plausibilidade física, compreensão de ações e conclusão de tarefas. Ele oferece uma nova base de código aberto para que os modelos fundamentais de vídeo vão além da criação de conteúdo digital e avancem para a inteligência incorporada.
No benchmark RBench, desenvolvido em conjunto pela Universidade de Pequim e pela ByteDance, o LingBot-Video obteve uma pontuação de 0,620, superando o Wan2.6 (0,607), o Seedance1.5Pro (0,584) e o Cosmos3Super (0,581). O RBench, um benchmark de avaliação abrangente para vídeos de manipulação robótica, avalia especificamente se um modelo é capaz de gerar comportamentos robóticos que sigam as leis da física do mundo real. Esse resultado indica que o LingBot-Video é mais eficaz em preservar a racionalidade das ações e a integridade da execução de tarefas ao gerar vídeos relacionados a robôs.

(Legenda da figura: O LingBot-Video alcança o melhor desempenho no RBench)
Para verificar ainda mais a capacidade do LingBot-Video de modelar mudanças no mundo físico, o Ant Group o avaliou em um benchmark interno em duas dimensões: qualidade geral e domínio incorporado. Os resultados mostram que, em comparação com cinco modelos de código aberto — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 e LTX-2.3 —, o LingBot-Video supera os principais modelos de referência no domínio incorporado.

(Legenda da figura: Avaliação abrangente mostra que o LingBot-Video apresenta maior compreensão física e consistência de ação em cenários incorporados)
Nos últimos anos, os modelos de geração de vídeo avançaram rapidamente em termos de qualidade visual, fluidez e expressão criativa. No entanto, para a inteligência incorporada, um vídeo que pareça realista e tenha movimentos suaves pode não refletir as leis físicas reais, dificultando o suporte à previsão contínua, ao planejamento e à execução de tarefas por robôs. Ao mesmo tempo, a inteligência incorporada também exige maior eficiência de raciocínio para se adaptar à interação em tempo real e aos ciclos de controle.
Isso levou a geração de vídeos a evoluir por dois caminhos distintos: um voltado para o cinema, voltado à criação de conteúdo; o outro voltado para robôs, voltado à compreensão, previsão e interação com o mundo físico. O LingBot-Video representa uma exploração significativa do Ant Group em um novo caminho para a geração de vídeos adaptados à inteligência incorporada.
O LingBot-Video introduz inovações sistemáticas em arquitetura, dados e treinamento.
Em termos de arquitetura, o LingBot-Video emprega um design DiT + MoE, substituindo as arquiteturas densas tradicionais pelo MoE. Isso permite que o modelo amplie sua capacidade, mantendo os custos de inferência controláveis. Com 30 bilhões de parâmetros, o modelo ativa apenas cerca de 3 bilhões durante a geração, oferecendo aproximadamente três vezes a eficiência de raciocínio de uma arquitetura densa do mesmo tamanho. Esse projeto confere ao modelo expressividade visual a partir de parâmetros em grande escala, ao mesmo tempo em que atende melhor às demandas de eficiência da inteligência incorporada.
Quanto aos dados, o LingBot-Video desenvolveu um mecanismo de perfilagem de dados, incorporando dados relacionados a robôs, como VLA, VLN e Ego, além de uma enorme quantidade de vídeos da internet, abrangendo cenários que incluem manipulação hábil, mobilidade robótica e interações em primeira pessoa, totalizando 70.000 horas de dados incorporados. Esses dados ajudam o modelo a aprender a relação entre ações e mudanças ambientais, em vez de apenas a textura superficial e o estilo visual dos vídeos.

No treinamento, o LingBot-Video introduziu um sistema de recompensa de aprendizado por reforço multidimensional. Além de métricas convencionais como estética, obediência a comandos e consistência de movimento, o modelo também leva em conta a plausibilidade física e a conclusão de tarefas, tornando os resultados gerados mais consistentes com a física do mundo real e mais próximos das necessidades dos robôs que realizam tarefas no mundo real.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











