Lar
O Ant Group torna o LingBot-Vision de código aberto, proporcionando aos robôs percepção espacial
No campo da inteligência incorporada, permitir que os robôs percebam o espaço físico com precisão semelhante à humana continua sendo um desafio fundamental. A Robbyant, subsidiária do Ant Group especializada em IA incorporada, tornou oficialmente de código aberto a família de modelos LingBot-Vision. Esse conjunto de Transformers de visão auto-supervisionados alcança resultados excepcionais na percepção espacial densa por meio de uma estratégia inovadora de “modelagem de limites”, superando modelos maiores em vários benchmarks, apesar de possuir menos parâmetros.
A maioria dos modelos visuais de base atuais prioriza o “reconhecimento de objetos”, concentrando-se em identificar o que está em uma imagem, enquanto muitas vezes ignora pistas críticas de interação física, como limites, contornos e profundidade dos objetos. O LingBot-Vision inverte essa abordagem ao tratar os “limites” como sinais primários de pré-treinamento. Ao utilizar a modelagem de limites por máscara, o modelo identifica as regiões mais densas em informações em uma imagem e concentra seu treinamento nelas. Esse método permite que o modelo adquira compreensão semântica e, ao mesmo tempo, desenvolva uma percepção espacial geométrica robusta.

Em relação ao desempenho, o modelo principal do LingBot-Vision, o ViT-g/16, contém apenas 1,1 bilhão de parâmetros, mas alcança resultados de ponta em tarefas de estimativa de profundidade, incluindo o NYU-Depth v2. Ele supera o DINOv3, que possui 7 bilhões de parâmetros, embora utilize um conjunto de dados de treinamento com cerca de um terço do tamanho. Para cenários de implantação com recursos limitados, a série oferece versões destiladas que variam de 3 bilhões de parâmetros até tamanhos menores, garantindo desempenho de ponta em previsão densa em diversas configurações de hardware.
Para demonstrar o valor prático da tecnologia, a equipe de desenvolvimento também atualizou o sistema de preenchimento de profundidade para o LingBot-Depth 2.0. Testes indicam melhorias significativas na precisão ao lidar com objetos transparentes, um tradicional ponto cego da percepção. À medida que o volume de dados aumenta, o desempenho do LingBot-Vision continua a escalar sem a saturação típica dos modelos tradicionais, validando ainda mais o potencial de sua arquitetura de percepção espacial centrada em limites em ambientes complexos do mundo real.
O LingBot-Vision agora está totalmente disponível como código aberto no Hugging Face sob a licença Apache-2.0, incluindo pesos e código de inferência para quatro tamanhos de modelo, do maior ao menor. Essa tecnologia permite que os desenvolvedores equipem robôs com capacidades de percepção física mais sensíveis a custos computacionais mais baixos, abrindo caminho para um futuro mais preciso e interativo na inteligência incorporada.
Artigo relacionado
GPT 5.5 lidera a corrida de segurança de IA, enquanto DeepSeek se destaca em custo-efetividade
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livro
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o
Recomendações de tópicos especiais relacionados
Comentários (0)
No campo da inteligência incorporada, permitir que os robôs percebam o espaço físico com precisão semelhante à humana continua sendo um desafio fundamental. A Robbyant, subsidiária do Ant Group especializada em IA incorporada, tornou oficialmente de código aberto a família de modelos LingBot-Vision. Esse conjunto de Transformers de visão auto-supervisionados alcança resultados excepcionais na percepção espacial densa por meio de uma estratégia inovadora de “modelagem de limites”, superando modelos maiores em vários benchmarks, apesar de possuir menos parâmetros.
A maioria dos modelos visuais de base atuais prioriza o “reconhecimento de objetos”, concentrando-se em identificar o que está em uma imagem, enquanto muitas vezes ignora pistas críticas de interação física, como limites, contornos e profundidade dos objetos. O LingBot-Vision inverte essa abordagem ao tratar os “limites” como sinais primários de pré-treinamento. Ao utilizar a modelagem de limites por máscara, o modelo identifica as regiões mais densas em informações em uma imagem e concentra seu treinamento nelas. Esse método permite que o modelo adquira compreensão semântica e, ao mesmo tempo, desenvolva uma percepção espacial geométrica robusta.

Em relação ao desempenho, o modelo principal do LingBot-Vision, o ViT-g/16, contém apenas 1,1 bilhão de parâmetros, mas alcança resultados de ponta em tarefas de estimativa de profundidade, incluindo o NYU-Depth v2. Ele supera o DINOv3, que possui 7 bilhões de parâmetros, embora utilize um conjunto de dados de treinamento com cerca de um terço do tamanho. Para cenários de implantação com recursos limitados, a série oferece versões destiladas que variam de 3 bilhões de parâmetros até tamanhos menores, garantindo desempenho de ponta em previsão densa em diversas configurações de hardware.
Para demonstrar o valor prático da tecnologia, a equipe de desenvolvimento também atualizou o sistema de preenchimento de profundidade para o LingBot-Depth 2.0. Testes indicam melhorias significativas na precisão ao lidar com objetos transparentes, um tradicional ponto cego da percepção. À medida que o volume de dados aumenta, o desempenho do LingBot-Vision continua a escalar sem a saturação típica dos modelos tradicionais, validando ainda mais o potencial de sua arquitetura de percepção espacial centrada em limites em ambientes complexos do mundo real.
O LingBot-Vision agora está totalmente disponível como código aberto no Hugging Face sob a licença Apache-2.0, incluindo pesos e código de inferência para quatro tamanhos de modelo, do maior ao menor. Essa tecnologia permite que os desenvolvedores equipem robôs com capacidades de percepção física mais sensíveis a custos computacionais mais baixos, abrindo caminho para um futuro mais preciso e interativo na inteligência incorporada.
GPT 5.5 lidera a corrida de segurança de IA, enquanto DeepSeek se destaca em custo-efetividade
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livro
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o











