Lar
A Apple apresenta o RubiCap AI para descrições de imagens em meio a preocupações com o desempenho
Na visão computacional, permitir que a IA observe e descreva cada detalhe de uma imagem com precisão semelhante à humana tem sido, há muito tempo, um dos principais desafios. Recentemente, a Apple, em colaboração com a Universidade de Wisconsin-Madison, lançou oficialmente uma nova estrutura de treinamento de IA chamada RubiCap .
Essa estrutura foi projetada especificamente para “legendagem densa de imagens”, com o objetivo de capacitar a IA a capturar e articular com precisão detalhes minuciosos — como “uma maçã vermelha sobre a mesa de madeira” ou “um pedestre à distância” — em vez de oferecer apenas resumos genéricos.

Aprendizado por reforço com grande impacto: Qwen2.5 atua como o “árbitro”
A legenda de imagens tradicional geralmente depende de anotações humanas dispendiosas ou de grandes modelos propensos a alucinações, resultando em qualidade de dados inconsistente. A equipe de pesquisa da Apple abordou isso com uma abordagem inovadora de aprendizado por reforço. O sistema primeiro usa o GPT-4 e o Gemini 1.5 Pro para gerar descrições candidatas. O Gemini 1.5 Pro então refina os critérios de pontuação, enquanto o modelo Qwen2.5 atua como um árbitro, fornecendo pontuações e feedback.
Esse feedback estruturado e preciso permite que o modelo de treinamento identifique e corrija erros com clareza, alcançando maior precisão descritiva mesmo com um número menor de parâmetros.
A vantagem do modelo compacto: taxas de alucinação mais baixas superam modelos com trilhões de parâmetros
Os modelos da série RubiCap (variando de 2 bilhões a 7 bilhões de parâmetros) treinados nessa estrutura demonstraram eficiência excepcional nas avaliações. Dados experimentais revelam que o modelo RubiCap de 7 bilhões de parâmetros alcançou as melhores pontuações em testes cegos, com uma taxa de erro de alucinação inferior à de um modelo grande líder de 720 bilhões de parâmetros. Notavelmente, a versão mini de 3 bilhões de parâmetros chegou a superar sua contraparte de 7 bilhões de parâmetros em certas métricas.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
Na visão computacional, permitir que a IA observe e descreva cada detalhe de uma imagem com precisão semelhante à humana tem sido, há muito tempo, um dos principais desafios. Recentemente, a Apple, em colaboração com a Universidade de Wisconsin-Madison, lançou oficialmente uma nova estrutura de treinamento de IA chamada
Essa estrutura foi projetada especificamente para “legendagem densa de imagens”, com o objetivo de capacitar a IA a capturar e articular com precisão detalhes minuciosos — como “uma maçã vermelha sobre a mesa de madeira” ou “um pedestre à distância” — em vez de oferecer apenas resumos genéricos.

Aprendizado por reforço com grande impacto: Qwen2.5 atua como o “árbitro”
A legenda de imagens tradicional geralmente depende de anotações humanas dispendiosas ou de grandes modelos propensos a alucinações, resultando em qualidade de dados inconsistente. A equipe de pesquisa da Apple abordou isso com uma abordagem inovadora de aprendizado por reforço. O sistema primeiro usa o GPT-4 e o Gemini 1.5 Pro para gerar descrições candidatas. O Gemini 1.5 Pro então refina os critérios de pontuação, enquanto o modelo Qwen2.5 atua como um árbitro, fornecendo pontuações e feedback.
Esse feedback estruturado e preciso permite que o modelo de treinamento identifique e corrija erros com clareza, alcançando maior precisão descritiva mesmo com um número menor de parâmetros.
A vantagem do modelo compacto: taxas de alucinação mais baixas superam modelos com trilhões de parâmetros
Os modelos da série RubiCap (variando de 2 bilhões a 7 bilhões de parâmetros) treinados nessa estrutura demonstraram eficiência excepcional nas avaliações. Dados experimentais revelam que o modelo RubiCap de 7 bilhões de parâmetros alcançou as melhores pontuações em testes cegos, com uma taxa de erro de alucinação inferior à de um modelo grande líder de 720 bilhões de parâmetros. Notavelmente, a versão mini de 3 bilhões de parâmetros chegou a superar sua contraparte de 7 bilhões de parâmetros em certas métricas.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











