Lar
O Google aprimora a pesquisa de arquivos da API Gemini com recursos avançados de RAG multimodal
O Google lançou uma atualização significativa no recurso de busca de arquivos da API Gemini, oferecendo aos desenvolvedores recursos aprimorados de geração aumentada por recuperação multimodal (RAG). Essa atualização vai além da recuperação tradicional apenas de texto, permitindo que a IA interprete imagens e se integre profundamente a documentos complexos — um passo fundamental para a precisão da IA em nível corporativo na recuperação de informações.
Tecnicamente, a nova função de pesquisa de arquivos utiliza o modelo Gemini Embedding2. Ao contrário dos sistemas anteriores, limitados à pesquisa por vetores de texto, o sistema atualizado apresenta uma incorporação multimodal unificada, permitindo que ele reconheça e processe conteúdo visual em PDFs, documentos e vários tipos de imagens. Isso significa que os desenvolvedores não precisam mais criar bancos de dados vetoriais complexos ou sistemas de segmentação de documentos; eles podem obter um fluxo de trabalho RAG completo — desde o upload de dados até a recuperação de informações — diretamente na API do Gemini.

Na prática, esse avanço resolve um problema comum: os sistemas RAG tradicionais muitas vezes não conseguem processar conteúdo não textual. Anteriormente, gráficos, diagramas de projeto ou capturas de tela de produtos em documentos eram pontos cegos para a IA, fazendo com que contextos essenciais fossem perdidos. Agora, a API do Gemini compreende nativamente esses elementos visuais. Por exemplo, quando uma empresa carrega um PDF com diagramas de arquitetura técnica ou gráficos de tendências de vendas, a IA pode combinar os dados dos gráficos com descrições de texto para fornecer insights precisos, aumentando significativamente a utilidade dos bots de atendimento ao cliente e dos sistemas de análise de documentos.
Para melhorar o gerenciamento de grandes bases de conhecimento, o Google adicionou filtragem personalizada de metadados. Os desenvolvedores podem marcar arquivos por departamento, data ou categoria e, durante a recuperação, filtrar informações irrelevantes usando condições predefinidas, garantindo que as respostas geradas pela IA sejam mais focadas.
Além disso, para atender às preocupações sobre a rastreabilidade das informações, a API Gemini agora oferece suporte a citações no nível da página. Ao gerar respostas, a IA indica claramente o número específico da página para cada informação, em vez de apenas fazer referência ao arquivo inteiro. Essa transparência ajuda os usuários a verificar rapidamente a precisão e facilita uma leitura mais aprofundada.
O recurso aprimorado de busca de arquivos já está disponível para desenvolvedores em todo o mundo. Os usuários podem acessá-lo pelo Google AI Studio ou pela plataforma Google Cloud para experimentar a conveniência no desenvolvimento e os ganhos de eficiência oferecidos pelo RAG multimodal.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
O Google lançou uma atualização significativa no recurso de busca de arquivos da API Gemini, oferecendo aos desenvolvedores recursos aprimorados de geração aumentada por recuperação multimodal (RAG). Essa atualização vai além da recuperação tradicional apenas de texto, permitindo que a IA interprete imagens e se integre profundamente a documentos complexos — um passo fundamental para a precisão da IA em nível corporativo na recuperação de informações.
Tecnicamente, a nova função de pesquisa de arquivos utiliza o modelo Gemini Embedding2. Ao contrário dos sistemas anteriores, limitados à pesquisa por vetores de texto, o sistema atualizado apresenta uma incorporação multimodal unificada, permitindo que ele reconheça e processe conteúdo visual em PDFs, documentos e vários tipos de imagens. Isso significa que os desenvolvedores não precisam mais criar bancos de dados vetoriais complexos ou sistemas de segmentação de documentos; eles podem obter um fluxo de trabalho RAG completo — desde o upload de dados até a recuperação de informações — diretamente na API do Gemini.

Na prática, esse avanço resolve um problema comum: os sistemas RAG tradicionais muitas vezes não conseguem processar conteúdo não textual. Anteriormente, gráficos, diagramas de projeto ou capturas de tela de produtos em documentos eram pontos cegos para a IA, fazendo com que contextos essenciais fossem perdidos. Agora, a API do Gemini compreende nativamente esses elementos visuais. Por exemplo, quando uma empresa carrega um PDF com diagramas de arquitetura técnica ou gráficos de tendências de vendas, a IA pode combinar os dados dos gráficos com descrições de texto para fornecer insights precisos, aumentando significativamente a utilidade dos bots de atendimento ao cliente e dos sistemas de análise de documentos.
Para melhorar o gerenciamento de grandes bases de conhecimento, o Google adicionou filtragem personalizada de metadados. Os desenvolvedores podem marcar arquivos por departamento, data ou categoria e, durante a recuperação, filtrar informações irrelevantes usando condições predefinidas, garantindo que as respostas geradas pela IA sejam mais focadas.
Além disso, para atender às preocupações sobre a rastreabilidade das informações, a API Gemini agora oferece suporte a citações no nível da página. Ao gerar respostas, a IA indica claramente o número específico da página para cada informação, em vez de apenas fazer referência ao arquivo inteiro. Essa transparência ajuda os usuários a verificar rapidamente a precisão e facilita uma leitura mais aprofundada.
O recurso aprimorado de busca de arquivos já está disponível para desenvolvedores em todo o mundo. Os usuários podem acessá-lo pelo Google AI Studio ou pela plataforma Google Cloud para experimentar a conveniência no desenvolvimento e os ganhos de eficiência oferecidos pelo RAG multimodal.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











