Maison
Google améliore la recherche de fichiers via l'API Gemini grâce à des fonctionnalités RAG multimodales avancées
Google a déployé une mise à jour majeure de la fonctionnalité de recherche de fichiers de son API Gemini, offrant ainsi aux développeurs des capacités améliorées de génération augmentée par la recherche multimodale (RAG). Cette mise à jour va au-delà de la recherche traditionnelle limitée au texte, permettant à l’IA d’interpréter des images et de s’intégrer en profondeur à des documents complexes — une avancée majeure pour la précision de l’IA en matière de recherche d’informations au niveau de l’entreprise.
D’un point de vue technique, la nouvelle fonction de recherche de fichiers s’appuie sur le modèle Gemini Embedding2. Contrairement aux systèmes antérieurs limités à la recherche vectorielle de texte, le système mis à jour dispose d’un encodage multimodal unifié, ce qui lui permet de reconnaître et de traiter le contenu visuel présent dans les PDF, les documents et divers types d’images. Cela signifie que les développeurs n’ont plus besoin de créer des bases de données vectorielles complexes ni des systèmes de segmentation de documents ; ils peuvent mettre en place un workflow RAG complet — du téléchargement des données à la recherche d’informations — directement au sein de l’API Gemini.

En pratique, cette avancée résout un problème courant : les systèmes RAG traditionnels ne parviennent souvent pas à traiter les contenus non textuels. Auparavant, les graphiques, les schémas de conception ou les captures d’écran de produits présents dans les documents constituaient des angles morts pour l’IA, ce qui entraînait la perte d’éléments contextuels essentiels. Désormais, l’API Gemini comprend nativement ces éléments visuels. Par exemple, lorsqu’une entreprise télécharge un PDF contenant des schémas d’architecture technique ou des graphiques de tendances de ventes, l’IA peut combiner les données des graphiques avec les descriptions textuelles pour fournir des informations précises, ce qui améliore considérablement l’utilité des bots de service client et des systèmes d’analyse de documents.
Pour améliorer la gestion des bases de connaissances volumineuses, Google a ajouté un filtrage personnalisé des métadonnées. Les développeurs peuvent baliser les fichiers par service, date ou catégorie, puis, lors de la recherche, filtrer les informations non pertinentes à l’aide de conditions prédéfinies, garantissant ainsi que les réponses générées par l’IA soient plus ciblées.
De plus, pour répondre aux préoccupations concernant la traçabilité des informations, l’API Gemini prend désormais en charge les citations au niveau de la page. Lors de la génération de réponses, l’IA indique clairement le numéro de page spécifique pour chaque information, plutôt que de se contenter de faire référence à l’ensemble du fichier. Cette transparence aide les utilisateurs à vérifier rapidement l’exactitude des informations et facilite une lecture plus approfondie.
La fonctionnalité améliorée de recherche de fichiers est désormais accessible aux développeurs du monde entier. Les utilisateurs peuvent y accéder via Google AI Studio ou la plateforme Google Cloud pour profiter de la facilité de développement et des gains d’efficacité offerts par le RAG multimodal.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Google a déployé une mise à jour majeure de la fonctionnalité de recherche de fichiers de son API Gemini, offrant ainsi aux développeurs des capacités améliorées de génération augmentée par la recherche multimodale (RAG). Cette mise à jour va au-delà de la recherche traditionnelle limitée au texte, permettant à l’IA d’interpréter des images et de s’intégrer en profondeur à des documents complexes — une avancée majeure pour la précision de l’IA en matière de recherche d’informations au niveau de l’entreprise.
D’un point de vue technique, la nouvelle fonction de recherche de fichiers s’appuie sur le modèle Gemini Embedding2. Contrairement aux systèmes antérieurs limités à la recherche vectorielle de texte, le système mis à jour dispose d’un encodage multimodal unifié, ce qui lui permet de reconnaître et de traiter le contenu visuel présent dans les PDF, les documents et divers types d’images. Cela signifie que les développeurs n’ont plus besoin de créer des bases de données vectorielles complexes ni des systèmes de segmentation de documents ; ils peuvent mettre en place un workflow RAG complet — du téléchargement des données à la recherche d’informations — directement au sein de l’API Gemini.

En pratique, cette avancée résout un problème courant : les systèmes RAG traditionnels ne parviennent souvent pas à traiter les contenus non textuels. Auparavant, les graphiques, les schémas de conception ou les captures d’écran de produits présents dans les documents constituaient des angles morts pour l’IA, ce qui entraînait la perte d’éléments contextuels essentiels. Désormais, l’API Gemini comprend nativement ces éléments visuels. Par exemple, lorsqu’une entreprise télécharge un PDF contenant des schémas d’architecture technique ou des graphiques de tendances de ventes, l’IA peut combiner les données des graphiques avec les descriptions textuelles pour fournir des informations précises, ce qui améliore considérablement l’utilité des bots de service client et des systèmes d’analyse de documents.
Pour améliorer la gestion des bases de connaissances volumineuses, Google a ajouté un filtrage personnalisé des métadonnées. Les développeurs peuvent baliser les fichiers par service, date ou catégorie, puis, lors de la recherche, filtrer les informations non pertinentes à l’aide de conditions prédéfinies, garantissant ainsi que les réponses générées par l’IA soient plus ciblées.
De plus, pour répondre aux préoccupations concernant la traçabilité des informations, l’API Gemini prend désormais en charge les citations au niveau de la page. Lors de la génération de réponses, l’IA indique clairement le numéro de page spécifique pour chaque information, plutôt que de se contenter de faire référence à l’ensemble du fichier. Cette transparence aide les utilisateurs à vérifier rapidement l’exactitude des informations et facilite une lecture plus approfondie.
La fonctionnalité améliorée de recherche de fichiers est désormais accessible aux développeurs du monde entier. Les utilisateurs peuvent y accéder via Google AI Studio ou la plateforme Google Cloud pour profiter de la facilité de développement et des gains d’efficacité offerts par le RAG multimodal.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











