Maison
Wikipédia s'associe à des entreprises spécialisées dans l'IA pour améliorer l'accès aux données

Wikimedia Deutschland a dévoilé ce mercredi une nouvelle base de données conçue pour améliorer l'accès des modèles d'intelligence artificielle au vaste référentiel de connaissances de Wikipédia.
Baptisée Wikidata Embedding Project, cette initiative s'appuie sur la technologie de recherche sémantique vectorielle - qui permet aux ordinateurs de saisir le sens des mots et leurs relations - appliquée au vaste réseau de Wikipédia, qui compte près de 120 millions d'entrées sur l'ensemble de ses plates-formes.
Grâce à une compatibilité accrue avec le protocole Model Context Protocol (MCP), un cadre facilitant la communication entre l'IA et les sources de données, le projet améliore la manière dont les grands modèles de langage interagissent avec les informations et les récupèrent par le biais de requêtes en langage naturel.
La division allemande de Wikimedia a mené cet effort aux côtés de Jina.AI, un spécialiste de la recherche neuronale, et de DataStax, propriété d'IBM, qui se spécialise dans les données d'entraînement en temps réel.
Si Wikidata fournit depuis longtemps des données lisibles par machine provenant des propriétés de Wikimedia, les outils précédents se limitaient à des recherches par mots clés et à des requêtes SPARQL. Ce système amélioré renforce les capacités de génération augmentée par récupération (RAG), permettant aux développeurs d'IA d'ancrer leurs modèles dans la base de connaissances de Wikipédia vérifiée par les éditeurs.
La base de données structure les données avec un contexte sémantique riche. Par exemple, une recherche sur "scientist" renvoie à des listes de scientifiques nucléaires et de chercheurs des Bell Labs, ainsi qu'à des traductions multilingues, à des images Wikimedia et à des termes apparentés tels que "researcher" et "scholar".
Accessible via Toolforge, Wikidata organisera un webinaire à l'intention des développeurs le 9 octobre pour présenter le potentiel de la plateforme.
Rencontrez plus de 10 000 pionniers de la technologie et du capital-risque à Disrupt 2025
Rejoignez des géants de l'industrie tels que Netflix, Box, a16z, ElevenLabs et Vinod Khosla à travers plus de 200 sessions remplies de stratégies de croissance de startups et d'idées technologiques. Réservez dès aujourd'hui votre billet à tarif préférentiel et économisez jusqu'à 444 $ avant l'ouverture de l'admission générale.
Entrez en contact avec plus de 10 000 pionniers de la technologie et du capital-risque à Disrupt 2025
Rejoignez des géants de l'industrie tels que Netflix, Box, a16z, ElevenLabs et Vinod Khosla à travers plus de 200 sessions remplies de stratégies de croissance de startups et d'idées technologiques. Réservez dès aujourd'hui votre billet à tarif préférentiel et économisez jusqu'à 444 $ avant l'ouverture de l'admission générale.
Ce lancement intervient alors que les développeurs d'IA recherchent de plus en plus des sources de données de premier ordre pour affiner leurs modèles. Les systèmes d'apprentissage modernes, qui sont désormais des écosystèmes complexes plutôt que de simples ensembles de données, exigent toujours des informations méticuleusement traitées, en particulier pour les applications critiques en termes de précision. Le contenu vérifié de Wikipédia offre un avantage certain par rapport à des ensembles de données en vrac tels que Common Crawl.
La recherche de données de qualité comporte des risques : Anthropic a récemment proposé un règlement de 1,5 milliard de dollars à la suite d'une action en justice intentée par des auteurs pour utilisation non autorisée de leurs œuvres à des fins de formation.
Philippe Saadé, chef du projet d'IA de Wikidata, a souligné son indépendance : "Cela prouve qu'une IA puissante peut prospérer au-delà des silos des entreprises - ouverte, collaborative et construite pour le bénéfice du public", a-t-il déclaré à la presse.
Article connexe
Ollie mise sur la protection de la vie privée pour remporter la course aux assistants IA
Pour être véritablement utile, un assistant IA doit comprendre en profondeur son utilisateur. Ollie, un assistant personnel conçu pour la vie quotidienne, part du principe que cela ne nécessite pas de
Comment « AI LIVE : Londres » abordera les thèmes de l'IA et de l'automatisation industrielle
Ce sommet réunira des dirigeants de haut niveau venus du monde entier afin d'aborder les défis urgents auxquels sont confrontés les secteurs d'activité à l'échelle mondiale, allant des bouleversements
Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie
Anthropic a dévoilé une série de nouvelles fonctionnalités de chatbot mardi, visant à fournir un support automatisé aux cabinets d’avocats. Ces améliorations étendent Claude for Legal, la plateforme spécifique aux cabinets lancée plus tôt cette année
Recommandations de sujets spéciaux liés
commentaires (3)
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

Wikimedia Deutschland a dévoilé ce mercredi une nouvelle base de données conçue pour améliorer l'accès des modèles d'intelligence artificielle au vaste référentiel de connaissances de Wikipédia.
Baptisée Wikidata Embedding Project, cette initiative s'appuie sur la technologie de recherche sémantique vectorielle - qui permet aux ordinateurs de saisir le sens des mots et leurs relations - appliquée au vaste réseau de Wikipédia, qui compte près de 120 millions d'entrées sur l'ensemble de ses plates-formes.
Grâce à une compatibilité accrue avec le protocole Model Context Protocol (MCP), un cadre facilitant la communication entre l'IA et les sources de données, le projet améliore la manière dont les grands modèles de langage interagissent avec les informations et les récupèrent par le biais de requêtes en langage naturel.
La division allemande de Wikimedia a mené cet effort aux côtés de Jina.AI, un spécialiste de la recherche neuronale, et de DataStax, propriété d'IBM, qui se spécialise dans les données d'entraînement en temps réel.
Si Wikidata fournit depuis longtemps des données lisibles par machine provenant des propriétés de Wikimedia, les outils précédents se limitaient à des recherches par mots clés et à des requêtes SPARQL. Ce système amélioré renforce les capacités de génération augmentée par récupération (RAG), permettant aux développeurs d'IA d'ancrer leurs modèles dans la base de connaissances de Wikipédia vérifiée par les éditeurs.
La base de données structure les données avec un contexte sémantique riche. Par exemple, une recherche sur "scientist" renvoie à des listes de scientifiques nucléaires et de chercheurs des Bell Labs, ainsi qu'à des traductions multilingues, à des images Wikimedia et à des termes apparentés tels que "researcher" et "scholar".
Accessible via Toolforge, Wikidata organisera un webinaire à l'intention des développeurs le 9 octobre pour présenter le potentiel de la plateforme.
Rencontrez plus de 10 000 pionniers de la technologie et du capital-risque à Disrupt 2025
Rejoignez des géants de l'industrie tels que Netflix, Box, a16z, ElevenLabs et Vinod Khosla à travers plus de 200 sessions remplies de stratégies de croissance de startups et d'idées technologiques. Réservez dès aujourd'hui votre billet à tarif préférentiel et économisez jusqu'à 444 $ avant l'ouverture de l'admission générale.
Entrez en contact avec plus de 10 000 pionniers de la technologie et du capital-risque à Disrupt 2025
Rejoignez des géants de l'industrie tels que Netflix, Box, a16z, ElevenLabs et Vinod Khosla à travers plus de 200 sessions remplies de stratégies de croissance de startups et d'idées technologiques. Réservez dès aujourd'hui votre billet à tarif préférentiel et économisez jusqu'à 444 $ avant l'ouverture de l'admission générale.
Ce lancement intervient alors que les développeurs d'IA recherchent de plus en plus des sources de données de premier ordre pour affiner leurs modèles. Les systèmes d'apprentissage modernes, qui sont désormais des écosystèmes complexes plutôt que de simples ensembles de données, exigent toujours des informations méticuleusement traitées, en particulier pour les applications critiques en termes de précision. Le contenu vérifié de Wikipédia offre un avantage certain par rapport à des ensembles de données en vrac tels que Common Crawl.
La recherche de données de qualité comporte des risques : Anthropic a récemment proposé un règlement de 1,5 milliard de dollars à la suite d'une action en justice intentée par des auteurs pour utilisation non autorisée de leurs œuvres à des fins de formation.
Philippe Saadé, chef du projet d'IA de Wikidata, a souligné son indépendance : "Cela prouve qu'une IA puissante peut prospérer au-delà des silos des entreprises - ouverte, collaborative et construite pour le bénéfice du public", a-t-il déclaré à la presse.
Ollie mise sur la protection de la vie privée pour remporter la course aux assistants IA
Pour être véritablement utile, un assistant IA doit comprendre en profondeur son utilisateur. Ollie, un assistant personnel conçu pour la vie quotidienne, part du principe que cela ne nécessite pas de
Comment « AI LIVE : Londres » abordera les thèmes de l'IA et de l'automatisation industrielle
Ce sommet réunira des dirigeants de haut niveau venus du monde entier afin d'aborder les défis urgents auxquels sont confrontés les secteurs d'activité à l'échelle mondiale, allant des bouleversements
Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie
Anthropic a dévoilé une série de nouvelles fonctionnalités de chatbot mardi, visant à fournir un support automatisé aux cabinets d’avocats. Ces améliorations étendent Claude for Legal, la plateforme spécifique aux cabinets lancée plus tôt cette année
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡











