Hogar
Wikipedia se asocia con empresas de inteligencia artificial para mejorar el acceso a los datos

Wikimedia Deutschland ha presentado este miércoles una nueva base de datos diseñada para mejorar el acceso de los modelos de inteligencia artificial al amplio repositorio de conocimientos de Wikipedia.
Bautizada como Wikidata Embedding Project, esta iniciativa aprovecha la tecnología de búsqueda semántica basada en vectores -que permite a los ordenadores comprender el significado y las relaciones de las palabras- aplicada a la vasta red de Wikipedia de casi 120 millones de entradas en sus plataformas hermanas.
Con compatibilidad añadida para el Protocolo de Contexto de Modelos (MCP), un marco que facilita la comunicación IA-fuente de datos, el proyecto mejora la forma en que los grandes modelos lingüísticos interactúan con la información y la recuperan a través de consultas en lenguaje natural.
La división alemana de Wikimedia encabezó este esfuerzo junto con Jina.AI, especialista en búsqueda neuronal, y DataStax, propiedad de IBM y especializada en datos de entrenamiento en tiempo real.
Aunque Wikidata lleva mucho tiempo proporcionando datos legibles por máquina de las propiedades de Wikimedia, las herramientas anteriores se limitaban a búsquedas por palabras clave y consultas SPARQL. Este sistema actualizado mejora las capacidades de generación aumentada por recuperación (RAG), lo que permite a los desarrolladores de IA anclar sus modelos en la base de conocimientos de Wikipedia verificada por los editores.
La base de datos estructura los datos con un rico contexto semántico. Por ejemplo, al buscar "científico" se obtienen listas de científicos nucleares e investigadores de Bell Labs notables, junto con traducciones multilingües, imágenes de Wikimedia y términos relacionados como "investigador" y "erudito".
Wikidata, accesible a través de Toolforge, organizará un seminario web para desarrolladores el 9 de octubre para mostrar el potencial de la plataforma.
Conecta con más de 10.000 pioneros de la tecnología y el capital riesgo en Disrupt 2025
Únase a gigantes del sector como Netflix, Box, a16z, ElevenLabs y Vinod Khosla en más de 200 sesiones repletas de estrategias de crecimiento de startups y conocimientos tecnológicos. Consiga hoy mismo su entrada anticipada: ahorre hasta 444 $ antes de que se abra el plazo de admisión general.
Conéctese con más de 10.000 pioneros de la tecnología y el capital riesgo en Disrupt 2025
Únase a gigantes del sector como Netflix, Box, a16z, ElevenLabs y Vinod Khosla en más de 200 sesiones repletas de estrategias de crecimiento de startups y conocimientos tecnológicos. Consiga hoy mismo su entrada anticipada y ahorre hasta 444 $ antes de que se abra el plazo de admisión general.
Este lanzamiento llega en un momento en el que los desarrolladores de IA buscan cada vez más fuentes de datos de primera calidad para perfeccionar sus modelos. Los sistemas de entrenamiento modernos -ahora ecosistemas intrincados en lugar de simples conjuntos de datos- siguen exigiendo información meticulosamente curada, especialmente para aplicaciones críticas de precisión. El contenido verificado de Wikipedia ofrece una clara ventaja sobre conjuntos de datos a granel como Common Crawl.
La búsqueda de datos de calidad conlleva riesgos: Anthropic propuso recientemente un acuerdo de 1.500 millones de dólares después de que los autores demandaran el uso no autorizado de sus obras para la formación.
El director del proyecto de IA de Wikidata, Philippe Saadé, destacó su independencia: "Esto demuestra que una IA potente puede prosperar más allá de los silos corporativos: abierta, colaborativa y construida para el beneficio público", declaró a la prensa.
Artículo relacionado
Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA
Para resultar realmente útil, un asistente de IA debe comprender a fondo a su usuario. Ollie, un asistente personal diseñado para la vida cotidiana, parte de la premisa de que esto no implica ceder tu
Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial
La cumbre reunirá a altos directivos de todo el mundo para abordar los retos más acuciantes de los sectores industriales a nivel global, que van desde la disrupción impulsada por la inteligencia artif
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia
Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
Recomendaciones de temas especiales relacionados
comentario (3)
0/500
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

Wikimedia Deutschland ha presentado este miércoles una nueva base de datos diseñada para mejorar el acceso de los modelos de inteligencia artificial al amplio repositorio de conocimientos de Wikipedia.
Bautizada como Wikidata Embedding Project, esta iniciativa aprovecha la tecnología de búsqueda semántica basada en vectores -que permite a los ordenadores comprender el significado y las relaciones de las palabras- aplicada a la vasta red de Wikipedia de casi 120 millones de entradas en sus plataformas hermanas.
Con compatibilidad añadida para el Protocolo de Contexto de Modelos (MCP), un marco que facilita la comunicación IA-fuente de datos, el proyecto mejora la forma en que los grandes modelos lingüísticos interactúan con la información y la recuperan a través de consultas en lenguaje natural.
La división alemana de Wikimedia encabezó este esfuerzo junto con Jina.AI, especialista en búsqueda neuronal, y DataStax, propiedad de IBM y especializada en datos de entrenamiento en tiempo real.
Aunque Wikidata lleva mucho tiempo proporcionando datos legibles por máquina de las propiedades de Wikimedia, las herramientas anteriores se limitaban a búsquedas por palabras clave y consultas SPARQL. Este sistema actualizado mejora las capacidades de generación aumentada por recuperación (RAG), lo que permite a los desarrolladores de IA anclar sus modelos en la base de conocimientos de Wikipedia verificada por los editores.
La base de datos estructura los datos con un rico contexto semántico. Por ejemplo, al buscar "científico" se obtienen listas de científicos nucleares e investigadores de Bell Labs notables, junto con traducciones multilingües, imágenes de Wikimedia y términos relacionados como "investigador" y "erudito".
Wikidata, accesible a través de Toolforge, organizará un seminario web para desarrolladores el 9 de octubre para mostrar el potencial de la plataforma.
Conecta con más de 10.000 pioneros de la tecnología y el capital riesgo en Disrupt 2025
Únase a gigantes del sector como Netflix, Box, a16z, ElevenLabs y Vinod Khosla en más de 200 sesiones repletas de estrategias de crecimiento de startups y conocimientos tecnológicos. Consiga hoy mismo su entrada anticipada: ahorre hasta 444 $ antes de que se abra el plazo de admisión general.
Conéctese con más de 10.000 pioneros de la tecnología y el capital riesgo en Disrupt 2025
Únase a gigantes del sector como Netflix, Box, a16z, ElevenLabs y Vinod Khosla en más de 200 sesiones repletas de estrategias de crecimiento de startups y conocimientos tecnológicos. Consiga hoy mismo su entrada anticipada y ahorre hasta 444 $ antes de que se abra el plazo de admisión general.
Este lanzamiento llega en un momento en el que los desarrolladores de IA buscan cada vez más fuentes de datos de primera calidad para perfeccionar sus modelos. Los sistemas de entrenamiento modernos -ahora ecosistemas intrincados en lugar de simples conjuntos de datos- siguen exigiendo información meticulosamente curada, especialmente para aplicaciones críticas de precisión. El contenido verificado de Wikipedia ofrece una clara ventaja sobre conjuntos de datos a granel como Common Crawl.
La búsqueda de datos de calidad conlleva riesgos: Anthropic propuso recientemente un acuerdo de 1.500 millones de dólares después de que los autores demandaran el uso no autorizado de sus obras para la formación.
El director del proyecto de IA de Wikidata, Philippe Saadé, destacó su independencia: "Esto demuestra que una IA potente puede prosperar más allá de los silos corporativos: abierta, colaborativa y construida para el beneficio público", declaró a la prensa.
Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA
Para resultar realmente útil, un asistente de IA debe comprender a fondo a su usuario. Ollie, un asistente personal diseñado para la vida cotidiana, parte de la premisa de que esto no implica ceder tu
Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial
La cumbre reunirá a altos directivos de todo el mundo para abordar los retos más acuciantes de los sectores industriales a nivel global, que van desde la disrupción impulsada por la inteligencia artif
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia
Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡











