Hogar
Wikipedia está dando a los desarrolladores de IA sus datos para defenderse de los raspadores de bots

La nueva estrategia de Wikipedia para gestionar el raspado de datos por IA
Wikipedia, a través de la Fundación Wikimedia, está tomando una medida proactiva para gestionar el impacto del raspado de datos por IA en sus servidores. El miércoles, anunciaron una colaboración con Kaggle, una plataforma propiedad de Google y dedicada a la ciencia de datos y el aprendizaje automático, para lanzar un conjunto de datos beta. Este conjunto de datos contiene "contenido estructurado de Wikipedia en inglés y francés," diseñado específicamente para propósitos de entrenamiento de IA.
El conjunto de datos, ahora disponible en Kaggle, ha sido creado pensando en los desarrolladores de IA, simplificando el proceso de acceso a datos de artículos legibles por máquina. Esto incluye desde resúmenes de investigación y descripciones cortas hasta enlaces de imágenes, datos de infoboxes y varias secciones de artículos. Es importante destacar que estos datos están licenciados abiertamente y no incluyen referencias ni elementos no textuales como archivos de audio, asegurando que estén optimizados para casos de uso de IA como modelado, ajuste fino y evaluación comparativa.
El enfoque de Wikimedia ofrece un formato JSON bien estructurado del contenido de Wikipedia, que esperan sea una opción más atractiva para los desarrolladores de IA en comparación con el método tradicional de raspado o análisis de texto de artículos en bruto. Esta medida responde en parte a la presión que los bots de IA han estado ejerciendo sobre los servidores de Wikipedia debido a su consumo de ancho de banda.
Ya, Wikimedia ha establecido acuerdos de intercambio de contenido con gigantes como Google y el Internet Archive. Sin embargo, la colaboración con Kaggle se espera que haga estos datos más accesibles para empresas más pequeñas y científicos de datos independientes, ampliando el alcance y la utilidad del contenido de Wikipedia.
Lo que Kaggle aporta
Brenda Flynn, líder de asociaciones de Kaggle, expresó entusiasmo por alojar los datos de Wikimedia. "Como el lugar al que la comunidad de aprendizaje automático acude por herramientas y pruebas, Kaggle está extremadamente emocionada de ser el anfitrión de los datos de la Fundación Wikimedia," afirmó. El rol de Kaggle es crucial para mantener estos datos no solo accesibles, sino también relevantes y útiles para la comunidad de aprendizaje automático.
Esta movida estratégica de Wikipedia no solo busca aliviar la carga en sus servidores, sino que también fomenta una relación más estructurada y beneficiosa con las comunidades de IA y aprendizaje automático.
Artículo relacionado
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA
Para resultar realmente útil, un asistente de IA debe comprender a fondo a su usuario. Ollie, un asistente personal diseñado para la vida cotidiana, parte de la premisa de que esto no implica ceder tu
Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial
La cumbre reunirá a altos directivos de todo el mundo para abordar los retos más acuciantes de los sectores industriales a nivel global, que van desde la disrupción impulsada por la inteligencia artif
Recomendaciones de temas especiales relacionados
comentario (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

La nueva estrategia de Wikipedia para gestionar el raspado de datos por IA
Wikipedia, a través de la Fundación Wikimedia, está tomando una medida proactiva para gestionar el impacto del raspado de datos por IA en sus servidores. El miércoles, anunciaron una colaboración con Kaggle, una plataforma propiedad de Google y dedicada a la ciencia de datos y el aprendizaje automático, para lanzar un conjunto de datos beta. Este conjunto de datos contiene "contenido estructurado de Wikipedia en inglés y francés," diseñado específicamente para propósitos de entrenamiento de IA.
El conjunto de datos, ahora disponible en Kaggle, ha sido creado pensando en los desarrolladores de IA, simplificando el proceso de acceso a datos de artículos legibles por máquina. Esto incluye desde resúmenes de investigación y descripciones cortas hasta enlaces de imágenes, datos de infoboxes y varias secciones de artículos. Es importante destacar que estos datos están licenciados abiertamente y no incluyen referencias ni elementos no textuales como archivos de audio, asegurando que estén optimizados para casos de uso de IA como modelado, ajuste fino y evaluación comparativa.
El enfoque de Wikimedia ofrece un formato JSON bien estructurado del contenido de Wikipedia, que esperan sea una opción más atractiva para los desarrolladores de IA en comparación con el método tradicional de raspado o análisis de texto de artículos en bruto. Esta medida responde en parte a la presión que los bots de IA han estado ejerciendo sobre los servidores de Wikipedia debido a su consumo de ancho de banda.
Ya, Wikimedia ha establecido acuerdos de intercambio de contenido con gigantes como Google y el Internet Archive. Sin embargo, la colaboración con Kaggle se espera que haga estos datos más accesibles para empresas más pequeñas y científicos de datos independientes, ampliando el alcance y la utilidad del contenido de Wikipedia.
Lo que Kaggle aporta
Brenda Flynn, líder de asociaciones de Kaggle, expresó entusiasmo por alojar los datos de Wikimedia. "Como el lugar al que la comunidad de aprendizaje automático acude por herramientas y pruebas, Kaggle está extremadamente emocionada de ser el anfitrión de los datos de la Fundación Wikimedia," afirmó. El rol de Kaggle es crucial para mantener estos datos no solo accesibles, sino también relevantes y útiles para la comunidad de aprendizaje automático.
Esta movida estratégica de Wikipedia no solo busca aliviar la carga en sus servidores, sino que también fomenta una relación más estructurada y beneficiosa con las comunidades de IA y aprendizaje automático.
Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA
Para resultar realmente útil, un asistente de IA debe comprender a fondo a su usuario. Ollie, un asistente personal diseñado para la vida cotidiana, parte de la premisa de que esto no implica ceder tu
Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial
La cumbre reunirá a altos directivos de todo el mundo para abordar los retos más acuciantes de los sectores industriales a nivel global, que van desde la disrupción impulsada por la inteligencia artif
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️











