Дом
Википедия предоставляет разработчикам искусственного интеллекта свои данные для отрыва от скребков бота

Новая стратегия Википедии по управлению сбором данных для ИИ
Википедия, через Фонд Викимедиа, предпринимает активные шаги для управления влиянием сбора данных для ИИ на свои серверы. В среду они объявили о сотрудничестве с Kaggle, платформой, принадлежащей Google и посвященной науке о данных и машинному обучению, для запуска бета-версии набора данных. Этот набор данных содержит «структурированный контент Википедии на английском и французском языках», специально адаптированный для целей обучения ИИ.
Набор данных, теперь доступный на Kaggle, создан с учетом потребностей разработчиков ИИ, упрощая процесс доступа к машиночитаемым данным статей. Это включает в себя всё: от исследовательских сводок и кратких описаний до ссылок на изображения, данных инфобоксов и различных разделов статей. Важно, что эти данные имеют открытую лицензию и не включают ссылки или нетекстовые элементы, такие как аудиофайлы, что оптимизировано для использования в ИИ, таких как моделирование, тонкая настройка и тестирование.
Подход Викимедиа предлагает хорошо структурированный JSON-формат контента Википедии, который, как они надеются, станет более привлекательным вариантом для разработчиков ИИ по сравнению с традиционным методом сбора или парсинга необработанного текста статей. Этот шаг частично является ответом на нагрузку, которую боты ИИ создают на серверах Википедии из-за потребления пропускной способности.
Уже сейчас Викимедиа заключила соглашения о совместном использовании контента с такими гигантами, как Google и Internet Archive. Однако партнерство с Kaggle, как ожидается, сделает эти данные более доступными для небольших компаний и независимых ученых-данных, расширяя охват и полезность контента Википедии.
Что Kaggle приносит в этот процесс
Бренда Флинн, руководитель партнерств Kaggle, выразила энтузиазм по поводу размещения данных Викимедиа. «Как место, куда сообщество машинного обучения приходит за инструментами и тестами, Kaggle чрезвычайно взволнован тем, что стал хостом для данных Фонда Викимедиа», — заявила она. Роль Kaggle имеет решающее значение для того, чтобы эти данные оставались не только доступными, но также актуальными и полезными для сообщества машинного обучения.
Этот стратегический шаг Википедии направлен не только на снижение нагрузки на её серверы, но и на развитие более структурированных и взаимовыгодных отношений с сообществами ИИ и машинного обучения.
Связанная статья
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Рекомендации по связанным специальным темам
Комментарии (3)
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

Новая стратегия Википедии по управлению сбором данных для ИИ
Википедия, через Фонд Викимедиа, предпринимает активные шаги для управления влиянием сбора данных для ИИ на свои серверы. В среду они объявили о сотрудничестве с Kaggle, платформой, принадлежащей Google и посвященной науке о данных и машинному обучению, для запуска бета-версии набора данных. Этот набор данных содержит «структурированный контент Википедии на английском и французском языках», специально адаптированный для целей обучения ИИ.
Набор данных, теперь доступный на Kaggle, создан с учетом потребностей разработчиков ИИ, упрощая процесс доступа к машиночитаемым данным статей. Это включает в себя всё: от исследовательских сводок и кратких описаний до ссылок на изображения, данных инфобоксов и различных разделов статей. Важно, что эти данные имеют открытую лицензию и не включают ссылки или нетекстовые элементы, такие как аудиофайлы, что оптимизировано для использования в ИИ, таких как моделирование, тонкая настройка и тестирование.
Подход Викимедиа предлагает хорошо структурированный JSON-формат контента Википедии, который, как они надеются, станет более привлекательным вариантом для разработчиков ИИ по сравнению с традиционным методом сбора или парсинга необработанного текста статей. Этот шаг частично является ответом на нагрузку, которую боты ИИ создают на серверах Википедии из-за потребления пропускной способности.
Уже сейчас Викимедиа заключила соглашения о совместном использовании контента с такими гигантами, как Google и Internet Archive. Однако партнерство с Kaggle, как ожидается, сделает эти данные более доступными для небольших компаний и независимых ученых-данных, расширяя охват и полезность контента Википедии.
Что Kaggle приносит в этот процесс
Бренда Флинн, руководитель партнерств Kaggle, выразила энтузиазм по поводу размещения данных Викимедиа. «Как место, куда сообщество машинного обучения приходит за инструментами и тестами, Kaggle чрезвычайно взволнован тем, что стал хостом для данных Фонда Викимедиа», — заявила она. Роль Kaggle имеет решающее значение для того, чтобы эти данные оставались не только доступными, но также актуальными и полезными для сообщества машинного обучения.
Этот стратегический шаг Википедии направлен не только на снижение нагрузки на её серверы, но и на развитие более структурированных и взаимовыгодных отношений с сообществами ИИ и машинного обучения.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️











