Дом
Википедия сотрудничает с компаниями, занимающимися разработкой искусственного интеллекта, для расширения доступа к данным

В эту среду Wikimedia Deutschland представила новую базу данных, призванную расширить доступ моделей искусственного интеллекта к обширному хранилищу знаний Википедии.
Эта инициатива, получившая название Wikidata Embedding Project, использует технологию векторного семантического поиска, позволяющую компьютерам улавливать значения слов и взаимосвязи между ними и применяемую к обширной сети Википедии, насчитывающей около 120 миллионов записей на родственных платформах.
Благодаря совместимости с протоколом Model Context Protocol (MCP) - структурой, облегчающей взаимодействие ИИ с источниками данных, - проект улучшает взаимодействие больших языковых моделей с информацией и ее извлечение через запросы на естественном языке.
Немецкое подразделение Wikimedia возглавило эту работу вместе с Jina.AI, специалистом по нейронному поиску, и DataStax, принадлежащей IBM, которая специализируется на обучающих данных в реальном времени.
Хотя Викиданные уже давно предоставляют машиночитаемые данные из объектов Викимедиа, предыдущие инструменты были ограничены поиском по ключевым словам и SPARQL-запросами. Модернизированная система расширяет возможности генерации с расширенным поиском (RAG), позволяя разработчикам ИИ привязывать свои модели к проверенной редакторами базе знаний Википедии.
База данных структурирует данные с богатым семантическим контекстом. Например, поиск по слову "ученый" выдает списки выдающихся ученых-ядерщиков и исследователей Bell Labs, а также многоязычные переводы, курируемые изображения Викимедиа и связанные с ними термины, такие как "исследователь" и "ученый".
Доступная через Toolforge, Wikidata проведет вебинар для разработчиков 9 октября, чтобы продемонстрировать потенциал платформы.
Общение с 10 000+ пионерами в области технологий и венчурного инвестирования на Disrupt 2025
Присоединяйтесь к таким гигантам индустрии, как Netflix, Box, a16z, ElevenLabs и Vinod Khosla, которые примут участие в 200+ сессиях, посвященных стратегиям роста стартапов и технологиям. Успейте купить билет по акции "ранняя заявка" уже сегодня - сэкономьте до 444 долларов до открытия общего доступа.
Общение с 10 000+ пионерами в области технологий и венчурного инвестирования на Disrupt 2025
Присоединяйтесь к таким гигантам индустрии, как Netflix, Box, a16z, ElevenLabs и Vinod Khosla, на 200+ сессиях, посвященных стратегиям роста стартапов и технологиям. Успейте купить билет по акции "ранняя заявка" уже сегодня - сэкономьте до 444 долларов до открытия общего доступа.
Этот запуск происходит на фоне того, что разработчики ИИ все чаще обращаются к премиальным источникам данных для совершенствования моделей. Современные системы обучения - теперь это сложные экосистемы, а не простые наборы данных - по-прежнему требуют тщательно подобранной информации, особенно для приложений, критичных к точности. Контент Википедии, проверенный на факты, дает значительное преимущество перед такими массовыми наборами данных, как Common Crawl.
Поиск качественных данных сопряжен с риском: Недавно компания Anthropic предложила урегулировать вопрос на сумму 1,5 миллиарда долларов после того, как авторы подали в суд на несанкционированное использование их работ для обучения.
Руководитель проекта ИИ в Викиданных Филипп Сааде подчеркнул свою независимость: "Это доказывает, что мощный искусственный интеллект может процветать вне корпоративных силосов - открытый, совместный и созданный для общественной пользы", - сказал он журналистам.
Связанная статья
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Рекомендации по связанным специальным темам
Комментарии (3)
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

В эту среду Wikimedia Deutschland представила новую базу данных, призванную расширить доступ моделей искусственного интеллекта к обширному хранилищу знаний Википедии.
Эта инициатива, получившая название Wikidata Embedding Project, использует технологию векторного семантического поиска, позволяющую компьютерам улавливать значения слов и взаимосвязи между ними и применяемую к обширной сети Википедии, насчитывающей около 120 миллионов записей на родственных платформах.
Благодаря совместимости с протоколом Model Context Protocol (MCP) - структурой, облегчающей взаимодействие ИИ с источниками данных, - проект улучшает взаимодействие больших языковых моделей с информацией и ее извлечение через запросы на естественном языке.
Немецкое подразделение Wikimedia возглавило эту работу вместе с Jina.AI, специалистом по нейронному поиску, и DataStax, принадлежащей IBM, которая специализируется на обучающих данных в реальном времени.
Хотя Викиданные уже давно предоставляют машиночитаемые данные из объектов Викимедиа, предыдущие инструменты были ограничены поиском по ключевым словам и SPARQL-запросами. Модернизированная система расширяет возможности генерации с расширенным поиском (RAG), позволяя разработчикам ИИ привязывать свои модели к проверенной редакторами базе знаний Википедии.
База данных структурирует данные с богатым семантическим контекстом. Например, поиск по слову "ученый" выдает списки выдающихся ученых-ядерщиков и исследователей Bell Labs, а также многоязычные переводы, курируемые изображения Викимедиа и связанные с ними термины, такие как "исследователь" и "ученый".
Доступная через Toolforge, Wikidata проведет вебинар для разработчиков 9 октября, чтобы продемонстрировать потенциал платформы.
Общение с 10 000+ пионерами в области технологий и венчурного инвестирования на Disrupt 2025
Присоединяйтесь к таким гигантам индустрии, как Netflix, Box, a16z, ElevenLabs и Vinod Khosla, которые примут участие в 200+ сессиях, посвященных стратегиям роста стартапов и технологиям. Успейте купить билет по акции "ранняя заявка" уже сегодня - сэкономьте до 444 долларов до открытия общего доступа.
Общение с 10 000+ пионерами в области технологий и венчурного инвестирования на Disrupt 2025
Присоединяйтесь к таким гигантам индустрии, как Netflix, Box, a16z, ElevenLabs и Vinod Khosla, на 200+ сессиях, посвященных стратегиям роста стартапов и технологиям. Успейте купить билет по акции "ранняя заявка" уже сегодня - сэкономьте до 444 долларов до открытия общего доступа.
Этот запуск происходит на фоне того, что разработчики ИИ все чаще обращаются к премиальным источникам данных для совершенствования моделей. Современные системы обучения - теперь это сложные экосистемы, а не простые наборы данных - по-прежнему требуют тщательно подобранной информации, особенно для приложений, критичных к точности. Контент Википедии, проверенный на факты, дает значительное преимущество перед такими массовыми наборами данных, как Common Crawl.
Поиск качественных данных сопряжен с риском: Недавно компания Anthropic предложила урегулировать вопрос на сумму 1,5 миллиарда долларов после того, как авторы подали в суд на несанкционированное использование их работ для обучения.
Руководитель проекта ИИ в Викиданных Филипп Сааде подчеркнул свою независимость: "Это доказывает, что мощный искусственный интеллект может процветать вне корпоративных силосов - открытый, совместный и созданный для общественной пользы", - сказал он журналистам.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡











