ウィキペディア、データアクセス強化のためAI企業と提携

ウィキメディア・ドイチュランドは今週水曜日、AIモデルによるウィキペディアの膨大な知識リポジトリへのアクセスを強化するための新しいデータベースを発表した。
Wikidata Embedding Projectと名付けられたこのイニシアチブは、ベクトルベースのセマンティック検索技術を活用し、コンピュータが単語の意味や関係を把握できるようにするもので、ウィキペディアの姉妹プラットフォームにまたがる約1億2千万項目の膨大なネットワークに適用されている。
AIとデータソースの通信を促進するフレームワークであるモデルコンテキストプロトコル(MCP)の互換性が追加されたことで、このプロジェクトは、大規模な言語モデルが自然言語クエリを通じてどのように対話し、情報を取得するかを改善する。
ウィキメディアのドイツ部門は、ニューラル検索のスペシャリストであるJina.AIや、リアルタイムのトレーニングデータを専門とするIBM傘下のDataStaxとともに、この取り組みの先頭に立った。
ウィキデータは長い間、ウィキメディアの資産から機械可読データを提供してきたが、以前のツールはキーワード検索とSPARQLクエリに限られていた。このアップグレードされたシステムは、検索拡張生成(RAG)機能を強化し、AI開発者がウィキペディアの編集者によって検証された知識ベースにモデルを固定できるようにする。
このデータベースは、豊富な意味的文脈を持つデータを構造化する。例えば、"scientist "を検索すると、多言語翻訳、キュレーションされたウィキメディアの画像、"researchcher "や "scholar "といった関連用語とともに、著名な原子力科学者やベル研究所の研究者のリストが返される。
Toolforgeからアクセスできるウィキデータは、10月9日に開発者向けウェビナーを開催し、このプラットフォームの可能性を紹介する。
Disrupt 2025で10,000人以上のテック企業やVCのパイオニアとつながろう
Netflix、Box、a16z、ElevenLabs、Vinod Khoslaといった業界の巨人たちが、スタートアップの成長戦略や技術的洞察を満載した200以上のセッションに参加します。早割チケットは、一般入場開始前の今なら最大444ドルお得です。
Disrupt 2025で10,000人以上のテック企業やVCのパイオニアとつながろう
Netflix、Box、a16z、ElevenLabs、Vinod Khoslaといった業界の巨人たちが、スタートアップの成長戦略や技術的洞察を満載した200以上のセッションに参加します。一般入場が開始される前に、最大444ドルお得な早割チケットを今すぐ確保しよう。
AI開発者がモデル改良のためにプレミアム・データソースを求める傾向が強まる中、今回の発表が実現した。現代の学習システムは、単純なデータセットではなく、複雑なエコシステムとなっているが、特に精度が重要なアプリケーションでは、細心の注意を払ってキュレーションされた情報が要求される。ウィキペディアのファクトチェックされたコンテンツは、コモン・クロールのような大量のデータセットよりもはるかに優れている。
質の高いデータの追求にはリスクが伴う:Anthropicは最近、トレーニングのための著作物の無断使用について著者から訴えられ、15億ドルの和解を提案した。
ウィキデータのAIプロジェクトリーダーであるフィリップ・サーデは、その独立性を強調した:「これは、強力なAIが企業のサイロを越えて繁栄できることを証明するもので、オープンで協力的、そして公共の利益のために構築されたものです」と彼は報道陣に語った。
関連記事
オリー社、AIアシスタント競争で優位に立つためプライバシー重視を掲げる
真に役立つAIアシスタントであるためには、ユーザーを深く理解する必要があります。日常生活向けに設計されたパーソナルアシスタント「Ollie」は、そのためにデータを明け渡したり、プライバシーを犠牲にしたりする必要はないという前提で動作します。一部のエンタープライズ向けAIツールにはデータプライバシー保護措置が講じられていますが、OllieはSOC 2準拠を達成した、一般家庭向けのAIサービスとしては
「AI LIVE: London」がAIと産業オートメーションをどのように掘り下げるか
このサミットには、世界中から経営幹部が集まり、AIによる変革から経済の変動性に至るまで、世界の産業が直面する喫緊の課題について議論します。「AI LIVE: The London Summit」では、「テクノロジー+人間の目的」をテーマに、2,000名を超える国際的なリーダーが一堂に会し、人工知能の新たな時代について検討を行います。BizClik傘下の『AI Magazine』は、「AI LIVE
Anthropic、AI法テック市場に参入、競争激化
Anthropicは火曜日、法律実務に自動化されたサポートを提供することを目的とした一連の新しいチャットボットの機能を公開した。これらの強化機能は、今年初めに導入された企業固有のプラットフォーム「Claude for Legal」を拡張し、異なる法律分野に特化した専門的な法律プラグインとMCPコネクタを追加するものである。これらのツールは、法律AI分野での競争が激化する中で登場した。3月、エージェント型AIを活用して法律ワークフローを効率化するAI法律スタートアップのHarveyは、110億ド
関連特集おすすめ
コメント (3)
0/500
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

ウィキメディア・ドイチュランドは今週水曜日、AIモデルによるウィキペディアの膨大な知識リポジトリへのアクセスを強化するための新しいデータベースを発表した。
Wikidata Embedding Projectと名付けられたこのイニシアチブは、ベクトルベースのセマンティック検索技術を活用し、コンピュータが単語の意味や関係を把握できるようにするもので、ウィキペディアの姉妹プラットフォームにまたがる約1億2千万項目の膨大なネットワークに適用されている。
AIとデータソースの通信を促進するフレームワークであるモデルコンテキストプロトコル(MCP)の互換性が追加されたことで、このプロジェクトは、大規模な言語モデルが自然言語クエリを通じてどのように対話し、情報を取得するかを改善する。
ウィキメディアのドイツ部門は、ニューラル検索のスペシャリストであるJina.AIや、リアルタイムのトレーニングデータを専門とするIBM傘下のDataStaxとともに、この取り組みの先頭に立った。
ウィキデータは長い間、ウィキメディアの資産から機械可読データを提供してきたが、以前のツールはキーワード検索とSPARQLクエリに限られていた。このアップグレードされたシステムは、検索拡張生成(RAG)機能を強化し、AI開発者がウィキペディアの編集者によって検証された知識ベースにモデルを固定できるようにする。
このデータベースは、豊富な意味的文脈を持つデータを構造化する。例えば、"scientist "を検索すると、多言語翻訳、キュレーションされたウィキメディアの画像、"researchcher "や "scholar "といった関連用語とともに、著名な原子力科学者やベル研究所の研究者のリストが返される。
Toolforgeからアクセスできるウィキデータは、10月9日に開発者向けウェビナーを開催し、このプラットフォームの可能性を紹介する。
Disrupt 2025で10,000人以上のテック企業やVCのパイオニアとつながろう
Netflix、Box、a16z、ElevenLabs、Vinod Khoslaといった業界の巨人たちが、スタートアップの成長戦略や技術的洞察を満載した200以上のセッションに参加します。早割チケットは、一般入場開始前の今なら最大444ドルお得です。
Disrupt 2025で10,000人以上のテック企業やVCのパイオニアとつながろう
Netflix、Box、a16z、ElevenLabs、Vinod Khoslaといった業界の巨人たちが、スタートアップの成長戦略や技術的洞察を満載した200以上のセッションに参加します。一般入場が開始される前に、最大444ドルお得な早割チケットを今すぐ確保しよう。
AI開発者がモデル改良のためにプレミアム・データソースを求める傾向が強まる中、今回の発表が実現した。現代の学習システムは、単純なデータセットではなく、複雑なエコシステムとなっているが、特に精度が重要なアプリケーションでは、細心の注意を払ってキュレーションされた情報が要求される。ウィキペディアのファクトチェックされたコンテンツは、コモン・クロールのような大量のデータセットよりもはるかに優れている。
質の高いデータの追求にはリスクが伴う:Anthropicは最近、トレーニングのための著作物の無断使用について著者から訴えられ、15億ドルの和解を提案した。
ウィキデータのAIプロジェクトリーダーであるフィリップ・サーデは、その独立性を強調した:「これは、強力なAIが企業のサイロを越えて繁栄できることを証明するもので、オープンで協力的、そして公共の利益のために構築されたものです」と彼は報道陣に語った。
オリー社、AIアシスタント競争で優位に立つためプライバシー重視を掲げる
真に役立つAIアシスタントであるためには、ユーザーを深く理解する必要があります。日常生活向けに設計されたパーソナルアシスタント「Ollie」は、そのためにデータを明け渡したり、プライバシーを犠牲にしたりする必要はないという前提で動作します。一部のエンタープライズ向けAIツールにはデータプライバシー保護措置が講じられていますが、OllieはSOC 2準拠を達成した、一般家庭向けのAIサービスとしては
「AI LIVE: London」がAIと産業オートメーションをどのように掘り下げるか
このサミットには、世界中から経営幹部が集まり、AIによる変革から経済の変動性に至るまで、世界の産業が直面する喫緊の課題について議論します。「AI LIVE: The London Summit」では、「テクノロジー+人間の目的」をテーマに、2,000名を超える国際的なリーダーが一堂に会し、人工知能の新たな時代について検討を行います。BizClik傘下の『AI Magazine』は、「AI LIVE
Anthropic、AI法テック市場に参入、競争激化
Anthropicは火曜日、法律実務に自動化されたサポートを提供することを目的とした一連の新しいチャットボットの機能を公開した。これらの強化機能は、今年初めに導入された企業固有のプラットフォーム「Claude for Legal」を拡張し、異なる法律分野に特化した専門的な法律プラグインとMCPコネクタを追加するものである。これらのツールは、法律AI分野での競争が激化する中で登場した。3月、エージェント型AIを活用して法律ワークフローを効率化するAI法律スタートアップのHarveyは、110億ド
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡





家






