Wikipedia正在為AI開發人員提供數據以抵禦機器人刮板

維基百科管理AI資料抓取的新策略
維基百科透過維基媒體基金會,採取積極措施來管理AI資料抓取對其伺服器的影響。週三,他們宣佈與Google旗下的數據科學和機器學習平台Kaggle合作,推出一個測試版數據集。該數據集包含「結構化的維基百科英文和法文內容」,專為AI訓練目的量身打造。
該數據集現已在Kaggle上提供,專為AI開發者設計,簡化了存取機器可讀文章數據的過程。這包括從研究摘要、簡短描述到圖片連結、資訊框數據和各篇文章段落等內容。重要的是,這些數據採用開放授權,不包括參考資料或非文本元素(如音頻文件),確保其針對AI使用場景(如建模、微調和基準測試)進行了優化。
維基媒體的方法提供了結構良好的JSON格式維基百科內容,他們希望這將成為AI開發者相較於傳統抓取或解析原始文章文本更具吸引力的選項。此舉部分是為了回應AI機器人因頻寬消耗對維基百科伺服器造成的壓力。
維基媒體已與Google和Internet Archive等巨頭建立了內容共享協議。然而,與Kaggle的合作預計將使這些數據更容易為小型公司和獨立數據科學家所用,擴大維基百科內容的影響力和實用性。
Kaggle的貢獻
Kaggle的合作負責人Brenda Flynn對托管維基媒體的數據表示熱情。「作為機器學習社群尋找工具和測試的平台,Kaggle非常興奮能成為維基媒體基金會數據的托管者,」她表示。Kaggle的角色對於保持這些數據不僅可存取,且對機器學習社群相關且實用至關重要。
維基百科的這一策略舉措不僅旨在減輕其伺服器的負擔,還促進了與AI和機器學習社群更結構化且有益的關係。
相關文章
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
相關專題推薦
評論 (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

維基百科管理AI資料抓取的新策略
維基百科透過維基媒體基金會,採取積極措施來管理AI資料抓取對其伺服器的影響。週三,他們宣佈與Google旗下的數據科學和機器學習平台Kaggle合作,推出一個測試版數據集。該數據集包含「結構化的維基百科英文和法文內容」,專為AI訓練目的量身打造。
該數據集現已在Kaggle上提供,專為AI開發者設計,簡化了存取機器可讀文章數據的過程。這包括從研究摘要、簡短描述到圖片連結、資訊框數據和各篇文章段落等內容。重要的是,這些數據採用開放授權,不包括參考資料或非文本元素(如音頻文件),確保其針對AI使用場景(如建模、微調和基準測試)進行了優化。
維基媒體的方法提供了結構良好的JSON格式維基百科內容,他們希望這將成為AI開發者相較於傳統抓取或解析原始文章文本更具吸引力的選項。此舉部分是為了回應AI機器人因頻寬消耗對維基百科伺服器造成的壓力。
維基媒體已與Google和Internet Archive等巨頭建立了內容共享協議。然而,與Kaggle的合作預計將使這些數據更容易為小型公司和獨立數據科學家所用,擴大維基百科內容的影響力和實用性。
Kaggle的貢獻
Kaggle的合作負責人Brenda Flynn對托管維基媒體的數據表示熱情。「作為機器學習社群尋找工具和測試的平台,Kaggle非常興奮能成為維基媒體基金會數據的托管者,」她表示。Kaggle的角色對於保持這些數據不僅可存取,且對機器學習社群相關且實用至關重要。
維基百科的這一策略舉措不僅旨在減輕其伺服器的負擔,還促進了與AI和機器學習社群更結構化且有益的關係。
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️





首頁






