Wikipedia正在为AI开发人员提供数据以抵御机器人刮板

维基百科管理AI数据抓取的新策略
维基百科通过维基媒体基金会采取积极措施,管理AI数据抓取对其服务器的影响。周三,他们宣布与Kaggle合作,Kaggle是Google旗下的一个专注于数据科学和机器学习的平台,共同推出一个测试版数据集。该数据集包含“结构化的维基百科内容,涵盖英语和法语”,专门为AI训练目的量身定制。
该数据集现已在Kaggle上提供,专为AI开发者设计,简化了获取机器可读文章数据的流程。这包括从研究摘要和简短描述到图片链接、信息框数据以及各种文章部分的全部内容。重要的是,这些数据采用开放许可,不包括参考文献或非文本元素,如音频文件,确保其针对AI用例(如建模、微调和基准测试)进行了优化。
维基媒体的方法提供了维基百科内容的结构化JSON格式,他们希望这对AI开发者来说是比传统抓取或解析原始文章文本更具吸引力的选择。此举部分是为了应对AI机器人因带宽消耗对维基百科服务器造成的压力。
维基媒体已与Google和互联网档案馆等巨头建立了内容共享协议。然而,与Kaggle的合作预计将使这些数据更容易为小型公司和独立数据科学家所用,扩大了维基百科内容的覆盖范围和实用性。
Kaggle的贡献
Kaggle的合作负责人布伦达·弗林(Brenda Flynn)对托管维基媒体的数据表示了热情。“作为机器学习社区获取工具和测试的平台,Kaggle非常兴奋能成为维基媒体基金会数据的托管方,”她说道。Kaggle的角色在保持这些数据的可访问性、相关性和对机器学习社区的实用性方面至关重要。
维基百科的这一战略举措不仅旨在减轻其服务器的负担,还促进了与AI和机器学习社区之间更结构化、更互利的关系。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

维基百科管理AI数据抓取的新策略
维基百科通过维基媒体基金会采取积极措施,管理AI数据抓取对其服务器的影响。周三,他们宣布与Kaggle合作,Kaggle是Google旗下的一个专注于数据科学和机器学习的平台,共同推出一个测试版数据集。该数据集包含“结构化的维基百科内容,涵盖英语和法语”,专门为AI训练目的量身定制。
该数据集现已在Kaggle上提供,专为AI开发者设计,简化了获取机器可读文章数据的流程。这包括从研究摘要和简短描述到图片链接、信息框数据以及各种文章部分的全部内容。重要的是,这些数据采用开放许可,不包括参考文献或非文本元素,如音频文件,确保其针对AI用例(如建模、微调和基准测试)进行了优化。
维基媒体的方法提供了维基百科内容的结构化JSON格式,他们希望这对AI开发者来说是比传统抓取或解析原始文章文本更具吸引力的选择。此举部分是为了应对AI机器人因带宽消耗对维基百科服务器造成的压力。
维基媒体已与Google和互联网档案馆等巨头建立了内容共享协议。然而,与Kaggle的合作预计将使这些数据更容易为小型公司和独立数据科学家所用,扩大了维基百科内容的覆盖范围和实用性。
Kaggle的贡献
Kaggle的合作负责人布伦达·弗林(Brenda Flynn)对托管维基媒体的数据表示了热情。“作为机器学习社区获取工具和测试的平台,Kaggle非常兴奋能成为维基媒体基金会数据的托管方,”她说道。Kaggle的角色在保持这些数据的可访问性、相关性和对机器学习社区的实用性方面至关重要。
维基百科的这一战略举措不仅旨在减轻其服务器的负担,还促进了与AI和机器学习社区之间更结构化、更互利的关系。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️





首页






