维基百科与人工智能公司合作加强数据访问

德国维基媒体本周三发布了一个新数据库,旨在加强人工智能模型对维基百科庞大知识库的访问。
该项目被称为维基数据嵌入项目(Wikidata Embedding Project),它利用基于矢量的语义搜索技术--使计算机能够掌握词义和词与词之间的关系--将其应用于维基百科的庞大网络,该网络包含维基百科姊妹平台上的近1.2亿个词条。
该项目增加了对模型上下文协议(MCP)的兼容性,这是一个促进人工智能与数据源交流的框架,它改善了大型语言模型与自然语言查询的交互方式以及通过自然语言查询检索信息的方式。
维基媒体的德国分部与神经搜索专家 Jina.AI 和 IBM 旗下专门从事实时训练数据的 DataStax 一起率先开展了这项工作。
维基数据长期以来一直提供来自维基媒体属性的机器可读数据,但以前的工具仅限于关键词搜索和 SPARQL 查询。升级后的系统增强了检索增强生成(RAG)功能,使人工智能开发人员能够在维基百科的编辑验证知识库中建立自己的模型。
数据库的数据结构具有丰富的语义背景。例如,搜索 "科学家 "会返回著名核科学家和贝尔实验室研究人员的名单,以及多语种翻译、维基媒体图片和相关术语(如 "研究人员 "和 "学者")。
Wikidata可通过Toolforge访问,并将于10月9日举办开发人员网络研讨会,展示该平台的潜力。
在 2025 年颠覆大会上与 10,000 多名技术和风险投资先锋进行交流
加入 Netflix、Box、a16z、ElevenLabs 和 Vinod Khosla 等行业巨头的行列,参加 200 多场包含初创企业发展战略和技术见解的会议。今天就购买早鸟门票--在普通门票开放之前最多可节省 444 美元。
在 2025 年颠覆大会上与 10,000 多名技术和风险投资先锋进行交流
与 Netflix、Box、a16z、ElevenLabs 和 Vinod Khosla 等行业巨头一起,参加 200 多场包含初创企业发展战略和技术见解的会议。今天就购买早鸟门票,在普通门票开放之前最多可节省 444 美元。
随着人工智能开发人员越来越多地寻求优质数据源来完善模型,此次发布会也应运而生。现代训练系统已不再是简单的数据集,而是错综复杂的生态系统,它仍然需要经过精心策划的信息,尤其是对准确性要求极高的应用而言。维基百科经过事实核查的内容与 Common Crawl 等批量数据集相比具有明显优势。
对高质量数据的追求蕴含着风险:Anthropic公司最近提出了一项15亿美元的和解协议,因为作者起诉维基百科未经授权使用他们的作品进行训练。
维基数据的人工智能项目负责人菲利普-萨德(Philippe Saadé)强调了其独立性:"他对媒体说:"这证明了强大的人工智能可以超越企业孤岛--开放、合作、为公众利益而生。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (3)
0/500
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

德国维基媒体本周三发布了一个新数据库,旨在加强人工智能模型对维基百科庞大知识库的访问。
该项目被称为维基数据嵌入项目(Wikidata Embedding Project),它利用基于矢量的语义搜索技术--使计算机能够掌握词义和词与词之间的关系--将其应用于维基百科的庞大网络,该网络包含维基百科姊妹平台上的近1.2亿个词条。
该项目增加了对模型上下文协议(MCP)的兼容性,这是一个促进人工智能与数据源交流的框架,它改善了大型语言模型与自然语言查询的交互方式以及通过自然语言查询检索信息的方式。
维基媒体的德国分部与神经搜索专家 Jina.AI 和 IBM 旗下专门从事实时训练数据的 DataStax 一起率先开展了这项工作。
维基数据长期以来一直提供来自维基媒体属性的机器可读数据,但以前的工具仅限于关键词搜索和 SPARQL 查询。升级后的系统增强了检索增强生成(RAG)功能,使人工智能开发人员能够在维基百科的编辑验证知识库中建立自己的模型。
数据库的数据结构具有丰富的语义背景。例如,搜索 "科学家 "会返回著名核科学家和贝尔实验室研究人员的名单,以及多语种翻译、维基媒体图片和相关术语(如 "研究人员 "和 "学者")。
Wikidata可通过Toolforge访问,并将于10月9日举办开发人员网络研讨会,展示该平台的潜力。
在 2025 年颠覆大会上与 10,000 多名技术和风险投资先锋进行交流
加入 Netflix、Box、a16z、ElevenLabs 和 Vinod Khosla 等行业巨头的行列,参加 200 多场包含初创企业发展战略和技术见解的会议。今天就购买早鸟门票--在普通门票开放之前最多可节省 444 美元。
在 2025 年颠覆大会上与 10,000 多名技术和风险投资先锋进行交流
与 Netflix、Box、a16z、ElevenLabs 和 Vinod Khosla 等行业巨头一起,参加 200 多场包含初创企业发展战略和技术见解的会议。今天就购买早鸟门票,在普通门票开放之前最多可节省 444 美元。
随着人工智能开发人员越来越多地寻求优质数据源来完善模型,此次发布会也应运而生。现代训练系统已不再是简单的数据集,而是错综复杂的生态系统,它仍然需要经过精心策划的信息,尤其是对准确性要求极高的应用而言。维基百科经过事实核查的内容与 Common Crawl 等批量数据集相比具有明显优势。
对高质量数据的追求蕴含着风险:Anthropic公司最近提出了一项15亿美元的和解协议,因为作者起诉维基百科未经授权使用他们的作品进行训练。
维基数据的人工智能项目负责人菲利普-萨德(Philippe Saadé)强调了其独立性:"他对媒体说:"这证明了强大的人工智能可以超越企业孤岛--开放、合作、为公众利益而生。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡





首页






