AI爬行者涌现Wikimedia Commons带宽需求50%

维基媒体基金会,维基百科及众多其他众包知识平台的母体,于周三宣布,自2024年1月以来,来自维基媒体共享资源的的多媒体下载带宽使用量惊人地增长了50%。周二的一篇博客文章详细说明,这一激增并非源于人类好奇心的增加,而是由于自动化抓取工具对训练AI模型的数据的渴求。
“我们的基础设施设计能够应对重大事件期间来自人类的突发流量激增,但抓取机器人的流量规模无与伦比,且带来了日益增加的风险和成本,”该文章解释道。
维基媒体共享资源作为一个可自由访问的图片、视频和音频文件中心,所有内容均采用开放许可或属于公共领域。
深入研究后,维基媒体透露,最耗费资源的流量中——以消耗的内容类型衡量——高达65%来自机器人。然而,这些机器人仅占总页面浏览量的35%。维基媒体表示,这种差异源于经常访问的内容被缓存到靠近用户的地方,而机器人常针对的较不受欢迎的内容则存储在成本更高的“核心数据中心”。
“人类读者倾向于关注特定且往往相似的主题,而爬虫机器人则倾向于‘批量阅读’更多页面,并访问较不受欢迎的页面,”维基媒体指出。“这导致这些请求被转发到核心数据中心,显著增加了我们的资源消耗成本。”
因此,维基媒体基金会的站点可靠性团队正投入大量时间和资源来阻止这些爬虫,以防止对日常用户的干扰。这还未涉及基金会正在应对的不断上升的云端成本。
这一情景是威胁开放互联网的更广泛趋势的一部分。就在上个月,软件工程师和开源倡导者德鲁·德沃特(Drew DeVault)感叹,AI爬虫公然无视旨在阻止自动化流量的“robots.txt”文件。同样,被称为“实用工程师”的格尔盖伊·奥罗斯(Gergely Orosz)最近也表达了对AI抓取工具(例如来自Meta的公司)对其项目带宽需求激增的沮丧。
虽然开源基础设施尤其脆弱,但开发者们正以创造力和决心应对。上周,TechCrunch报道了一些科技公司正在采取行动。例如,Cloudflare推出了AI Labyrinth,旨在通过AI生成的内容减缓爬虫速度。
然而,这仍然是一场持续的猫鼠游戏,可能迫使许多出版商退回到登录和付费墙之后,最终损害我们赖以生存的网络的开放性。
相关文章
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
相关专题推荐
评论 (15)
0/500
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!

维基媒体基金会,维基百科及众多其他众包知识平台的母体,于周三宣布,自2024年1月以来,来自维基媒体共享资源的的多媒体下载带宽使用量惊人地增长了50%。周二的一篇博客文章详细说明,这一激增并非源于人类好奇心的增加,而是由于自动化抓取工具对训练AI模型的数据的渴求。
“我们的基础设施设计能够应对重大事件期间来自人类的突发流量激增,但抓取机器人的流量规模无与伦比,且带来了日益增加的风险和成本,”该文章解释道。
维基媒体共享资源作为一个可自由访问的图片、视频和音频文件中心,所有内容均采用开放许可或属于公共领域。
深入研究后,维基媒体透露,最耗费资源的流量中——以消耗的内容类型衡量——高达65%来自机器人。然而,这些机器人仅占总页面浏览量的35%。维基媒体表示,这种差异源于经常访问的内容被缓存到靠近用户的地方,而机器人常针对的较不受欢迎的内容则存储在成本更高的“核心数据中心”。
“人类读者倾向于关注特定且往往相似的主题,而爬虫机器人则倾向于‘批量阅读’更多页面,并访问较不受欢迎的页面,”维基媒体指出。“这导致这些请求被转发到核心数据中心,显著增加了我们的资源消耗成本。”
因此,维基媒体基金会的站点可靠性团队正投入大量时间和资源来阻止这些爬虫,以防止对日常用户的干扰。这还未涉及基金会正在应对的不断上升的云端成本。
这一情景是威胁开放互联网的更广泛趋势的一部分。就在上个月,软件工程师和开源倡导者德鲁·德沃特(Drew DeVault)感叹,AI爬虫公然无视旨在阻止自动化流量的“robots.txt”文件。同样,被称为“实用工程师”的格尔盖伊·奥罗斯(Gergely Orosz)最近也表达了对AI抓取工具(例如来自Meta的公司)对其项目带宽需求激增的沮丧。
虽然开源基础设施尤其脆弱,但开发者们正以创造力和决心应对。上周,TechCrunch报道了一些科技公司正在采取行动。例如,Cloudflare推出了AI Labyrinth,旨在通过AI生成的内容减缓爬虫速度。
然而,这仍然是一场持续的猫鼠游戏,可能迫使许多出版商退回到登录和付费墙之后,最终损害我们赖以生存的网络的开放性。
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!





首页






