AI爬行者湧現Wikimedia Commons帶寬需求50%

維基媒體基金會,維基百科及眾多其他群眾外包知識平台的母體,於週三宣布,自2024年1月起,來自維基共享資源的多媒體下載頻寬使用量驚人地增長了50%。根據週二的一篇博客文章詳細說明,這一激增並非由於人類好奇心的增加,而是由於自動化爬蟲對數據的渴求,用於訓練AI模型。
“我們的基礎設施設計用於處理重大事件期間來自人類的突發流量激增,但來自爬蟲機器人的流量量無與倫比,且帶來日益增加的風險和成本,”該文章解釋道。
維基共享資源作為一個可自由訪問的圖像、視頻和音頻文件中心,所有內容均以開放許可證或公共領域形式提供。
深入探究,維基媒體透露,資源消耗最嚴重的流量中有高達65%來自機器人,這是以內容消耗類型衡量的。然而,這些機器人僅佔總頁面瀏覽量的35%。維基媒體表示,這一差異源於經常訪問的內容會被緩存在靠近用戶的地方,而機器人經常針對的較不受歡迎的內容則儲存在成本更高的“核心數據中心”。
“人類讀者傾向於專注於特定的、通常相似的話題,而爬蟲機器人則傾向於‘批量閱讀’更多頁面,並訪問較不受歡迎的頁面,”維基媒體指出。“這導致這些請求被轉發到核心數據中心,顯著增加了我們的資源消耗成本。”
因此,維基媒體基金會的網站可靠性團隊正在投入大量時間和資源來阻止這些爬蟲,以防止對日常用戶的干擾。這還未觸及基金會正應對的不斷上升的雲端成本。
這種情況是威脅開放互聯網的更廣泛趨勢的一部分。就在上個月,軟件工程師兼開源倡導者Drew DeVault哀嘆,AI爬蟲公然無視旨在阻止自動流量的“robots.txt”文件。同樣,被稱為“務實工程師”的Gergely Orosz最近也表達了他對來自Meta等公司的AI爬蟲如何使其項目頻寬需求激增的不滿。
雖然開源基礎設施尤其脆弱,但開發者們正以創造力和決心應對。TechCrunch上週報導,一些科技公司正在加緊行動。例如,Cloudflare推出了AI Labyrinth,旨在通過AI生成的內容減緩爬蟲速度。
然而,這仍然是一場持續的貓鼠遊戲,可能會迫使許多出版商退回到登錄和付費牆後,最終損害我們都依賴的網絡的開放性質。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (15)
0/500
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!

維基媒體基金會,維基百科及眾多其他群眾外包知識平台的母體,於週三宣布,自2024年1月起,來自維基共享資源的多媒體下載頻寬使用量驚人地增長了50%。根據週二的一篇博客文章詳細說明,這一激增並非由於人類好奇心的增加,而是由於自動化爬蟲對數據的渴求,用於訓練AI模型。
“我們的基礎設施設計用於處理重大事件期間來自人類的突發流量激增,但來自爬蟲機器人的流量量無與倫比,且帶來日益增加的風險和成本,”該文章解釋道。
維基共享資源作為一個可自由訪問的圖像、視頻和音頻文件中心,所有內容均以開放許可證或公共領域形式提供。
深入探究,維基媒體透露,資源消耗最嚴重的流量中有高達65%來自機器人,這是以內容消耗類型衡量的。然而,這些機器人僅佔總頁面瀏覽量的35%。維基媒體表示,這一差異源於經常訪問的內容會被緩存在靠近用戶的地方,而機器人經常針對的較不受歡迎的內容則儲存在成本更高的“核心數據中心”。
“人類讀者傾向於專注於特定的、通常相似的話題,而爬蟲機器人則傾向於‘批量閱讀’更多頁面,並訪問較不受歡迎的頁面,”維基媒體指出。“這導致這些請求被轉發到核心數據中心,顯著增加了我們的資源消耗成本。”
因此,維基媒體基金會的網站可靠性團隊正在投入大量時間和資源來阻止這些爬蟲,以防止對日常用戶的干擾。這還未觸及基金會正應對的不斷上升的雲端成本。
這種情況是威脅開放互聯網的更廣泛趨勢的一部分。就在上個月,軟件工程師兼開源倡導者Drew DeVault哀嘆,AI爬蟲公然無視旨在阻止自動流量的“robots.txt”文件。同樣,被稱為“務實工程師”的Gergely Orosz最近也表達了他對來自Meta等公司的AI爬蟲如何使其項目頻寬需求激增的不滿。
雖然開源基礎設施尤其脆弱,但開發者們正以創造力和決心應對。TechCrunch上週報導,一些科技公司正在加緊行動。例如,Cloudflare推出了AI Labyrinth,旨在通過AI生成的內容減緩爬蟲速度。
然而,這仍然是一場持續的貓鼠遊戲,可能會迫使許多出版商退回到登錄和付費牆後,最終損害我們都依賴的網絡的開放性質。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!





首頁






