AIクローラーはウィキメディアコモンズ帯域幅の需要を50%サージします

Wikimedia Foundationは、Wikipediaやその他のクラウドソーシングによる知識プラットフォームの親団体であり、2024年1月以来、Wikimedia Commonsからのマルチメディアダウンロードの帯域幅使用量が驚異的な50%増加したと水曜日に発表しました。この急増は、火曜日のブログ投稿で詳しく説明されているように、人間の好奇心の高まりによるものではなく、AIモデルを訓練するためのデータを求める自動スクレーパーによるものです。
「私たちのインフラストラクチャは、大きなイベント中に人間からの急激なトラフィック増加に対応するように設計されていますが、スクレーパーボットからのトラフィックの量は比類なく、増加するリスクとコストをもたらしています」と投稿は説明しています。
Wikimedia Commonsは、画像、ビデオ、オーディオファイルの自由にアクセス可能なハブとして機能し、すべてオープンライセンスまたはパブリックドメインで利用可能です。
さらに詳しく調べると、Wikimediaは、最もリソースを消費するトラフィックの驚くべき65%がボットによるものであり、消費されるコンテンツの種類によって測定されていることを明らかにしました。しかし、これらのボットは全体のページビューのわずか35%を占めています。Wikimediaによると、この差は、頻繁にアクセスされるコンテンツがユーザーに近い場所でキャッシュされる一方で、ボットがしばしばターゲットにするあまり人気のないコンテンツは、よりコストのかかる「コアデータセンター」に保存されていることに起因しています。
「人間の読者は特定の、しばしば類似したトピックに焦点を当てる傾向がありますが、クローラーボットはより多くのページを『一括読み込み』し、比較的人気のないページも訪れる傾向があります」とWikimediaは指摘しました。「これにより、これらのリクエストがコアデータセンターに転送され、リソース消費コストが大幅に増加します。」
その結果、Wikimedia Foundationのサイト信頼性チームは、日常のユーザーへの影響を防ぐために、これらのクローラーをブロックするのにかなりの時間とリソースを費やしています。これは、Foundationが直面しているクラウドコストの増大にすら触れていません。
この状況は、オープンインターネットを危険にさらすより広範なトレンドの一部です。先月、ソフトウェアエンジニアでオープンソースの提唱者であるDrew DeVaultは、AIクローラーが自動トラフィックを抑止するための「robots.txt」ファイルを無視していると嘆きました。同様に、「プラグマティックエンジニア」として知られるGergely Oroszは、最近、Metaなどの企業からのAIスクレーパーが彼のプロジェクトの帯域幅需要を急増させていることに不満を表明しました。
オープンソースのインフラストラクチャは特に脆弱ですが、開発者は創意工夫と決意で対応しています。TechCrunchは先週、いくつかのテクノロジー企業が対策を講じていると報じました。たとえば、Cloudflareは、AI生成コンテンツでクローラーを遅くするように設計されたAI Labyrinthを導入しました。
しかし、それは猫とネズミの終わりのないゲームであり、多くのパブリッシャーがログインやペイウォールの背後に退却する可能性があり、結局のところ私たち全員が依存するウェブのオープンな性質を損なう可能性があります。
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (15)
0/500
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!

Wikimedia Foundationは、Wikipediaやその他のクラウドソーシングによる知識プラットフォームの親団体であり、2024年1月以来、Wikimedia Commonsからのマルチメディアダウンロードの帯域幅使用量が驚異的な50%増加したと水曜日に発表しました。この急増は、火曜日のブログ投稿で詳しく説明されているように、人間の好奇心の高まりによるものではなく、AIモデルを訓練するためのデータを求める自動スクレーパーによるものです。
「私たちのインフラストラクチャは、大きなイベント中に人間からの急激なトラフィック増加に対応するように設計されていますが、スクレーパーボットからのトラフィックの量は比類なく、増加するリスクとコストをもたらしています」と投稿は説明しています。
Wikimedia Commonsは、画像、ビデオ、オーディオファイルの自由にアクセス可能なハブとして機能し、すべてオープンライセンスまたはパブリックドメインで利用可能です。
さらに詳しく調べると、Wikimediaは、最もリソースを消費するトラフィックの驚くべき65%がボットによるものであり、消費されるコンテンツの種類によって測定されていることを明らかにしました。しかし、これらのボットは全体のページビューのわずか35%を占めています。Wikimediaによると、この差は、頻繁にアクセスされるコンテンツがユーザーに近い場所でキャッシュされる一方で、ボットがしばしばターゲットにするあまり人気のないコンテンツは、よりコストのかかる「コアデータセンター」に保存されていることに起因しています。
「人間の読者は特定の、しばしば類似したトピックに焦点を当てる傾向がありますが、クローラーボットはより多くのページを『一括読み込み』し、比較的人気のないページも訪れる傾向があります」とWikimediaは指摘しました。「これにより、これらのリクエストがコアデータセンターに転送され、リソース消費コストが大幅に増加します。」
その結果、Wikimedia Foundationのサイト信頼性チームは、日常のユーザーへの影響を防ぐために、これらのクローラーをブロックするのにかなりの時間とリソースを費やしています。これは、Foundationが直面しているクラウドコストの増大にすら触れていません。
この状況は、オープンインターネットを危険にさらすより広範なトレンドの一部です。先月、ソフトウェアエンジニアでオープンソースの提唱者であるDrew DeVaultは、AIクローラーが自動トラフィックを抑止するための「robots.txt」ファイルを無視していると嘆きました。同様に、「プラグマティックエンジニア」として知られるGergely Oroszは、最近、Metaなどの企業からのAIスクレーパーが彼のプロジェクトの帯域幅需要を急増させていることに不満を表明しました。
オープンソースのインフラストラクチャは特に脆弱ですが、開発者は創意工夫と決意で対応しています。TechCrunchは先週、いくつかのテクノロジー企業が対策を講じていると報じました。たとえば、Cloudflareは、AI生成コンテンツでクローラーを遅くするように設計されたAI Labyrinthを導入しました。
しかし、それは猫とネズミの終わりのないゲームであり、多くのパブリッシャーがログインやペイウォールの背後に退却する可能性があり、結局のところ私たち全員が依存するウェブのオープンな性質を損なう可能性があります。
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!





家






