AI 크롤러 서지 Wikimedia Commons 대역폭 수요 50%

위키미디어 재단, 즉 위키백과와 여러 군중 소싱 지식 플랫폼의 모체는 수요일에 위키미디어 커먼스에서 멀티미디어 다운로드에 대한 대역폭 사용량이 2024년 1월 이후 50% 급증했다고 발표했습니다. 화요일 블로그 포스트에서 자세히 설명된 이 급증은 인간의 호기심 증가 때문이 아니라, AI 모델 훈련을 위한 데이터를 갈망하는 자동화된 스크레이퍼 때문입니다.
“우리 인프라는 주요 이벤트 동안 인간의 트래픽 급증을 처리하도록 설계되었지만, 스크레이퍼 봇에서 오는 트래픽의 양은 비교할 수 없을 정도로 많으며 점점 더 큰 위험과 비용을 초래합니다,”라고 포스트는 설명합니다.
위키미디어 커먼스는 이미지, 비디오, 오디오 파일을 위한 자유롭게 접근 가능한 허브로, 모두 오픈 라이선스 또는 퍼블릭 도메인에서 제공됩니다.
더 깊이 파고들어, 위키미디어는 가장 많은 자원을 소모하는 트래픽—소비된 콘텐츠 유형으로 측정—의 무려 65%가 봇에서 나온다고 밝혔습니다. 그러나 이러한 봇은 전체 페이지뷰의 단지 35%만을 차지합니다. 위키미디어에 따르면, 이 불균형은 자주 액세스되는 콘텐츠가 사용자에게 더 가까운 곳에 캐싱되는 반면, 봇이 종종 타겟팅하는 덜 인기 있는 콘텐츠는 더 비용이 많이 드는 “코어 데이터 센터”에 저장되기 때문입니다.
“인간 독자들은 특정하고 종종 유사한 주제에 집중하는 경향이 있지만, 크롤러 봇은 더 많은 페이지를 ‘대량 읽기’하고 덜 인기 있는 페이지도 방문하는 경향이 있습니다,”라고 위키미디어는 언급했습니다. “이로 인해 이러한 요청이 코어 데이터센터로 전달되어 자원 소모 비용이 크게 증가합니다.”
결과적으로, 위키미디어 재단의 사이트 안정성 팀은 일상적인 사용자들에게 중단을 방지하기 위해 이러한 크롤러를 차단하는 데 상당한 시간과 자원을 투입하고 있습니다. 이는 재단이 직면하고 있는 급등하는 클라우드 비용에 대해서는 언급조차 하지 않은 것입니다.
이 시나리오는 오픈 인터넷을 위협하는 더 큰 트렌드의 일부입니다. 지난 달, 소프트웨어 엔지니어이자 오픈소스 옹호자인 Drew DeVault는 AI 크롤러들이 자동화된 트래픽을 막기 위한 “robots.txt” 파일을 노골적으로 무시하고 있다고 한탄했습니다. 마찬가지로, “프래그매틱 엔지니어”로 알려진 Gergely Orosz는 최근 Meta와 같은 회사들의 AI 스크레이퍼가 그의 프로젝트에 대한 대역폭 수요를 급증시켰다고 좌절감을 표출했습니다.
오픈소스 인프라가 특히 취약하지만, 개발자들은 독창성과 결단력으로 대응하고 있습니다. TechCrunch는 지난 주 일부 기술 회사들이 나서고 있다고 강조했습니다. 예를 들어, Cloudflare는 AI로 생성된 콘텐츠로 크롤러를 늦추기 위해 설계된 AI Labyrinth를 도입했습니다.
그럼에도 불구하고, 이는 끊임없는 고양이와 쥐 게임으로 남아 있으며, 많은 퍼블리셔들이 로그인과 페이월 뒤로 후퇴하게 만들어, 우리가 모두 의존하는 웹의 오픈 본질을 궁극적으로 해칠 수 있습니다.
관련 기사
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
관련 특별 주제 추천
의견 (15)
0/500
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!

위키미디어 재단, 즉 위키백과와 여러 군중 소싱 지식 플랫폼의 모체는 수요일에 위키미디어 커먼스에서 멀티미디어 다운로드에 대한 대역폭 사용량이 2024년 1월 이후 50% 급증했다고 발표했습니다. 화요일 블로그 포스트에서 자세히 설명된 이 급증은 인간의 호기심 증가 때문이 아니라, AI 모델 훈련을 위한 데이터를 갈망하는 자동화된 스크레이퍼 때문입니다.
“우리 인프라는 주요 이벤트 동안 인간의 트래픽 급증을 처리하도록 설계되었지만, 스크레이퍼 봇에서 오는 트래픽의 양은 비교할 수 없을 정도로 많으며 점점 더 큰 위험과 비용을 초래합니다,”라고 포스트는 설명합니다.
위키미디어 커먼스는 이미지, 비디오, 오디오 파일을 위한 자유롭게 접근 가능한 허브로, 모두 오픈 라이선스 또는 퍼블릭 도메인에서 제공됩니다.
더 깊이 파고들어, 위키미디어는 가장 많은 자원을 소모하는 트래픽—소비된 콘텐츠 유형으로 측정—의 무려 65%가 봇에서 나온다고 밝혔습니다. 그러나 이러한 봇은 전체 페이지뷰의 단지 35%만을 차지합니다. 위키미디어에 따르면, 이 불균형은 자주 액세스되는 콘텐츠가 사용자에게 더 가까운 곳에 캐싱되는 반면, 봇이 종종 타겟팅하는 덜 인기 있는 콘텐츠는 더 비용이 많이 드는 “코어 데이터 센터”에 저장되기 때문입니다.
“인간 독자들은 특정하고 종종 유사한 주제에 집중하는 경향이 있지만, 크롤러 봇은 더 많은 페이지를 ‘대량 읽기’하고 덜 인기 있는 페이지도 방문하는 경향이 있습니다,”라고 위키미디어는 언급했습니다. “이로 인해 이러한 요청이 코어 데이터센터로 전달되어 자원 소모 비용이 크게 증가합니다.”
결과적으로, 위키미디어 재단의 사이트 안정성 팀은 일상적인 사용자들에게 중단을 방지하기 위해 이러한 크롤러를 차단하는 데 상당한 시간과 자원을 투입하고 있습니다. 이는 재단이 직면하고 있는 급등하는 클라우드 비용에 대해서는 언급조차 하지 않은 것입니다.
이 시나리오는 오픈 인터넷을 위협하는 더 큰 트렌드의 일부입니다. 지난 달, 소프트웨어 엔지니어이자 오픈소스 옹호자인 Drew DeVault는 AI 크롤러들이 자동화된 트래픽을 막기 위한 “robots.txt” 파일을 노골적으로 무시하고 있다고 한탄했습니다. 마찬가지로, “프래그매틱 엔지니어”로 알려진 Gergely Orosz는 최근 Meta와 같은 회사들의 AI 스크레이퍼가 그의 프로젝트에 대한 대역폭 수요를 급증시켰다고 좌절감을 표출했습니다.
오픈소스 인프라가 특히 취약하지만, 개발자들은 독창성과 결단력으로 대응하고 있습니다. TechCrunch는 지난 주 일부 기술 회사들이 나서고 있다고 강조했습니다. 예를 들어, Cloudflare는 AI로 생성된 콘텐츠로 크롤러를 늦추기 위해 설계된 AI Labyrinth를 도입했습니다.
그럼에도 불구하고, 이는 끊임없는 고양이와 쥐 게임으로 남아 있으며, 많은 퍼블리셔들이 로그인과 페이월 뒤로 후퇴하게 만들어, 우리가 모두 의존하는 웹의 오픈 본질을 궁극적으로 해칠 수 있습니다.
미국의 주식 시장이 AI와 항공우주 거대 기업들의 1조 달러 데뷔를 앞두고 역사적 이정표에 도달
엘론 머스크, 샘 알트만, 그리고 다리오 아모데이라는 기술 산업의 거인 세 명이 각자의 기업에 대해 공개 시장 상장(IPO)을 앞두고 있다. 스페이스X, 오픈AI, 앤트로픽이라는 세 산업의 거대 기업이 1조 달러 이상의 기업 가치를 달성하며 상장을 준비함에 따라, 2026년은 미국 역사상 신주 발행 측면에서 가장 중요한 해가 될 것으로 전망된다.이러한 역사적인 자본 증가는 전 세계 금융계의 주목을 받고 있으며, 공공 시장이 이러한 규모의 자금
스웨덴의 AI 스타트업 로버블 아이즈, 주요 자금 조달 라운드 이후 132억 달러의 기업 가치 달성
AI 기반 코딩 도구가 인기를 얻으면서 스웨덴 스타트업 로버블(Lovable)이 주요 자금 조달 라운드를 성사시켰다. 이 회사는 30억 달러를 조달하여 지난 12월 기록된 66억 달러의 두 배인 132억 달러의 기업 가치를 달성할 수 있을 것으로 기대된다. 멘로 벤처스(Menlo Ventures)가 이 투자 라운드를 주도할 것으로 예상된다.로버블의 매력은 복잡한 코딩 기술이 필요하지 않은 소프트웨어 제작을 단순화하는 핵심 '바이브 코딩(vib
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!





집






