Wikipedia는 AI 개발자에게 봇 스크레이퍼를 막기 위해 데이터를 제공하고 있습니다.

위키피디아의 AI 데이터 스크래핑 관리 전략
위키피디아는 위키미디어 재단을 통해 AI 데이터 스크래핑이 서버에 미치는 영향을 관리하기 위한 적극적인 조치를 취하고 있습니다. 수요일, 그들은 구글 소유의 데이터 과학 및 머신 러닝 전용 플랫폼인 캐글(Kaggle)과 협력하여 베타 데이터셋을 출시한다고 발표했습니다. 이 데이터셋은 "영어와 프랑스어로 된 구조화된 위키피디아 콘텐츠"를 포함하며, AI 훈련 목적에 특화되어 있습니다.
캐글에서 이제 이용 가능한 이 데이터셋은 AI 개발자를 염두에 두고 제작되었으며, 기계가 읽을 수 있는 기사 데이터에 접근하는 과정을 단순화합니다. 여기에는 연구 요약, 짧은 설명, 이미지 링크, 정보 상자 데이터, 다양한 기사 섹션이 포함됩니다. 중요한 점은 이 데이터가 공개적으로 라이선스가 부여되었으며, 오디오 파일과 같은 비텍스트 요소나 참조를 포함하지 않아 모델링, 미세 조정, 벤치마킹과 같은 AI 사용 사례에 최적화되어 있습니다.
위키미디어의 접근 방식은 위키피디아 콘텐츠를 잘 구조화된 JSON 형식으로 제공하며, 이는 AI 개발자들에게 전통적인 스크래핑이나 원시 기사 텍스트 파싱 방식에 비해 더 매력적인 옵션이 되기를 바랍니다. 이 조치는 AI 봇이 대역폭 소모로 인해 위키피디아 서버에 가중된 부담을 줄이기 위한 대응책의 일환입니다.
이미 위키미디어는 구글 및 인터넷 아카이브와 같은 거대 기업들과 콘텐츠 공유 계약을 체결했습니다. 그러나 캐글과의 파트너십은 이 데이터를 소규모 기업과 독립 데이터 과학자들에게 더 쉽게 접근할 수 있게 하여 위키피디아 콘텐츠의 도달 범위와 유용성을 확대할 것으로 기대됩니다.
캐글이 제공하는 것
캐글의 파트너십 리드인 브렌다 플린(Brenda Flynn)은 위키미디어의 데이터를 호스팅하는 것에 대해 열정을 표명했습니다. "머신 러닝 커뮤니티가 도구와 테스트를 위해 찾는 곳으로서, 캐글은 위키미디어 재단의 데이터를 호스팅하게 되어 매우 기쁩니다,"라고 그녀는 말했습니다. 캐글의 역할은 이 데이터를 단순히 접근 가능하게 유지하는 것뿐만 아니라 머신 러닝 커뮤니티에 적합하고 유용하게 만드는 데 중요합니다.
위키피디아의 이 전략적 움직임은 서버 부담을 완화할 뿐만 아니라 AI 및 머신 러닝 커뮤니티와 보다 구조화되고 유익한 관계를 촉진하는 것을 목표로 합니다.
관련 기사
구글, 사용자 제어 강화에 맞춰 제미니용 레미 AI 에이전트 테스트
비즈니스 인사이더에 따르면, 구글은 제미나이를 위한 새로운 AI 개인 에이전트인 레미를 테스트하고 있습니다. 이 도구는 사용자를 대신하여 작업을 실행하여 전문적인 워크플로우와 일상적인 루틴을 모두 간소화하는 것을 목표로 합니다.현재 레미는 제미나이 애플리케이션의 내부 직원 전용 버전에서 테스트 중입니다. 이 보고서는 내부 문서와 프로젝트에 정통한 두 명의 인물과의 인터뷰를 인용합니다. 내부 자료는 레미를 “24/7 개인 에이전트”로 묘사하며,
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
관련 특별 주제 추천
의견 (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

위키피디아의 AI 데이터 스크래핑 관리 전략
위키피디아는 위키미디어 재단을 통해 AI 데이터 스크래핑이 서버에 미치는 영향을 관리하기 위한 적극적인 조치를 취하고 있습니다. 수요일, 그들은 구글 소유의 데이터 과학 및 머신 러닝 전용 플랫폼인 캐글(Kaggle)과 협력하여 베타 데이터셋을 출시한다고 발표했습니다. 이 데이터셋은 "영어와 프랑스어로 된 구조화된 위키피디아 콘텐츠"를 포함하며, AI 훈련 목적에 특화되어 있습니다.
캐글에서 이제 이용 가능한 이 데이터셋은 AI 개발자를 염두에 두고 제작되었으며, 기계가 읽을 수 있는 기사 데이터에 접근하는 과정을 단순화합니다. 여기에는 연구 요약, 짧은 설명, 이미지 링크, 정보 상자 데이터, 다양한 기사 섹션이 포함됩니다. 중요한 점은 이 데이터가 공개적으로 라이선스가 부여되었으며, 오디오 파일과 같은 비텍스트 요소나 참조를 포함하지 않아 모델링, 미세 조정, 벤치마킹과 같은 AI 사용 사례에 최적화되어 있습니다.
위키미디어의 접근 방식은 위키피디아 콘텐츠를 잘 구조화된 JSON 형식으로 제공하며, 이는 AI 개발자들에게 전통적인 스크래핑이나 원시 기사 텍스트 파싱 방식에 비해 더 매력적인 옵션이 되기를 바랍니다. 이 조치는 AI 봇이 대역폭 소모로 인해 위키피디아 서버에 가중된 부담을 줄이기 위한 대응책의 일환입니다.
이미 위키미디어는 구글 및 인터넷 아카이브와 같은 거대 기업들과 콘텐츠 공유 계약을 체결했습니다. 그러나 캐글과의 파트너십은 이 데이터를 소규모 기업과 독립 데이터 과학자들에게 더 쉽게 접근할 수 있게 하여 위키피디아 콘텐츠의 도달 범위와 유용성을 확대할 것으로 기대됩니다.
캐글이 제공하는 것
캐글의 파트너십 리드인 브렌다 플린(Brenda Flynn)은 위키미디어의 데이터를 호스팅하는 것에 대해 열정을 표명했습니다. "머신 러닝 커뮤니티가 도구와 테스트를 위해 찾는 곳으로서, 캐글은 위키미디어 재단의 데이터를 호스팅하게 되어 매우 기쁩니다,"라고 그녀는 말했습니다. 캐글의 역할은 이 데이터를 단순히 접근 가능하게 유지하는 것뿐만 아니라 머신 러닝 커뮤니티에 적합하고 유용하게 만드는 데 중요합니다.
위키피디아의 이 전략적 움직임은 서버 부담을 완화할 뿐만 아니라 AI 및 머신 러닝 커뮤니티와 보다 구조화되고 유익한 관계를 촉진하는 것을 목표로 합니다.
올리는 AI 비서 시장 경쟁에서 우위를 점하기 위해 개인정보 보호에 주력하고 있다
진정으로 도움이 되려면 AI 비서는 사용자를 깊이 이해해야 합니다. 일상 생활을 위해 설계된 개인 비서 ‘올리(Ollie)’는 이를 위해 사용자의 데이터를 제공하거나 개인정보를 침해할 필요가 없다는 전제 하에 운영됩니다.일부 기업용 AI 도구가 데이터 개인정보 보호 장치를 제공하기는 하지만, 올리는 SOC 2 인증을 획득한 최초의 대중적 가정용 AI 서비스
‘AI LIVE: London’이 AI와 산업 자동화를 어떻게 조명할 것인가
이번 정상회의에는 전 세계의 최고 경영진들이 한자리에 모여, AI에 의한 산업 혁신부터 경제 변동성에 이르기까지 글로벌 산업이 직면한 시급한 과제들을 논의할 예정입니다.‘AI LIVE: 런던 서밋’은 ‘기술 + 인간의 목적(Technology + Human Purpose)’이라는 주제로 2,000명 이상의 국제적 리더들을 한자리에 모아, 새롭게 도래하는 인
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️





집






