Lar
A Wikipedia está dando aos desenvolvedores de IA seus dados para afastar os raspadores de bot

Nova Estratégia da Wikipédia para Gerenciar a Extração de Dados por IA
A Wikipédia, por meio da Wikimedia Foundation, está tomando uma medida proativa para gerenciar o impacto da extração de dados por IA em seus servidores. Na quarta-feira, eles anunciaram uma colaboração com o Kaggle, uma plataforma pertencente ao Google e dedicada à ciência de dados e aprendizado de máquina, para lançar um conjunto de dados beta. Este conjunto de dados contém "conteúdo estruturado da Wikipédia em inglês e francês", projetado especificamente para fins de treinamento de IA.
O conjunto de dados, agora disponível no Kaggle, foi criado pensando nos desenvolvedores de IA, simplificando o processo de acesso a dados de artigos legíveis por máquina. Isso inclui desde resumos de pesquisa e descrições curtas até links de imagens, dados de infobox e várias seções de artigos. Importante, esses dados são licenciados abertamente e não incluem referências ou elementos não textuais, como arquivos de áudio, garantindo que sejam otimizados para casos de uso de IA, como modelagem, ajuste fino e benchmarking.
A abordagem da Wikimedia oferece um formato JSON bem estruturado do conteúdo da Wikipédia, que eles esperam ser uma opção mais atraente para os desenvolvedores de IA em comparação com o método tradicional de extração ou análise de texto bruto de artigos. Essa medida responde, em parte, à pressão que os bots de IA têm causado nos servidores da Wikipédia devido ao consumo de largura de banda.
Já existem acordos de compartilhamento de conteúdo estabelecidos pela Wikimedia com gigantes como Google e o Internet Archive. No entanto, a parceria com o Kaggle deve tornar esses dados mais acessíveis para empresas menores e cientistas de dados independentes, ampliando o alcance e a utilidade do conteúdo da Wikipédia.
O que o Kaggle Traz para a Mesa
Brenda Flynn, líder de parcerias do Kaggle, expressou entusiasmo por hospedar os dados da Wikimedia. "Como o lugar onde a comunidade de aprendizado de máquina busca ferramentas e testes, o Kaggle está extremamente animado por ser o anfitrião dos dados da Wikimedia Foundation", afirmou. O papel do Kaggle é crucial para manter esses dados não apenas acessíveis, mas também relevantes e úteis para a comunidade de aprendizado de máquina.
Essa jogada estratégica da Wikipédia visa não apenas aliviar a carga em seus servidores, mas também fomentar uma relação mais estruturada e benéfica com as comunidades de IA e aprendizado de máquina.
Artigo relacionado
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
Recomendações de tópicos especiais relacionados
Comentários (3)
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

Nova Estratégia da Wikipédia para Gerenciar a Extração de Dados por IA
A Wikipédia, por meio da Wikimedia Foundation, está tomando uma medida proativa para gerenciar o impacto da extração de dados por IA em seus servidores. Na quarta-feira, eles anunciaram uma colaboração com o Kaggle, uma plataforma pertencente ao Google e dedicada à ciência de dados e aprendizado de máquina, para lançar um conjunto de dados beta. Este conjunto de dados contém "conteúdo estruturado da Wikipédia em inglês e francês", projetado especificamente para fins de treinamento de IA.
O conjunto de dados, agora disponível no Kaggle, foi criado pensando nos desenvolvedores de IA, simplificando o processo de acesso a dados de artigos legíveis por máquina. Isso inclui desde resumos de pesquisa e descrições curtas até links de imagens, dados de infobox e várias seções de artigos. Importante, esses dados são licenciados abertamente e não incluem referências ou elementos não textuais, como arquivos de áudio, garantindo que sejam otimizados para casos de uso de IA, como modelagem, ajuste fino e benchmarking.
A abordagem da Wikimedia oferece um formato JSON bem estruturado do conteúdo da Wikipédia, que eles esperam ser uma opção mais atraente para os desenvolvedores de IA em comparação com o método tradicional de extração ou análise de texto bruto de artigos. Essa medida responde, em parte, à pressão que os bots de IA têm causado nos servidores da Wikipédia devido ao consumo de largura de banda.
Já existem acordos de compartilhamento de conteúdo estabelecidos pela Wikimedia com gigantes como Google e o Internet Archive. No entanto, a parceria com o Kaggle deve tornar esses dados mais acessíveis para empresas menores e cientistas de dados independentes, ampliando o alcance e a utilidade do conteúdo da Wikipédia.
O que o Kaggle Traz para a Mesa
Brenda Flynn, líder de parcerias do Kaggle, expressou entusiasmo por hospedar os dados da Wikimedia. "Como o lugar onde a comunidade de aprendizado de máquina busca ferramentas e testes, o Kaggle está extremamente animado por ser o anfitrião dos dados da Wikimedia Foundation", afirmou. O papel do Kaggle é crucial para manter esses dados não apenas acessíveis, mas também relevantes e úteis para a comunidade de aprendizado de máquina.
Essa jogada estratégica da Wikipédia visa não apenas aliviar a carga em seus servidores, mas também fomentar uma relação mais estruturada e benéfica com as comunidades de IA e aprendizado de máquina.
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️











