Wikipedia faz parceria com empresas de IA para melhorar o acesso aos dados

A Wikimedia Deutschland apresentou nesta quarta-feira um novo banco de dados criado para aprimorar o acesso dos modelos de IA ao extenso repositório de conhecimento da Wikipédia.
Batizada de Wikidata Embedding Project, essa iniciativa aproveita a tecnologia de pesquisa semântica baseada em vetores - permitindo que os computadores compreendam os significados e as relações entre as palavras - aplicada à vasta rede da Wikipédia de quase 120 milhões de entradas em suas plataformas irmãs.
Com compatibilidade adicional para o Protocolo de Contexto de Modelo (MCP), uma estrutura que facilita a comunicação entre IA e fonte de dados, o projeto aprimora a forma como modelos de linguagem grandes interagem e recuperam informações por meio de consultas em linguagem natural.
A divisão alemã da Wikimedia liderou esse esforço juntamente com a Jina.AI, especialista em pesquisa neural, e a DataStax, de propriedade da IBM, especializada em dados de treinamento em tempo real.
Embora o Wikidata há muito tempo forneça dados legíveis por máquina das propriedades da Wikimedia, as ferramentas anteriores limitavam-se a pesquisas por palavras-chave e consultas SPARQL. Esse sistema atualizado aprimora os recursos de geração aumentada por recuperação (RAG), permitindo que os desenvolvedores de IA ancorem seus modelos na base de conhecimento verificada pelo editor da Wikipédia.
O banco de dados estrutura os dados com um rico contexto semântico. Por exemplo, pesquisar "scientist" retorna listas de cientistas nucleares notáveis e pesquisadores do Bell Labs, juntamente com traduções multilíngues, imagens selecionadas da Wikimedia e termos relacionados, como "researcher" e "scholar".
Acessível via Toolforge, o Wikidata realizará um webinar para desenvolvedores em 9 de outubro para mostrar o potencial da plataforma.
Conecte-se com mais de 10.000 pioneiros em tecnologia e capital de risco no Disrupt 2025
Junte-se a gigantes do setor, como Netflix, Box, a16z, ElevenLabs e Vinod Khosla, em mais de 200 sessões repletas de estratégias de crescimento de startups e percepções tecnológicas. Garanta seu ingresso antecipado hoje mesmo - economize até US$ 444 antes da abertura da admissão geral.
Conecte-se com mais de 10.000 pioneiros em tecnologia e capital de risco no Disrupt 2025
Junte-se a gigantes do setor, como Netflix, Box, a16z, ElevenLabs e Vinod Khosla, em mais de 200 sessões repletas de estratégias de crescimento de startups e percepções tecnológicas. Garanta seu ingresso antecipado hoje mesmo - economize até US$ 444 antes da abertura da admissão geral.
Esse lançamento ocorre no momento em que os desenvolvedores de IA buscam cada vez mais fontes de dados premium para o refinamento de modelos. Os sistemas de treinamento modernos - agora ecossistemas complexos em vez de conjuntos de dados simples - ainda exigem informações meticulosamente selecionadas, especialmente para aplicativos críticos de precisão. O conteúdo verificado de fatos da Wikipédia oferece uma grande vantagem sobre conjuntos de dados em massa como o Common Crawl.
A busca por dados de qualidade traz riscos: A Anthropic recentemente propôs um acordo de US$ 1,5 bilhão depois que autores processaram o uso não autorizado de seus trabalhos para treinamento.
O líder do projeto de IA do Wikidata, Philippe Saadé, destacou sua independência: "Isso prova que a IA poderosa pode prosperar além dos silos corporativos - aberta, colaborativa e construída para o benefício público", disse ele à imprensa.
Artigo relacionado
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
A Anthropic entra no mercado de tecnologia jurídica de IA à medida que a competição se intensifica
A Anthropic apresentou na terça-feira um conjunto de novas funcionalidades para chatbots, destinadas a oferecer suporte automatizado a escritórios de advocacia. Essas melhorias expandem o Claude for Legal, a plataforma específica para firmas lançada
Recomendações de tópicos especiais relacionados
Comentários (3)
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡

A Wikimedia Deutschland apresentou nesta quarta-feira um novo banco de dados criado para aprimorar o acesso dos modelos de IA ao extenso repositório de conhecimento da Wikipédia.
Batizada de Wikidata Embedding Project, essa iniciativa aproveita a tecnologia de pesquisa semântica baseada em vetores - permitindo que os computadores compreendam os significados e as relações entre as palavras - aplicada à vasta rede da Wikipédia de quase 120 milhões de entradas em suas plataformas irmãs.
Com compatibilidade adicional para o Protocolo de Contexto de Modelo (MCP), uma estrutura que facilita a comunicação entre IA e fonte de dados, o projeto aprimora a forma como modelos de linguagem grandes interagem e recuperam informações por meio de consultas em linguagem natural.
A divisão alemã da Wikimedia liderou esse esforço juntamente com a Jina.AI, especialista em pesquisa neural, e a DataStax, de propriedade da IBM, especializada em dados de treinamento em tempo real.
Embora o Wikidata há muito tempo forneça dados legíveis por máquina das propriedades da Wikimedia, as ferramentas anteriores limitavam-se a pesquisas por palavras-chave e consultas SPARQL. Esse sistema atualizado aprimora os recursos de geração aumentada por recuperação (RAG), permitindo que os desenvolvedores de IA ancorem seus modelos na base de conhecimento verificada pelo editor da Wikipédia.
O banco de dados estrutura os dados com um rico contexto semântico. Por exemplo, pesquisar "scientist" retorna listas de cientistas nucleares notáveis e pesquisadores do Bell Labs, juntamente com traduções multilíngues, imagens selecionadas da Wikimedia e termos relacionados, como "researcher" e "scholar".
Acessível via Toolforge, o Wikidata realizará um webinar para desenvolvedores em 9 de outubro para mostrar o potencial da plataforma.
Conecte-se com mais de 10.000 pioneiros em tecnologia e capital de risco no Disrupt 2025
Junte-se a gigantes do setor, como Netflix, Box, a16z, ElevenLabs e Vinod Khosla, em mais de 200 sessões repletas de estratégias de crescimento de startups e percepções tecnológicas. Garanta seu ingresso antecipado hoje mesmo - economize até US$ 444 antes da abertura da admissão geral.
Conecte-se com mais de 10.000 pioneiros em tecnologia e capital de risco no Disrupt 2025
Junte-se a gigantes do setor, como Netflix, Box, a16z, ElevenLabs e Vinod Khosla, em mais de 200 sessões repletas de estratégias de crescimento de startups e percepções tecnológicas. Garanta seu ingresso antecipado hoje mesmo - economize até US$ 444 antes da abertura da admissão geral.
Esse lançamento ocorre no momento em que os desenvolvedores de IA buscam cada vez mais fontes de dados premium para o refinamento de modelos. Os sistemas de treinamento modernos - agora ecossistemas complexos em vez de conjuntos de dados simples - ainda exigem informações meticulosamente selecionadas, especialmente para aplicativos críticos de precisão. O conteúdo verificado de fatos da Wikipédia oferece uma grande vantagem sobre conjuntos de dados em massa como o Common Crawl.
A busca por dados de qualidade traz riscos: A Anthropic recentemente propôs um acordo de US$ 1,5 bilhão depois que autores processaram o uso não autorizado de seus trabalhos para treinamento.
O líder do projeto de IA do Wikidata, Philippe Saadé, destacou sua independência: "Isso prova que a IA poderosa pode prosperar além dos silos corporativos - aberta, colaborativa e construída para o benefício público", disse ele à imprensa.
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA
Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial
A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
A Anthropic entra no mercado de tecnologia jurídica de IA à medida que a competição se intensifica
A Anthropic apresentou na terça-feira um conjunto de novas funcionalidades para chatbots, destinadas a oferecer suporte automatizado a escritórios de advocacia. Essas melhorias expandem o Claude for Legal, a plataforma específica para firmas lançada
So they're basically selling training data to AI companies? As long as the knowledge stays accessible, I'm cool with it. 🤔
Das ist ein wirklich cleverer Schachzug von Wikipedia! Vektorsuche in ihren riesigen Datenbeständen könnte die Qualität von KI-Ausgaben enorm verbessern und vielleicht endlich mit den Halluzinationen aufräumen. Hoffentlich bleibt der Zugang aber transparent und für alle fair, damit nicht nur die großen Tech-Konzerne profitieren. Die deutsche Wikimedia-Abteilung zeigt mal wieder, dass sie vorne mitmischt. 💡





Lar






