EleutherAI 發布用於AI訓練的大規模許可文本數據集

EleutherAI,一個領先的AI研究團體,推出了一個用於AI模型訓練的最大許可和開放領域文本集合之一。
名為Common Pile v0.1,此8太字节數據集由AI初創公司Poolside、Hugging Face以及多家學術機構合作開發,歷時兩年。它被用於訓練EleutherAI的兩個新模型,Comma v0.1-1T和Comma v0.1-2T,該組織聲稱這些模型的性能與使用未經許可的版權數據訓練的模型相當。
包括OpenAI在內的AI公司因使用網絡抓取數據(包括版權書籍和期刊)進行模型訓練而面臨法律挑戰。雖然一些公司與內容提供商達成許可協議,但許多公司依賴美國的合理使用原則,來為未經許可使用版權材料進行訓練提供依據。
EleutherAI認為,這些訴訟顯著降低了AI行業的透明度,限制了對模型功能和弱點的洞察,這對更廣泛的研究社區造成了損害。
“法律挑戰並未顯著改變模型訓練的數據來源實踐,但它們極大地降低了AI公司的開放性,”EleutherAI的執行董事Stella Biderman在週五的Hugging Face博客文章中表示。“我們與一些公司研究人員交談時,他們提到訴訟是他們無法分享以數據為中心的研究的原因。”
Common Pile v0.1可在Hugging Face的AI平台和GitHub上獲得,該數據集在法律諮詢下開發,包括國會圖書館和Internet Archive數位化的30萬本公共領域書籍等來源。EleutherAI還使用了OpenAI的Whisper模型來轉錄音頻內容。
EleutherAI聲稱Comma v0.1-1T和Comma v0.1-2T展示了Common Pile v0.1的質量,使開發者能夠創建與專有系統競爭的模型。這兩個模型各有70億個參數,並在數據集的一部分上進行訓練,在編碼、圖像理解和數學基準測試中與Meta的原始Llama模型競爭。
在您的TechCrunch全階段通行證上節省超過200美元
更智能地創新。更快速地成長。更深入地聯繫。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等遠見卓識者進行為期一天的洞察、研討會和寶貴聯繫。
在您的TechCrunch全階段通行證上節省超過200美元
更智能地創新。更快速地成長。更深入地聯繫。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等遠見卓識者進行為期一天的洞察、研討會和寶貴聯繫。
波士頓,麻薩諸塞州 | 7月15日起立即註冊參數,通常稱為權重,是AI模型內部塑造其行為和響應的元素。
“認為未經許可的文本對於高性能至關重要的信念是沒有根據的,”Biderman在她的文章中表示。“隨著公開許可和公共領域數據變得更容易獲取,我們預期使用此類內容訓練的模型將顯著改進。”
Common Pile v0.1部分解決了EleutherAI過去的爭議。幾年前,該團體發布了包含版權材料的開放數據集The Pile,這引起了批評和法律審查,因其在AI訓練中的使用。
EleutherAI承諾將更定期發布開放數據集,與研究和基礎設施合作夥伴合作。
太平洋時間上午9:48更新:Biderman在X上指出,EleutherAI為數據集和模型發布做出了貢獻,來自多倫多大學等合作夥伴的參與尤為重要,該大學共同領導了研究。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (2)
0/500
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀

EleutherAI,一個領先的AI研究團體,推出了一個用於AI模型訓練的最大許可和開放領域文本集合之一。
名為Common Pile v0.1,此8太字节數據集由AI初創公司Poolside、Hugging Face以及多家學術機構合作開發,歷時兩年。它被用於訓練EleutherAI的兩個新模型,Comma v0.1-1T和Comma v0.1-2T,該組織聲稱這些模型的性能與使用未經許可的版權數據訓練的模型相當。
包括OpenAI在內的AI公司因使用網絡抓取數據(包括版權書籍和期刊)進行模型訓練而面臨法律挑戰。雖然一些公司與內容提供商達成許可協議,但許多公司依賴美國的合理使用原則,來為未經許可使用版權材料進行訓練提供依據。
EleutherAI認為,這些訴訟顯著降低了AI行業的透明度,限制了對模型功能和弱點的洞察,這對更廣泛的研究社區造成了損害。
“法律挑戰並未顯著改變模型訓練的數據來源實踐,但它們極大地降低了AI公司的開放性,”EleutherAI的執行董事Stella Biderman在週五的Hugging Face博客文章中表示。“我們與一些公司研究人員交談時,他們提到訴訟是他們無法分享以數據為中心的研究的原因。”
Common Pile v0.1可在Hugging Face的AI平台和GitHub上獲得,該數據集在法律諮詢下開發,包括國會圖書館和Internet Archive數位化的30萬本公共領域書籍等來源。EleutherAI還使用了OpenAI的Whisper模型來轉錄音頻內容。
EleutherAI聲稱Comma v0.1-1T和Comma v0.1-2T展示了Common Pile v0.1的質量,使開發者能夠創建與專有系統競爭的模型。這兩個模型各有70億個參數,並在數據集的一部分上進行訓練,在編碼、圖像理解和數學基準測試中與Meta的原始Llama模型競爭。
在您的TechCrunch全階段通行證上節省超過200美元
更智能地創新。更快速地成長。更深入地聯繫。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等遠見卓識者進行為期一天的洞察、研討會和寶貴聯繫。
在您的TechCrunch全階段通行證上節省超過200美元
更智能地創新。更快速地成長。更深入地聯繫。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等遠見卓識者進行為期一天的洞察、研討會和寶貴聯繫。
波士頓,麻薩諸塞州 | 7月15日起立即註冊參數,通常稱為權重,是AI模型內部塑造其行為和響應的元素。
“認為未經許可的文本對於高性能至關重要的信念是沒有根據的,”Biderman在她的文章中表示。“隨著公開許可和公共領域數據變得更容易獲取,我們預期使用此類內容訓練的模型將顯著改進。”
Common Pile v0.1部分解決了EleutherAI過去的爭議。幾年前,該團體發布了包含版權材料的開放數據集The Pile,這引起了批評和法律審查,因其在AI訓練中的使用。
EleutherAI承諾將更定期發布開放數據集,與研究和基礎設施合作夥伴合作。
太平洋時間上午9:48更新:Biderman在X上指出,EleutherAI為數據集和模型發布做出了貢獻,來自多倫多大學等合作夥伴的參與尤為重要,該大學共同領導了研究。
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
Наконец-то качественные данные для обучения ИИ! 😄 Но интересно, как это повлияет на конкуренцию между OpenAI и другими компаниями. Может, скоро увидим более умные модели?
Wow, 8 terabytes of legally licensed text is a game-changer! It's fantastic to see more high-quality, transparent data becoming available. This should really help push open-source AI models forward and maybe even challenge some of the big players who rely on murkier data sources. Hopefully, it leads to more reliable and ethically-sound systems. Can't wait to see what gets built on this! 🚀





首頁






