選項
首頁
新聞
研究:OpenAI模型記憶的受版權保護內容

研究:OpenAI模型記憶的受版權保護內容

2025-04-10
304

近期一項研究表明,OpenAI確實可能使用了受版權保護的材料來訓練其部分AI模型,為該公司面臨的持續法律爭議增添了燃料。作者、程式設計師和其他內容創作者指控OpenAI未經許可使用他們的作品(如書籍和程式碼)來開發其AI模型。雖然OpenAI以合理使用為由進行辯護,但原告認為美國版權法並未為訓練數據提供例外。

這項研究由華盛頓大學、哥本哈根大學和史丹佛大學的研究人員合作進行,介紹了一種新技術,用於檢測通過API存取的模型(如OpenAI的模型)中「記憶」的訓練數據。AI模型基本上從大量數據中學習以識別模式,使其能夠創作文稿、圖像等。雖然大多數輸出並非訓練數據的直接複製品,但由於學習過程,某些輸出難免是複製品。例如,圖像模型已知會重現電影截圖,而語言模型則被發現幾乎是在抄襲新聞文章。

研究中描述的方法聚焦於「高驚訝度」詞彙——在特定情境中不常見的詞。例如,在句子「Jack和我靜坐不動,雷達嗡嗡作響」中,「雷達」是一個高驚訝度詞,因為相較於「引擎」或「收音機」等詞,它較不常與「嗡嗡作響」連繫。

研究人員測試了多個OpenAI模型,包括GPT-4和GPT-3.5,方法是從小說書籍和新紐約時報文章的摘錄中移除高驚訝度詞彙,並要求模型預測這些缺失的詞。如果模型能準確猜出這些詞,則表明它們在訓練過程中記憶了這些文本。

OpenAI版權研究

一個讓模型「猜測」高驚訝度詞的例子。圖片來源:OpenAI
結果顯示,GPT-4很可能記憶了受版權保護的電子書數據集BookMIA中的部分熱門小說書籍內容。它似乎也記憶了一些紐約時報的文章,儘管頻率較低。

華盛頓大學博士生兼研究合著者Abhilasha Ravichander向TechCrunch強調,這些發現凸顯了可能用於訓練這些模型的「具爭議性數據」。「為了擁有值得信賴的大型語言模型,我們需要能夠探查、審計和科學檢驗的模型,」Ravichander表示。「我們的工作旨在提供一個探查大型語言模型的工具,但整個生態系統對數據透明度的需求確實很大。」

OpenAI一直推動放寬使用受版權保護數據來開發AI模型的規則。雖然該公司已與一些內容持有者簽訂了授權協議,並為版權持有人提供退出選項,但它也向各國政府遊說,試圖為AI訓練建立「合理使用」規則。

相關文章
山姆·奧特曼引發關於人工智慧減速的辯論 山姆·奧特曼引發關於人工智慧減速的辯論 在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗 OpenAI 與蘋果公司就商業秘密訴訟進行對抗 OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職 OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職 OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
代碼 適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具
適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具

2026 年最新、最優秀的 GitHub 團隊 AI 拉取請求審查工具,就在 XIX.AI!這份精選且評價極高的清單,展示了多款強大且能徹底改變遊戲規則的解決方案,可優化所有團隊工作流程中的重構、錯誤修復及安全漏洞偵測。 透過免費與付費版本的比較、實際測試結果以及詳細排名,協助您找到能顯著提升生產力的完美工具。立即探索,釋放您的 AI 競爭優勢!

12 個工具
xix.ai
評論 (34)
0/500
DouglasScott
DouglasScott 2026-07-31 04:00:18

So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.

JackAllen
JackAllen 2025-12-30 22:30:40

这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。

WilliamGonzalez
WilliamGonzalez 2025-08-25 17:01:06

This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤

GregoryBaker
GregoryBaker 2025-08-23 19:01:18

This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.

JohnGarcia
JohnGarcia 2025-04-23 23:10:14

Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?

TimothyMitchell
TimothyMitchell 2025-04-22 08:12:42

OpenAIが著作権付きの資料を使ってAIを訓練しているという研究は本当に驚きですね!クリエイターにとっては残念ですが、AIの訓練方法について知るのは面白いです。もっと透明性が必要かもしれませんね?🤔

OR