研究:OpenAI模型记忆的受版权保护内容
一项最新研究表明,OpenAI可能确实使用了受版权保护的材料来训练其部分AI模型,为公司面临的持续法律争议增添了依据。作者、程序员和其他内容创作者指控OpenAI未经许可使用他们的作品——如书籍和代码——来开发其AI模型。虽然OpenAI以合理使用为由进行辩护,但原告认为美国版权法并未为训练数据提供例外条款。
这项研究由华盛顿大学、哥本哈根大学和斯坦福大学的研究人员合作开展,介绍了一种新技术,用于检测通过API访问的模型(如OpenAI的模型)中“记忆”的训练数据。AI模型通过从海量数据中学习来识别模式,从而能够生成文章、图像等。虽然大多数输出并非训练数据的直接复制,但由于学习过程,某些输出不可避免地是复制品。例如,图像模型已知会重现电影截图,而语言模型则被发现几乎是在抄袭新闻文章。
研究中描述的方法聚焦于“高意外性”词汇——在特定语境中不常见的词汇。例如,在句子“Jack和我一动不动地坐着,雷达发出嗡嗡声”中,“雷达”是高意外性词汇,因为相比“引擎”或“收音机”等词汇,它出现在“嗡嗡声”前更不常见。
研究人员测试了多个OpenAI模型,包括GPT-4和GPT-3.5,通过从小说书籍片段和《纽约时报》文章中移除高意外性词汇,并要求模型预测这些缺失的词汇。如果模型能够准确猜测这些词汇,则表明它们在训练过程中记忆了这些文本。

一个让模型“猜测”高意外性词汇的示例。图片来源:OpenAI 结果显示,GPT-4很可能记忆了流行小说书籍的部分内容,包括BookMIA数据集中的受版权保护的电子书。它似乎也记忆了一些《纽约时报》的文章,尽管频率较低。华盛顿大学博士生、研究合著者Abhilasha Ravichander向TechCrunch强调,这些发现突显了训练这些模型可能使用的“有争议数据”。“为了拥有值得信赖的大型语言模型,我们需要能够对其进行探测、审计和科学检查的模型,”Ravichander表示。“我们的工作旨在提供一种探测大型语言模型的工具,但整个生态系统迫切需要更高的数据透明度。”
OpenAI一直推动放宽使用受版权保护数据开发AI模型的规则。尽管该公司与一些内容许可协议达成合作,并为版权持有者提供了退出选项,但它也在向各国政府游说,试图为AI训练建立专门的“合理使用”规则。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (34)
0/500
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?
一项最新研究表明,OpenAI可能确实使用了受版权保护的材料来训练其部分AI模型,为公司面临的持续法律争议增添了依据。作者、程序员和其他内容创作者指控OpenAI未经许可使用他们的作品——如书籍和代码——来开发其AI模型。虽然OpenAI以合理使用为由进行辩护,但原告认为美国版权法并未为训练数据提供例外条款。
这项研究由华盛顿大学、哥本哈根大学和斯坦福大学的研究人员合作开展,介绍了一种新技术,用于检测通过API访问的模型(如OpenAI的模型)中“记忆”的训练数据。AI模型通过从海量数据中学习来识别模式,从而能够生成文章、图像等。虽然大多数输出并非训练数据的直接复制,但由于学习过程,某些输出不可避免地是复制品。例如,图像模型已知会重现电影截图,而语言模型则被发现几乎是在抄袭新闻文章。
研究中描述的方法聚焦于“高意外性”词汇——在特定语境中不常见的词汇。例如,在句子“Jack和我一动不动地坐着,雷达发出嗡嗡声”中,“雷达”是高意外性词汇,因为相比“引擎”或“收音机”等词汇,它出现在“嗡嗡声”前更不常见。
研究人员测试了多个OpenAI模型,包括GPT-4和GPT-3.5,通过从小说书籍片段和《纽约时报》文章中移除高意外性词汇,并要求模型预测这些缺失的词汇。如果模型能够准确猜测这些词汇,则表明它们在训练过程中记忆了这些文本。

华盛顿大学博士生、研究合著者Abhilasha Ravichander向TechCrunch强调,这些发现突显了训练这些模型可能使用的“有争议数据”。“为了拥有值得信赖的大型语言模型,我们需要能够对其进行探测、审计和科学检查的模型,”Ravichander表示。“我们的工作旨在提供一种探测大型语言模型的工具,但整个生态系统迫切需要更高的数据透明度。”
OpenAI一直推动放宽使用受版权保护数据开发AI模型的规则。尽管该公司与一些内容许可协议达成合作,并为版权持有者提供了退出选项,但它也在向各国政府游说,试图为AI训练建立专门的“合理使用”规则。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?





首页






