Estudio: los modelos de OpenAI memorizaron contenido con derechos de autor
Un estudio reciente sugiere que OpenAI podría haber utilizado material protegido por derechos de autor para entrenar algunos de sus modelos de IA, añadiendo más leña al fuego de las batallas legales que enfrenta la compañía. Autores, programadores y otros creadores de contenido han acusado a OpenAI de usar sus obras —como libros y código— sin permiso para desarrollar sus modelos de IA. Aunque OpenAI se ha defendido alegando el uso justo, los demandantes argumentan que la ley de derechos de autor de EE. UU. no proporciona una excepción para los datos de entrenamiento.
El estudio, una colaboración entre investigadores de la Universidad de Washington, la Universidad de Copenhague y Stanford, presenta una nueva técnica para detectar datos de entrenamiento "memorizados" en modelos a los que se accede a través de una API, como los de OpenAI. Los modelos de IA esencialmente aprenden de grandes cantidades de datos para reconocer patrones, lo que les permite crear ensayos, imágenes y más. Aunque la mayoría de los resultados no son copias directas de los datos de entrenamiento, algunos lo son inevitablemente debido al proceso de aprendizaje. Por ejemplo, se sabe que los modelos de imágenes han reproducido capturas de pantalla de películas, mientras que los modelos de lenguaje han sido sorprendidos prácticamente plagiando artículos de noticias.
El método descrito en el estudio se centra en palabras de "alta sorpresa" —palabras que son inusuales en un contexto dado. Por ejemplo, en la frase "Jack y yo nos sentamos perfectamente quietos con el radar zumbando," "radar" sería una palabra de alta sorpresa porque es menos esperada que palabras como "motor" o "radio" para preceder a "zumbando."
Los investigadores probaron varios modelos de OpenAI, incluyendo GPT-4 y GPT-3.5, eliminando palabras de alta sorpresa de extractos de libros de ficción y artículos del New York Times y pidiendo a los modelos que predijeran estas palabras faltantes. Si los modelos adivinaban correctamente las palabras, esto sugería que habían memorizado el texto durante el entrenamiento.

Un ejemplo de hacer que un modelo "adivine" una palabra de alta sorpresa. Créditos de la imagen: OpenAI Los resultados indicaron que GPT-4 probablemente había memorizado partes de libros de ficción populares, incluyendo aquellos en el conjunto de datos BookMIA de libros electrónicos protegidos por derechos de autor. También parecía haber memorizado algunos artículos del New York Times, aunque con una frecuencia menor.Abhilasha Ravichander, estudiante de doctorado en la Universidad de Washington y coautora del estudio, enfatizó a TechCrunch que estos hallazgos destacan los "datos controvertidos" que podrían haber sido utilizados para entrenar estos modelos. "Para tener modelos de lenguaje grandes que sean confiables, necesitamos modelos que podamos sondear, auditar y examinar científicamente," afirmó Ravichander. "Nuestro trabajo busca proporcionar una herramienta para sondear modelos de lenguaje grandes, pero hay una necesidad real de mayor transparencia de datos en todo el ecosistema."
OpenAI ha presionado por reglas más relajadas sobre el uso de datos protegidos por derechos de autor para desarrollar modelos de IA. Aunque la compañía tiene algunos acuerdos de licencia de contenido y ofrece opciones de exclusión para los titulares de derechos de autor, ha presionado a varios gobiernos para establecer reglas de "uso justo" específicamente para el entrenamiento de IA.
Artículo relacionado
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
OpenAI enfrenta una demanda por secreto comercial de Apple
OpenAI rebatió las alegaciones de Apple sobre secretos comerciales el martes, argumentando que la demanda es infundada.“Tomamos estas afirmaciones en serio, pero no vemos ninguna evidencia que las respalde”, declaró OpenAI, según informó Ed Ludlow d
La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono
El líder de robótica de OpenAI, Caitlin Kalinowski, ha dimitido tras la controvertida asociación de la empresa con el Departamento de Defensa.“Esta no fue una decisión fácil”, explicó Kalinowski en un comunicado en redes sociales. “Aunque la IA dese
Recomendaciones de temas especiales relacionados
comentario (34)
0/500
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?
Un estudio reciente sugiere que OpenAI podría haber utilizado material protegido por derechos de autor para entrenar algunos de sus modelos de IA, añadiendo más leña al fuego de las batallas legales que enfrenta la compañía. Autores, programadores y otros creadores de contenido han acusado a OpenAI de usar sus obras —como libros y código— sin permiso para desarrollar sus modelos de IA. Aunque OpenAI se ha defendido alegando el uso justo, los demandantes argumentan que la ley de derechos de autor de EE. UU. no proporciona una excepción para los datos de entrenamiento.
El estudio, una colaboración entre investigadores de la Universidad de Washington, la Universidad de Copenhague y Stanford, presenta una nueva técnica para detectar datos de entrenamiento "memorizados" en modelos a los que se accede a través de una API, como los de OpenAI. Los modelos de IA esencialmente aprenden de grandes cantidades de datos para reconocer patrones, lo que les permite crear ensayos, imágenes y más. Aunque la mayoría de los resultados no son copias directas de los datos de entrenamiento, algunos lo son inevitablemente debido al proceso de aprendizaje. Por ejemplo, se sabe que los modelos de imágenes han reproducido capturas de pantalla de películas, mientras que los modelos de lenguaje han sido sorprendidos prácticamente plagiando artículos de noticias.
El método descrito en el estudio se centra en palabras de "alta sorpresa" —palabras que son inusuales en un contexto dado. Por ejemplo, en la frase "Jack y yo nos sentamos perfectamente quietos con el radar zumbando," "radar" sería una palabra de alta sorpresa porque es menos esperada que palabras como "motor" o "radio" para preceder a "zumbando."
Los investigadores probaron varios modelos de OpenAI, incluyendo GPT-4 y GPT-3.5, eliminando palabras de alta sorpresa de extractos de libros de ficción y artículos del New York Times y pidiendo a los modelos que predijeran estas palabras faltantes. Si los modelos adivinaban correctamente las palabras, esto sugería que habían memorizado el texto durante el entrenamiento.

Abhilasha Ravichander, estudiante de doctorado en la Universidad de Washington y coautora del estudio, enfatizó a TechCrunch que estos hallazgos destacan los "datos controvertidos" que podrían haber sido utilizados para entrenar estos modelos. "Para tener modelos de lenguaje grandes que sean confiables, necesitamos modelos que podamos sondear, auditar y examinar científicamente," afirmó Ravichander. "Nuestro trabajo busca proporcionar una herramienta para sondear modelos de lenguaje grandes, pero hay una necesidad real de mayor transparencia de datos en todo el ecosistema."
OpenAI ha presionado por reglas más relajadas sobre el uso de datos protegidos por derechos de autor para desarrollar modelos de IA. Aunque la compañía tiene algunos acuerdos de licencia de contenido y ofrece opciones de exclusión para los titulares de derechos de autor, ha presionado a varios gobiernos para establecer reglas de "uso justo" específicamente para el entrenamiento de IA.
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
OpenAI enfrenta una demanda por secreto comercial de Apple
OpenAI rebatió las alegaciones de Apple sobre secretos comerciales el martes, argumentando que la demanda es infundada.“Tomamos estas afirmaciones en serio, pero no vemos ninguna evidencia que las respalde”, declaró OpenAI, según informó Ed Ludlow d
La jefa de robótica de OpenAI, Caitlin Kalinowski, renuncia por la asociación con el Pentágono
El líder de robótica de OpenAI, Caitlin Kalinowski, ha dimitido tras la controvertida asociación de la empresa con el Departamento de Defensa.“Esta no fue una decisión fácil”, explicó Kalinowski en un comunicado en redes sociales. “Aunque la IA dese
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?





Hogar






