調査:Openaiモデルは著作権で保護されたコンテンツを記憶しました
最近の研究によると、OpenAIがそのAIモデルの一部を訓練するために著作権のある素材を使用した可能性があることが示唆されており、 同社が直面している進行中の法廷闘争にさらなる火種を投じています。作家、プログラマー、その他のコンテンツクリエイターは、OpenAIがそのAIモデルを開発するために、 本やコードなどの彼らの作品を許可なく使用したと非難しています。OpenAIはフェアユースを主張して自らを弁護していますが、 原告側は米国著作権法には訓練データに対する例外規定がないと主張しています。
この研究は、ワシントン大学、コペンハーゲン大学、スタンフォード大学の研究者による共同研究であり、 OpenAIのようなAPIを通じてアクセスされるモデルで「記憶された」訓練データを検出する新しい技術を導入しています。 AIモデルは、膨大なデータからパターンを認識することを学び、エッセイや画像などを生成できるようになります。 ほとんどの出力は訓練データの直接のコピーではありませんが、学習プロセスのため、一部は必然的にそうなることがあります。 例えば、画像モデルは映画のスクリーンショットを再現することが知られており、言語モデルはニュース記事をほぼ剽窃していると指摘されています。
研究で説明されている手法は、「高サプライザル」な単語、つまり特定の文脈で異常な単語に焦点を当てています。 例えば、「ジャックと私はレーダーがブーンと鳴る中、完全に静かに座っていた」という文で、「レーダー」は「エンジン」や「ラジオ」などの単語が「ブーンと鳴る」に先行することが期待されるよりも予測しにくいため、高サプライザルな単語となります。
研究者たちは、GPT-4やGPT-3.5を含むいくつかのOpenAIモデルをテストしました。フィクションの本やニューヨーク・タイムズの記事から高サプライザルな単語を削除し、モデルにその欠落した単語を予測させました。モデルが正確に単語を推測した場合、それは訓練中にそのテキストを記憶していたことを示唆しています。

モデルが「高サプライザル」な単語を「推測」する例。画像クレジット:OpenAI 研究の結果、GPT-4がBookMIAデータセットの著作権付き電子書籍を含む人気のフィクション本の一部を記憶していた可能性が高いことが示されました。また、ニューヨーク・タイムズの記事もいくつか記憶していたようですが、その頻度は低かったです。
ワシントン大学の博士課程学生であり、研究の共著者であるアビラシャ・ラビチャンダー氏は、TechCrunchに対し、これらの発見がこれらのモデルを訓練するために使用された可能性のある「問題のあるデータ」を強調していると述べました。「信頼できる大規模言語モデルを持つためには、科学的かつ監査可能で調査可能なモデルが必要です」とラビチャンダー氏は述べました。「私たちの研究は大規模言語モデルを調査するツールを提供することを目指していますが、エコシステム全体でデータの透明性を高める必要が本当にあるのです。」
OpenAIは、AIモデルの開発に著作権のあるデータを使用するルールを緩和することを推進しています。同社は一部のコンテンツライセンス契約を持ち、著作権者にオプトアウトのオプションを提供していますが、AI訓練に特化した「フェアユース」のルールを確立するよう、さまざまな政府に働きかけています。
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (34)
0/500
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?
最近の研究によると、OpenAIがそのAIモデルの一部を訓練するために著作権のある素材を使用した可能性があることが示唆されており、 同社が直面している進行中の法廷闘争にさらなる火種を投じています。作家、プログラマー、その他のコンテンツクリエイターは、OpenAIがそのAIモデルを開発するために、 本やコードなどの彼らの作品を許可なく使用したと非難しています。OpenAIはフェアユースを主張して自らを弁護していますが、 原告側は米国著作権法には訓練データに対する例外規定がないと主張しています。
この研究は、ワシントン大学、コペンハーゲン大学、スタンフォード大学の研究者による共同研究であり、 OpenAIのようなAPIを通じてアクセスされるモデルで「記憶された」訓練データを検出する新しい技術を導入しています。 AIモデルは、膨大なデータからパターンを認識することを学び、エッセイや画像などを生成できるようになります。 ほとんどの出力は訓練データの直接のコピーではありませんが、学習プロセスのため、一部は必然的にそうなることがあります。 例えば、画像モデルは映画のスクリーンショットを再現することが知られており、言語モデルはニュース記事をほぼ剽窃していると指摘されています。
研究で説明されている手法は、「高サプライザル」な単語、つまり特定の文脈で異常な単語に焦点を当てています。 例えば、「ジャックと私はレーダーがブーンと鳴る中、完全に静かに座っていた」という文で、「レーダー」は「エンジン」や「ラジオ」などの単語が「ブーンと鳴る」に先行することが期待されるよりも予測しにくいため、高サプライザルな単語となります。
研究者たちは、GPT-4やGPT-3.5を含むいくつかのOpenAIモデルをテストしました。フィクションの本やニューヨーク・タイムズの記事から高サプライザルな単語を削除し、モデルにその欠落した単語を予測させました。モデルが正確に単語を推測した場合、それは訓練中にそのテキストを記憶していたことを示唆しています。

ワシントン大学の博士課程学生であり、研究の共著者であるアビラシャ・ラビチャンダー氏は、TechCrunchに対し、これらの発見がこれらのモデルを訓練するために使用された可能性のある「問題のあるデータ」を強調していると述べました。「信頼できる大規模言語モデルを持つためには、科学的かつ監査可能で調査可能なモデルが必要です」とラビチャンダー氏は述べました。「私たちの研究は大規模言語モデルを調査するツールを提供することを目指していますが、エコシステム全体でデータの透明性を高める必要が本当にあるのです。」
OpenAIは、AIモデルの開発に著作権のあるデータを使用するルールを緩和することを推進しています。同社は一部のコンテンツライセンス契約を持ち、著作権者にオプトアウトのオプションを提供していますが、AI訓練に特化した「フェアユース」のルールを確立するよう、さまざまな政府に働きかけています。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
So OpenAI basically trained on copyrighted books and code without permission? Shocking absolutely no one. 😅 The real question is whether courts will actually make them pay damages or just slap a 'please don't do that again' fine. Either way, creators deserve better than being data fodder for billion-dollar models.
这篇文章提到的版权问题确实让人担忧,以后AI生成的内容会不会都带着'侵权'的标签?想想就觉得挺讽刺的,毕竟这些模型训练数据不透明,普通用户根本不知道输出里夹带了什么'私货'。希望有更严格的管理办法吧。
This is wild! OpenAI might’ve gobbled up copyrighted stuff to train their models? I’m not shocked, but it’s kinda shady. Hope those authors and coders get some justice! 😤
This is wild! OpenAI might've trained their models on copyrighted stuff? 😳 I wonder how many books and code snippets got swept up in that data vacuum. Ethics in AI is such a messy topic right now.
Me sorprendió un poco que OpenAI podría haber usado material con derechos de autor para entrenar sus modelos. Es un poco decepcionante, pero supongo que es el salvaje oeste allá en el mundo de la IA. 🤔 ¿Quizás deberían ser más cuidadosos la próxima vez?





家






