火曜日にNature Communications誌に掲載されたMITのコンピューター科学者らによる新しい研究は、AIの著作権をめぐる議論を一変させる可能性のある発見をもたらした。拡散モデルがより多くのデータでトレーニングされるにつれて、その出力はトレーニング素材の特定の部分にまで遡ることがますます不可能になっている。研究者らはこの現象を「帰属の減衰」と呼んでいる。生成 AI の急速に変化する世界を追跡している読者にとって、この論文は、今週 AI Buzz Wire で取り上げられた最も重要な研究結果の 1 つです。
「生成拡散モデルの出力は帰属できない場合が多い」と題されたこの論文は、MIT のコンピュータ サイエンスおよび人工知能研究所 (CSAIL) に所属する Zheng Dai 氏と David K. Gifford 氏によって執筆されました。彼らの中心的な質問は、一見単純に見えますが、生成モデルが画像を生成するとき、その出力に関与するトレーニング データ内の特定の項目を見つけることができるかというものでした。
研究者が発見したこと
答えはますます「ノー」です。研究者らは、生成されたサンプルの原因となっているトレーニング データの一部を特定するタスクとして定義されるアトリビューションは、「モデルが十分に大きなデータ コーパスでトレーニングされている場合には不可能になる可能性がある」ことを示しています。
「モデルがトレーニングされるデータが増えるほど、生成されたサンプルの帰属可能性が低くなることを発見しました。これを今後、帰属減衰と呼ぶ現象です」と著者らは書いています。
これをテストするために、チームは、コストのかかる再トレーニングを行わずに、トレーニング済みのモデルから特定のトレーニング サンプルを削除できる「アブレーション」方法論を開発しました。次に、彼らは大規模な仮定の実験を実行しました。特定の画像、またはクリエイターの一連の作品全体がトレーニング セットに存在しなかったら、モデルは何を生成するでしょうか?
この研究の最も印象的な結果のいくつかは、十分に大規模なデータセットでトレーニングされたモデルの場合、モナ・リザ、あるいはレオナルド・ダ・ヴィンチのすべての作品を削除しても、モデルは依然として画像や芸術的スタイルを再現できることを研究者らが発見したことである。出力に因果関係のある単一のトレーニング項目はありません。
著作権訴訟においてそれが重要な理由
調査結果は、活発な法的戦場の真っ只中に着地した。 Midjourney や Stable Diffusion などの拡散モデルは、トレーニング データ内の作品のコピーによって AI システムが出力やスタイルを再現できると主張するアーティストからの訴訟を引き起こしています。
2023 年から進行中の著作権訴訟の 1 つで、アンダーセンらは次のように述べています。 v. Stability AI Ltd.の原告らは、Midjourney に対し、そのモデルのトレーニングに使用されたデータセットの開示を強制しようとしてきました。彼らは、Midjourney が「モデルがそれらのアーティストの表現力豊かなコンテンツを模倣できるようにするという明確な目的のために、特定のアーティストの名前に関連付けられた画像をスクレイピングすることによって」トレーニング セットを構築したと主張しています。
MITの研究は、そのような因果関係を確立することは大規模では技術的に不可能である可能性があることを示唆しています。この研究の詳細を最初に報じたThe Registerが指摘したように、この研究はAIの規制を容易にするどころか、むしろ困難にする可能性が高く、研究を始めたときに著者らが期待していたものとは逆である。
フェアユースの問題
MITのプレスリリースの中でギフォード氏は、この調査結果は双方向に効果があると主張している。生成された出力が個々のトレーニング データと何の関係もない場合、モデルは単なるコピー機ではなく、真に創造的なものになる可能性があります。
「そのことは、フェアユース、出力自体が小説作品として著作権で保護されるかどうか、そしてモデルから得られたものがインターネット上の何にも起因しない場合に著者がどのように補償を受けるかについての疑問を引き起こす」とギフォード氏は述べた。
その影響は画像ジェネレータを超えて広がります。拡散モデルは、視聴覚メディアを生成するための主要なアーキテクチャとなっており、タンパク質構造モデリングや治療法の発見などの科学的用途での使用が増えています。アトリビューション ツールは、機械のアンラーニング、データ ポイズニングの検出、モデルの解釈可能性、公平性監査、プライバシー コンプライアンスのためにも提案されています。
アトリビューション関連のスタートアップへの警告
この調査には、AIの出所とコンテンツ検証ツールの成長産業に対する警告も含まれている。研究者らは、類似性に基づくアトリビューション(生成された出力を視覚的に類似したトレーニング画像と照合する)では、大規模なトレーニング データ領域で誤ったアトリビューションが生成されることを発見しました。
言い換えれば、「この AI 画像はそのアーティストのポートフォリオから来たものである」と主張するツールは、モデルが数十億枚の画像でトレーニングされた場合には単純に間違っている可能性があります。出所紛争を解決するために技術的な帰属を当てにしているプラットフォーム、裁判所、規制当局にとって、MITの結果は、そのような確実性はフロンティア規模のモデルでは手の届かない可能性があることを示唆している。
次に何が起こるか
この論文は、EU AI法の透明性要件やアーティスト補償制度の提案をめぐる議論など、進行中の訴訟や政策論争で引用されることが期待されている。帰属の減衰が最大の制作モデルに当てはまる場合、特定の作品への追跡出力に基づく報酬スキームは、アイテムレベルの追跡ではなく、集合的なライセンスを中心に再設計する必要がある可能性があります。
この研究は、AI 開発者にとって微妙な問題も提起しています。帰属不能性は、著作権で保護されたデータのトレーニングに対するフェアユースの議論を実際に強化する可能性があると同時に、個々の出力からの具体的な危害を証明するアーティストの能力を損なう可能性があります。著作権争いの双方は、データの中で何かを利用できるものを見つけることになるでしょう。
AI の先を行く
AI の最新の研究と分析については、AI Buzz Wire にアクセスして、AI 業界の毎日の報道をご覧ください。
AIニュースをもっと読む→