人工知能企業は、何十万冊もの古書や絶版本を購入し、その内容をトレーニング データセットに入力し、物理的な書籍を破棄しています。研究者や書店によれば、この産業規模の行為は、次世代の言語モデルを促進する一方で、文化遺産を消去しているとのことです。この暴露は、最初に法廷文書で明らかになり、現在ではヨーロッパの書籍販売コミュニティ全体に反響を呼び、AI著作権戦争に新たな前線を切り開いた。業界を再構築するトレーニング データ論争に関する AI ニュース速報 については、以下の詳細で、クリーン テキストの探索がどのようにして貴重な書籍の発掘に変わったかを追跡します。
実践の仕組み
2026年の裁判中にアンスロピック社が開示し、ワシントン・ポスト紙が報じた文書によると、このプロセスは意図的に工業化されているという。申請書類には、スキャン請負業者の「油圧式裁断機」がどのように本を「きれいに裁断」し、ページを「高速、高品質、生産レベルのスキャナーでスキャン」できるようにするかについて説明されている。提出書類によれば、デジタル化されたら、スキャン会社は「完成した書籍を引き取るためにリサイクル会社とスケジュールを調整する」予定だという。
つまり、本は返却されません。これらはデジタル テキストに変換されてからパルプ化されます。
企業が古い印刷本を求める理由
物理的な書籍への欲求は、AI 開発者にとって深刻な問題から生じています。オープンなインターネットは、AI によって生成されたテキストによってますます汚染されています。法律ブログ Verfassungsblog が「AI が本の世界を蝕んでいる」と題した分析で説明しているように、合成コンテンツのトレーニングはモデルの品質を低下させる危険性があり、研究者はこの現象をモデル崩壊と呼んでいます。対照的に、2022 年より前に印刷された書籍は、人間が書いたものであることが保証されています。
法的な計算もあります。企業は、自社が所有する物理的な書籍をスキャンすることは米国著作権法の「フェアユース」規定に該当する可能性があると主張しており、これは著作権で保護されたWebコンテンツをスクレイピングするよりも強力な防御手段であると考えている。裁判所がその主張を認めるかどうかは未解決の問題だが、それでも購買意欲は止まらない。
ズーム ブック現象
ヨーロッパでは、Zoom Booksというカナダのオンライン書店に注目が集まっており、Verfassungsblogの報告によると、同社は商業需要がほとんど残っていないノンフィクションタイトルを何十万冊も獲得しているという。これらの本(知られていない学術著作、地域の歴史、専門的な技術マニュアル)は、古本販売業者にとってほとんど価値がありませんが、AI 研究室にとってはこれまで未開発だったトレーニング資料の豊富な鉱脈を表しています。
Futurismは、破壊は「コピーがほとんど残っていないにもかかわらず、信じられないほどの規模で」起こっていると報告した。これは、一部のタイトルについては、スキャンされシュレッダーにかけられたコピーが、流通している最後の生き残った版の1つである可能性があることを意味している。
書店員と研究者が反発
この報告書は古書店業者らに警鐘を鳴らしている。彼らは、大量購入者が古本市場を歪曲し、アーカイブで保存できるよりも早く希少版を撤去していると主張している。アナドル庁は、ヨーロッパの書籍市場全体で懸念が高まっていることを認めながらも、特許請求の範囲について懐疑的な姿勢を表明したトルコの古書店業者の話を引用した。 Times of India と Boing Boing の報道は、この傾向を、AI 企業がインターネット以前の印刷物に後退することで「AI の低迷から逃れよう」としている直接の結果であると組み立てました。
保存活動家らは、どの本がスキャンされ破壊されたかを中央登録簿が追跡していないため、この破壊は特に厄介であると主張している。保存度の低いタイトルがシュレッダーにかけられると、そのタイトルをスキャンした会社がデジタル コピーを共有することを選択しない限り、損失は永久に残る可能性がありますが、通常は共有しません。
著作権戦争の新たな段階
この書籍購入キャンペーンは、2 つの未解決の法廷闘争の交差点に位置している。著作権で保護された作品を対象に AI モデルを許可なくトレーニングすることがフェアユースに当たるかどうか、もう 1 つはスキャン後に物理的ソースを破壊することで計算が変わるかどうかである。裁判所はこれまでのところ、AI開発者に有利な判決もあれば、クリエイターの主張を維持する判決もあり、さまざまなシグナルを送っている。
AI 企業にとって、計算は簡単です。印刷された書籍には、人間が執筆した密度の高い高品質のテキストが含まれていますが、オンラインで見つけるのはますます困難になっています。図書館、アーカイブ、および希少版を保護するコレクターにとって、そのトレードオフははるかに好ましくありません。かけがえのない物理的なアーティファクトがトレーニング トークンに還元され、その後パルプにリサイクルされるのです。
この実践では透明性についても疑問が生じます。 Anthropic 社の開示は、訴訟で強制されたという理由だけで行われました。他にどれだけの企業が同様の戦略を追求しているのか、すでに何冊の書籍が廃棄されているのか、また、危険にさらされている書籍がスキャンされて廃棄される前に保存するための業界全体の標準が策定されるのかどうかは、依然として不明である。
誰も定量化できないスケールの問題
この傾向を取り締まることを困難にしている理由の 1 つは、その拡散性です。単一の大規模なアーカイブやデータベースとは異なり、書籍購入キャンペーンは、不動産販売、図書館の登録解除セール、オンライン マーケットプレイスなど、何千もの個別の取引に分散されており、ノンフィクション タイトルのパレットをまとめ買いする購入者が明らかな危険信号を発することはありません。しかし、何十万件もの購入を集約すると、その累積的な影響は、膨大なニッチで流通量の少ない知識を物理的な記録から静かに削除することになります。
図書館員やアーキビストらは、損失は均等に分配されていないと警告している。大衆市場のベストセラーは数え切れないほど部数を残して残っていますが、AI トレーナーにとって最も魅力的なタイトル、つまり少部数の専門的で情報量の多い作品は、まさに他の場所で保存される可能性が最も低いものです。破棄されると、それらは企業のサーバー内にロックされた独自のトレーニング データとしてのみ存在し、最初に作成および依存していた一般の人々はアクセスできなくなります。
AI の先を行く
トレーニングデータをめぐる争いは激化しており、その利害は企業のバランスシートをはるかに超えています。 AI ニュースをもっと読む、裁判所、規制当局、保全活動家の対応を追跡するには、AI Buzz Wire をフォローし続けてください。
AIニュースをもっと読む→