Компанії, що займаються штучним інтелектом, купують антикварні книги та книжки, які вже не друкувалися, сотнями тисяч, завантажуючи їхній вміст у навчальні набори даних, а потім знищуючи фізичні томи — ця практика промислового масштабу, яка, за словами дослідників і книготорговців, стирає культурну спадщину, навіть будучи джерелом живлення для наступного покоління мовних моделей. Розголошення, які вперше з’явилися в судових документах, а тепер охопили європейські книгорозповсюджувальні спільноти, відкрили новий фронт у війні за авторські права на ШІ. Для [надзвичайних новин штучного інтелекту] (https://aibuzzwire.news) про суперечки щодо навчальних даних, які змінюють галузь, у подробицях нижче показано, як полювання на чистий текст перетворилася на багаття рідкісних книг.
Як працює практика
Відповідно до документів, оприлюднених Anthropic під час судового розгляду 2026 року та повідомлених The Washington Post, процес навмисно індустріалізований. У документі описується, як «різальна машина з гідравлічним приводом» підрядника сканування «акуратно розрізає» книги, щоб сторінки можна було «сканувати на високошвидкісних високоякісних сканерах виробничого рівня». Після оцифрування, як зазначено в документі, скануюча компанія «планує з компанією з переробки забрати готові книги».
Іншими словами, книги не повертаються. Вони зводяться до цифрового тексту, а потім перетворюються в целюлозу.
Чому компанії хочуть старі друковані книги
Апетит до фізичних книг виникає через погіршення проблеми для розробників штучного інтелекту: відкритий Інтернет дедалі більше забруднюється текстом, створеним штучним інтелектом. Як пояснив юридичний блог Verfassungsblog в аналізі під назвою «AI Is Eating the Book World», навчання синтетичному вмісту ризикує погіршити якість моделі — явище, яке дослідники називають колапсом моделі. Книги, надруковані до 2022 року, навпаки, гарантовано написані людиною.
Є й юридичний розрахунок. Компанії вважають, що сканування фізичних книг, якими вони володіють, може підпадати під положення про «добросовісне використання» закону про авторське право США, захист, який, на їхню думку, є сильнішим, ніж копіювання захищеного авторським правом веб-вмісту. Чи приймають суди цей аргумент, залишається відкритим питанням, але це не зупинило ажіотаж купівлі.
Феномен Zoom Books
У Європі увагу зосередили на канадському книжковому онлайн-магазині під назвою Zoom Books, який, як повідомляє Verfassungsblog, купує сотні тисяч назв документальної літератури, комерційний попит на які залишається невеликим. Ці томи — незрозумілі академічні праці, регіональна історія та спеціальні технічні посібники — майже нічого не варті для продавців букіністики, але являють собою багату жилу раніше невикористаного навчального матеріалу для лабораторій ШІ.
Футуризм повідомляє, що руйнування відбувається «у неймовірних масштабах, навіть якщо копій майже не залишилося», тобто для деяких назв відскановані та подрібнені копії, можливо, були одними з останніх видань, що збереглися в обігу.
Продавці книг і дослідники відмовляються
Ці звіти викликали занепокоєння продавців антикварних книг, які кажуть, що масові покупці спотворюють ринок уживаних книг і вилучають рідкісні видання швидше, ніж архіви можуть їх зберегти. Агентство Anadolu цитує турецького продавця антикварних книг, який висловлює скептицизм щодо обсягу претензій, водночас визнаючи зростання занепокоєння на європейських книжкових ринках. Висвітлення у Times of India та Boing Boing сформулювало цю тенденцію як прямий наслідок того, що фірми штучного інтелекту намагаються «втекти від власних помиїв», відступаючи від друку до Інтернету.
Фахівці з охорони природи стверджують, що знищення є особливо тривожним, оскільки жоден центральний реєстр не відстежує, які книги були відскановані та знищені. Після того, як назву з низьким рівнем виживання подрібнено, втрата може бути остаточною, якщо тільки компанія, яка її відсканувала, вирішить поділитися цифровою копією, чого вона зазвичай не робить.
Новий етап війни за авторське право
Кампанія купівлі книг знаходиться на перетині двох невирішених юридичних баталій: чи вважається добросовісним використанням навчання моделей штучного інтелекту на роботах, захищених авторським правом, без дозволу, і чи змінює обчислення знищення фізичного джерела після сканування. Наразі суди надсилають неоднозначні сигнали: деякі рішення надають перевагу розробникам штучного інтелекту, а інші залишають позови творців.
Для компаній штучного інтелекту розрахунок простий. Друковані книги пропонують щільний, високоякісний текст, написаний людьми, який дедалі важче знайти в Інтернеті. Для бібліотек, архівів і колекціонерів, які охороняють рідкісні видання, компроміс набагато менш вигідний: незамінні фізичні артефакти перетворюються на навчальні жетони, а потім переробляються в целюлозу.
Ця практика також викликає питання щодо прозорості. Anthropic розкрила лише тому, що це було вимушено через судовий процес. Залишається невідомим, скільки інших компаній дотримуються подібних стратегій, скільки книг уже знищено, чи з’явиться якийсь галузевий стандарт для збереження назв, що знаходяться під загрозою, до того, як їх відсканують і викинуть.
Проблему масштабу ніхто не може визначити кількісно
Частково через те, що тренд важко контролювати, це його дифузність. На відміну від окремого великого архіву чи бази даних, кампанія купівлі книг розподіляється між тисячами окремих транзакцій — продажу нерухомості, продажу бібліотеки та онлайн-ринків, — де покупець, який купує масу документальної літератури, не викликає жодних очевидних перешкод. Однак сукупний результат, отриманий у сотнях тисяч покупок, полягає в тихому вилученні величезної кількості нішевих, малотиражованих знань із фізичних записів.
Бібліотекарі та архівісти попереджають, що втрати розподілені нерівномірно. Масові бестселери виживають у незліченних примірниках, але назви, які найбільше приваблюють інструкторів зі штучного інтелекту — спеціалізовані, насичені інформацією твори з невеликими накладами — саме ті, які найменше ймовірно збережуться деінде. Після знищення вони можуть існувати лише як приватні навчальні дані, заблоковані на серверах компанії, недоступні для громадськості, яка їх спочатку створила та покладалася на них.
Будьте попереду ШІ
Війна тренувальних даних посилюється, і ставки виходять далеко за межі корпоративних балансів. Щоб читати більше новин штучного інтелекту і слідкувати за реакцією судів, регуляторів і природоохоронців, продовжуйте стежити за AI Buzz Wire.
Читати більше новин AI →