Компании, занимающиеся искусственным интеллектом, скупают сотни тысяч старинных и вышедших из печати книг, вводят их содержимое в обучающие наборы данных, а затем уничтожают физические тома — практика промышленного масштаба, которая, по словам исследователей и книготорговцев, стирает культурное наследие, одновременно питая следующее поколение языковых моделей. Разоблачения, впервые появившиеся в судебных документах, а теперь разнесённые по европейским книжным сообществам, открыли новый фронт в войне за авторские права на ИИ. В последних новостях искусственного интеллекта о спорах в отношении обучающих данных, которые меняют отрасль, приведенные ниже подробности прослеживают, как охота за чистым текстом превратилась в костер редких книг.
Как работает практика
Согласно документам, раскрытым Anthropic во время судебного разбирательства в 2026 году и опубликованным The Washington Post, этот процесс намеренно индустриализируется. В документе описывается, как «гидравлический режущий станок» подрядчика по сканированию «аккуратно разрезал» книги, чтобы страницы можно было «сканировать на высокоскоростных, высококачественных сканерах производственного уровня». После оцифровки, как отмечается в документации, сканирующая компания «договаривается с компанией по переработке книг о том, чтобы забрать готовые книги».
Другими словами, книги не возвращаются. Они преобразуются в цифровой текст, а затем измельчаются.
Почему компаниям нужны старые печатные книги
Аппетит к физическим книгам обусловлен усугубляющейся проблемой для разработчиков ИИ: открытый Интернет все больше загрязняется текстом, сгенерированным ИИ. Как объяснил юридический блог Verfassungsblog в анализе под названием «ИИ пожирает книжный мир», обучение на синтетическом контенте рискует ухудшить качество модели — явление, которое исследователи называют коллапсом модели. Книги, напечатанные до 2022 года, напротив, гарантированно будут написаны человеком.
Существует и юридический расчет. Компании рассудили, что сканирование физических книг, которыми они владеют, может подпадать под положение «добросовестного использования» закона об авторском праве США, и эта защита, по их мнению, более надежна, чем очистка веб-контента, защищенного авторским правом. Примут ли суды этот аргумент, остается открытым вопросом, но это не остановило покупательский ажиотаж.
Феномен Zoom-книг
В Европе внимание было сосредоточено на канадском книжном онлайн-магазине Zoom Books, который, как сообщает Verfassungsblog, приобрел сотни тысяч научно-популярных изданий, на которые осталось мало коммерческого спроса. Эти тома — малоизвестные научные труды, региональные истории и специализированные технические руководства — почти бесполезны для продавцов подержанных книг, но представляют собой богатую жилу ранее неиспользованных учебных материалов для лабораторий ИИ.
Футуризм сообщает, что уничтожение происходит «в невероятных масштабах, даже если копий почти не осталось», а это означает, что для некоторых изданий отсканированная и измельченная копия могла быть одним из последних сохранившихся изданий в обращении.
Книготорговцы и исследователи сопротивляются
Эти сообщения встревожили продавцов антикварных книг, которые утверждают, что оптовые покупатели искажают рынок подержанных книг и удаляют редкие издания быстрее, чем архивы успевают их сохранить. Агентство Анадолу процитировало турецкого продавца антикварных книг, который выразил скептицизм по поводу масштабов претензий, одновременно признав растущую обеспокоенность на европейских книжных рынках. В статьях Times of India и Boing Boing эта тенденция описывалась как прямое следствие того, что компании, занимающиеся искусственным интеллектом, пытаются «избежать собственных отбросов ИИ», возвращаясь к печатным изданиям, существовавшим до появления Интернета.
Защитники природы утверждают, что уничтожение вызывает особую тревогу, поскольку ни один центральный реестр не отслеживает, какие книги были отсканированы и уничтожены. После уничтожения игры с низкой выживаемостью потеря может быть постоянной — если только компания, которая ее отсканировала, не решит поделиться цифровой копией, чего она обычно не делает.
Новый этап войны за авторские права
Кампания по покупке книг находится на пересечении двух неразрешенных юридических баталий: является ли обучение моделей ИИ на произведениях, защищенных авторским правом, без разрешения, добросовестным использованием, и меняет ли уничтожение физического источника после сканирования расчеты. Суды до сих пор посылали неоднозначные сигналы: некоторые решения отдавали предпочтение разработчикам ИИ, а другие сохраняли права создателей.
Для компаний, занимающихся искусственным интеллектом, расчет прост. Печатные книги содержат плотный, высококачественный текст, написанный людьми, который становится все труднее найти в Интернете. Для библиотек, архивов и коллекционеров, охраняющих редкие издания, компромисс гораздо менее выгоден: незаменимые физические артефакты превращаются в тренировочные жетоны, а затем перерабатываются в целлюлозу.
Эта практика также поднимает вопросы о прозрачности. Раскрытие информации Anthropic произошло только потому, что она была вынуждена в судебном процессе. Остается неизвестным, сколько других компаний придерживаются подобных стратегий, сколько книг уже уничтожено и появится ли какой-либо общеотраслевой стандарт для сохранения изданий, находящихся в зоне риска, прежде чем они будут отсканированы и выброшены.
Проблема масштаба, которую никто не может измерить
Одной из причин, затрудняющих контроль над этой тенденцией, является ее разбросанность. В отличие от одного большого архива или базы данных, кампания по покупке книг распределена по тысячам отдельных транзакций — при продаже недвижимости, продаже библиотеки и онлайн-торговых площадках — где оптовый покупатель, покупающий набор научно-популярных изданий, не вызывает явного тревожного сигнала. Однако, если суммировать сотни тысяч покупок, совокупный эффект заключается в незаметном удалении огромных объемов нишевых, малотиражных знаний из физических записей.
Библиотекари и архивариусы предупреждают, что потери распределены неравномерно. Бестселлеры массового рынка выживают в бесчисленных экземплярах, но названия, наиболее привлекательные для инструкторов по ИИ — специализированные, насыщенные информацией работы с небольшими тиражами — как раз те, которые с наименьшей вероятностью сохранятся где-либо еще. После уничтожения они могут существовать только в виде запатентованных обучающих данных, запертых на серверах компании и недоступных для общественности, которая первоначально их создала и полагалась на них.
Будьте впереди ИИ
Войны за обучающие данные усиливаются, и ставки выходят далеко за рамки корпоративных балансов. Чтобы читать больше новостей об искусственном интеллекте и следить за реакцией судов, регулирующих органов и защитников природы, продолжайте следить за AI Buzz Wire.
Читать больше новостей об искусственном интеллекте →