شرکتهای هوش مصنوعی صدها هزار کتاب عتیقه و چاپ نشده خریداری میکنند، محتویات آنها را به مجموعه دادههای آموزشی میخورند و سپس حجم فیزیکی را از بین میبرند – اقدامی در مقیاس صنعتی که به گفته محققان و کتابفروشان، میراث فرهنگی را پاک میکند، حتی اگر نسل بعدی مدلهای زبانی را تقویت کند. این افشاگری که ابتدا در اسناد دادگاه ظاهر شد و اکنون در جوامع کتابفروشی اروپا منعکس شده است، جبهه جدیدی را در جنگ حق چاپ با هوش مصنوعی باز کرده است. برای [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) در مورد بحثهای مربوط به آموزش و دادهها که صنعت را تغییر میدهد، جزئیات زیر چگونگی تبدیل شدن شکار متن پاک را به آتش کتابهای کمیاب نشان میدهد.
تمرین چگونه کار می کند
بر اساس اسنادی که توسط آنتروپیک در طول یک دادرسی در سال 2026 فاش شد و توسط واشنگتن پست گزارش شد، این روند عمداً صنعتی شده است. این پرونده توضیح میدهد که چگونه «ماشین برش با نیروی هیدرولیک» پیمانکار اسکن، کتابها را «بهراحتی» از هم جدا میکند تا بتوان صفحات را «بر روی اسکنرهای با سرعت بالا، کیفیت بالا و سطح تولید اسکن کرد». بایگانی اشاره کرد که پس از دیجیتالی شدن، شرکت اسکن "با شرکت بازیافت برنامه ریزی می کند تا کتاب های تکمیل شده را تحویل بگیرد."
به عبارت دیگر کتاب ها پس داده نمی شوند. آنها به متن دیجیتال کاهش یافته و سپس پالپ می شوند.
چرا شرکت ها کتاب های قدیمی و چاپی می خواهند
علاقه به کتابهای فیزیکی از یک مشکل بدتر برای توسعهدهندگان هوش مصنوعی ناشی میشود: اینترنت باز به طور فزایندهای با متون تولید شده توسط هوش مصنوعی آلوده میشود. همانطور که وبلاگ حقوقی Verfassungsblog در تحلیلی با عنوان "هوش مصنوعی دنیای کتاب را می خورد" توضیح داد، آموزش در مورد محتوای مصنوعی کیفیت مدل را کاهش می دهد - پدیده ای که محققان آن را فروپاشی مدل می نامند. در مقابل، کتابهایی که قبل از سال 2022 چاپ شدهاند، تضمین میشوند که توسط انسان نوشته شده باشند.
محاسبه قانونی هم دارد. شرکتها استدلال کردهاند که اسکن کردن کتابهای فیزیکی که دارند ممکن است تحت مقررات «استفاده منصفانه» قانون کپیرایت ایالات متحده باشد، دفاعی که آنها معتقدند قویتر از حذف محتوای وب دارای حق نسخهبرداری است. این که آیا دادگاهها این استدلال را میپذیرند، یک سوال باز باقی میماند، اما این امر شور خرید را متوقف نکرده است.
پدیده کتابهای بزرگنمایی
در اروپا، توجه به یک کتابفروشی آنلاین کانادایی به نام Zoom Books متمرکز شده است، که Verfassungsblog گزارش می دهد که صدها هزار عنوان غیرداستانی را به دست آورده است که تقاضای تجاری کمی برای آنها وجود دارد. این مجلدات - آثار آکادمیک مبهم، تاریخچههای منطقهای و دستورالعملهای فنی تخصصی - برای فروشندگان کتابهای دست دوم تقریباً بیارزش هستند، اما نشاندهنده رگهای غنی از مواد آموزشی استفاده نشده قبلی برای آزمایشگاههای هوش مصنوعی هستند.
Futurism گزارش داد که تخریب "در مقیاسی باورنکردنی، حتی اگر تقریباً هیچ نسخه ای باقی نماند" اتفاق می افتد، به این معنی که برای برخی از عناوین، نسخه اسکن شده و خرد شده ممکن است در میان آخرین نسخه های باقی مانده در گردش باشد.
کتابفروشان و پژوهشگران به عقب راندند
این گزارشها باعث نگرانی فروشندگان کتابهای عتیقه شده است که میگویند خریداران عمده بازار دست دوم را مخدوش میکنند و نسخههای کمیاب را سریعتر از بایگانیها حذف میکنند. خبرگزاری آنادولو به نقل از یک کتابفروش عتیقه ترکی اظهار داشت که نسبت به دامنه ادعاها تردید دارد و در عین حال نگرانی فزاینده در بازارهای کتاب اروپا را تایید کرد. پوشش خبری Times of India و Boing Boing این روند را نتیجه مستقیم تلاش شرکتهای هوش مصنوعی برای «فرار از شیب هوش مصنوعی» با عقبنشینی به چاپ قبل از اینترنت توصیف کرد.
محافظه کاران استدلال می کنند که تخریب به ویژه نگران کننده است زیرا هیچ دفتر ثبت مرکزی ردیابی کتاب هایی را که اسکن شده و از بین رفته است، ندارد. هنگامی که یک عنوان با بقای پایین خرد شود، ضرر ممکن است دائمی باشد - مگر اینکه شرکتی که آن را اسکن کرده است، کپی دیجیتال را به اشتراک بگذارد، که معمولاً این کار را نمی کند.
مرحله جدیدی از جنگ حق چاپ
کمپین خرید کتاب در تقاطع دو نبرد حقوقی حلنشده قرار دارد: اینکه آیا آموزش مدلهای هوش مصنوعی بر روی آثار دارای حق چاپ بدون مجوز به منزله استفاده منصفانه است و آیا از بین بردن منبع فیزیکی پس از اسکن، حساب را تغییر میدهد. دادگاهها تاکنون سیگنالهای متفاوتی ارسال کردهاند که برخی از احکام به نفع توسعهدهندگان هوش مصنوعی هستند و برخی دیگر ادعاهای سازندگان را حفظ میکنند.
برای شرکتهای هوش مصنوعی، محاسبه ساده است. کتابهای چاپی متنی متراکم، باکیفیت و نوشتهشده توسط انسان ارائه میدهند که یافتن آنها بهصورت آنلاین بهطور فزایندهای دشوار است. برای کتابخانهها، بایگانیها و مجموعهدارانی که از نسخههای کمیاب محافظت میکنند، این مبادله به مراتب کمتر مطلوب است: مصنوعات فیزیکی غیرقابل جایگزینی به نشانههای آموزشی کاهش مییابند و سپس به خمیر کاغذ بازیافت میشوند.
این عمل همچنین سؤالاتی را در مورد شفافیت ایجاد می کند. افشای آنتروپیک تنها به این دلیل بود که در دعوی قضایی مجبور شد. هنوز مشخص نیست که چند شرکت دیگر استراتژیهای مشابه را دنبال میکنند، چند کتاب قبلاً نابود شدهاند یا اینکه آیا استانداردی در سطح صنعت برای حفظ عناوین در معرض خطر قبل از اسکن و دور انداختن آنها پدیدار خواهد شد یا خیر.
مشکل مقیاس که هیچ کس نمی تواند کمیت کند
بخشی از آنچه این روند را برای پلیس دشوار می کند، پراکندگی آن است. برخلاف یک بایگانی یا پایگاه داده بزرگ، کمپین خرید کتاب در میان هزاران تراکنش فردی توزیع میشود - در فروش املاک، فروش غیرقانونی کتابخانهها، و بازارهای آنلاین - جایی که یک خریدار انبوه با خرید پالت عناوین غیرداستانی هیچ پرچم قرمز آشکاری برافراشته است. با این حال، در میان صدها هزار خرید جمعآوری شده است، اما اثر تجمعی، حذف بیصدا بخشهای وسیعی از دانش کمتیراژ از سوابق فیزیکی است.
کتابداران و بایگانی ها هشدار داده اند که ضرر به طور مساوی توزیع نمی شود. پرفروشترینهای بازار انبوه در نسخههای بیشماری باقی میمانند، اما جذابترین عناوین برای مربیان هوش مصنوعی - آثار تخصصی و پر اطلاعات با چاپهای کوچک - دقیقاً همانهایی هستند که کمترین احتمال را دارد در جاهای دیگر حفظ شوند. پس از نابودی، آنها ممکن است فقط به عنوان داده های آموزشی اختصاصی قفل شده در سرورهای یک شرکت وجود داشته باشند و برای عموم مردمی که در ابتدا تولید و به آنها متکی بودند غیرقابل دسترسی باشند.
از هوش مصنوعی جلوتر بمانید
جنگ های آموزشی-داده ای در حال تشدید است، و مخاطرات فراتر از ترازنامه شرکت ها است. برای [اطلاعات بیشتر اخبار هوش مصنوعی] (https://aibuzzwire.news) و پیگیری واکنش دادگاهها، قانونگذاران، و محافظان، همچنان AI Buzz Wire را دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →