شرکت زیرساخت‌های وب Cloudflare کنترل جدیدی را معرفی کرده است که به ناشران وب‌سایت اجازه می‌دهد محتوای خود را از استفاده برای آموزش مدل‌های هوش مصنوعی مسدود کنند و در عین حال آن را در نتایج جستجوی سنتی کاملاً در دسترس نگه می‌دارند - جدایی که اکوسیستم خزنده قبلاً هرگز به طور کامل از آن پشتیبانی نکرده است.

این ویژگی که در وبلاگ Cloudflare در 15 سپتامبر اعلام شد، همراه با یک نام جدید "Accountable" برای اپراتورهای خزنده ارائه می شود. طبق گفته های Cloudflare، اپل، گوگل و مایکروسافت اولین شرکت هایی هستند که خزنده ها واجد شرایط هستند. هر کسی که [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) را در سال جاری ردیابی کند، می‌داند که این سوال که چه کسی محتوای منتشر شده را حذف می‌کند، به یکی از بحث‌برانگیزترین دعواهای خط‌مشی اینترنت تبدیل شده است.

مشکل خزنده با استفاده ترکیبی

مشکل اصلی آن چیزی است که Cloudflare آن را خزنده‌های با کاربرد مختلط می‌نامد: ربات‌های منفرد، مانند Googlebot، Bingbot و Applebot، که صفحات را هم برای ایجاد فهرست‌های جستجو و هم برای جمع‌آوری داده‌های آموزشی برای مدل‌های هوش مصنوعی واکشی می‌کنند. از لحاظ تاریخی، مالک سایتی که می‌خواست از آموزش هوش مصنوعی انصراف دهد، یک ابزار صریح داشت - robots.txt Disallow - و استفاده از آن خطر حذف کامل از نتایج جستجو را داشت.

تنظیم جدید Disallow AI Training Cloudflare به دلیل دستوری است که در فایل robots.txt سایت منتشر می کند. وقتی فعال باشد، اولویت بدون آموزش سایت با robots.txt همگام‌سازی می‌شود، خزنده‌های کاربری مختلط پاسخگو برای اهداف جستجو مجاز باقی می‌مانند و هر خزنده آموزشی دیگری مسدود می‌شود. Cloudflare خاطرنشان می‌کند که مسدود کردن خزنده‌های آموزشی - خزنده‌های آموزشی که توسط آمازون، آنتروپیک، متا و OpenAI اجرا می‌شوند نام می‌برد - هرگز در وهله اول بر جستجو تأثیری نداشت.

چه چیزی یک خزنده را "پاسخگو" می کند

برای کسب عنوان Accountable، یک اپراتور ربات باید مجموعه ای از الزامات مندرج در پست وبلاگ را برآورده کند یا متعهد به برآوردن آن باشد:

  • مکانیزمی برای انصراف صاحبان سایت از آموزش هوش مصنوعی، از طریق robots.txt یا استانداردی مشابه
  • مکانیزمی برای انصراف از خلاصه‌های هوش مصنوعی، که مستقیماً با اپراتور و سال آینده از طریق Cloudflare تنظیم شده است.
  • قابلیت مشاهده در سطح URL که در آن صفحات برای آموزش در دسترس قرار گرفته اند، به علاوه معیارهایی که نشان می دهد محتوا چگونه در جستجو ظاهر می شود
  • اطمینان از اینکه انصراف از آموزش هوش مصنوعی بر رتبه بندی جستجوی سنتی تأثیر نمی گذارد

Cloudflare می گوید اپل، گوگل و مایکروسافت در حال حاضر نشان می دهند که واجد شرایط هستند و قابلیت های موجود امروز را با تعهدات محدود زمانی برای ویژگی هایی که هنوز در حال توسعه هستند ترکیب می کنند.

تنظیمات جدید، ابزارهای منسوخ شده

این تغییر، کنترل‌های مدیریت ربات Cloudflare را بازسازی می‌کند، که اکنون ترافیک خزنده را به سه رفتار طبقه‌بندی می‌کند: جستجو، آموزش و عامل. با اضافه شدن Disallow AI Training، تنظیمات موجود عبارتند از Allow، Disallow AI Training، Block on pages with ads و Block.

دو ابزار قدیمی در حال منسوخ شدن هستند. گزینه گسترده «Block AI Bots» جای خود را به کنترل‌های جستجو، آموزش و عامل دقیق‌تر می‌دهد و Managed Robots.txt با سیستمی به نام Bot Preference Sync جایگزین می‌شود و مشتریان فعلی به‌طور خودکار مهاجرت می‌کنند. Disallow AI Training نیز بخشی از پیکربندی پیشنهادی Cloudflare برای برخی دامنه‌های جدید خواهد بود.

مهم ترین سوئیچ مربوط به خود تنظیم Block است. قبلاً، Block و «Block on pages with ads» برای خزنده‌های با کاربرد مختلط اعمال نمی‌شد، زیرا مسدود کردن آنها می‌تواند به قابلیت کشف جستجو آسیب برساند. از 15 سپتامبر، این تنظیمات اکنون برای همه خزنده‌های آموزشی، از جمله Applebot، Bingbot و Googlebot اعمال می‌شود - به این معنی که سایتی که Block را انتخاب می‌کند، اکنون پیامدهای رتبه‌بندی جستجوی آن انتخاب را می‌پذیرد.

"عدم اجازه" برای نمایندگان - هنوز

یک شکاف باقی مانده است. دسته‌بندی Cloudflare's Agent، عوامل هدایت‌شده توسط کاربر، مانند عوامل استفاده از مرورگر و ربات‌های واکشی چت، بازدید از یک صفحه از طرف یک شخص را پوشش می‌دهد. این شرکت می‌نویسد که عامل‌ها مانند خزنده‌های مختلط، معاوضه جستجو و کشف را ایجاد نمی‌کنند، و اینترنت فاقد یک دستورالعمل کاملاً تثبیت شده برای بیان ترجیحات غیرمجاز به عوامل است. در حال حاضر هیچ تنظیم Disallow برای Agents وجود ندارد، اگرچه Cloudflare می‌گوید با تکمیل استانداردهایی مانند ai-prefs، این رویکرد را مجدداً بررسی خواهد کرد.

چرا برای ناشران مهم است

برای سازمان‌های خبری و سایت‌های محتوا، این اعلام نزدیک‌ترین چیزی است که هنوز به یک مسیر میانی قابل اجرا در بن‌بست بین صنعت نشر و توسعه‌دهندگان هوش مصنوعی وجود دارد. ناشران استدلال کرده اند که آموزش کار آنها بدون پرداخت پول یا مجوز استخراج است. شرکت‌های هوش مصنوعی استدلال کرده‌اند که خزیدن یک روش استاندارد است و robots.txt هرگز برای تمایزات دوره هوش مصنوعی طراحی نشده است.

Cloudflare با رسمی کردن یک تعیین برای خزنده‌ها که نمایه‌سازی جستجو را از استفاده آموزشی جدا می‌کند – و با اعمال آن از طریق کنترل‌های پیش‌فرض – به طور موثر از آزمایشگاه‌های هوش مصنوعی و شرکت‌های پلت‌فرم می‌خواهد تا بر اساس شرایط ناشر پسند رقابت کنند. سه اپراتور حساب‌دار مؤسس شرکت‌هایی هستند که کسب‌وکار اصلی آنها به جستجو و سیستم‌های عامل بستگی دارد، نه آموزش مدل، که بعید است تصادفی باشد.

سوال باز، اجرا و اقتصاد است. Cloudflare می‌تواند رفتار و اولویت‌های همگام‌سازی را طبقه‌بندی کند، اما شرایط مالی مجوزهای آموزشی همچنان یک موضوع بازار خصوصی بین ناشران و شرکت‌های هوش مصنوعی است. آنچه در این هفته تغییر می‌کند، پیش پا افتاده‌تر و معنادارتر است: سایتی که به آموزش هوش مصنوعی نه می‌گوید، اکنون می‌تواند این کار را بدون قربانی کردن جایگاه خود در نتایج جستجو انجام دهد. برای صنعتی که شاهد اختلافات ترافیکی ارجاع و آموزشی است که همزمان آشکار می شود، این جدایی مدت زیادی است که در راه است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →