شرکت زیرساختهای وب Cloudflare کنترل جدیدی را معرفی کرده است که به ناشران وبسایت اجازه میدهد محتوای خود را از استفاده برای آموزش مدلهای هوش مصنوعی مسدود کنند و در عین حال آن را در نتایج جستجوی سنتی کاملاً در دسترس نگه میدارند - جدایی که اکوسیستم خزنده قبلاً هرگز به طور کامل از آن پشتیبانی نکرده است.
این ویژگی که در وبلاگ Cloudflare در 15 سپتامبر اعلام شد، همراه با یک نام جدید "Accountable" برای اپراتورهای خزنده ارائه می شود. طبق گفته های Cloudflare، اپل، گوگل و مایکروسافت اولین شرکت هایی هستند که خزنده ها واجد شرایط هستند. هر کسی که [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) را در سال جاری ردیابی کند، میداند که این سوال که چه کسی محتوای منتشر شده را حذف میکند، به یکی از بحثبرانگیزترین دعواهای خطمشی اینترنت تبدیل شده است.
مشکل خزنده با استفاده ترکیبی
مشکل اصلی آن چیزی است که Cloudflare آن را خزندههای با کاربرد مختلط مینامد: رباتهای منفرد، مانند Googlebot، Bingbot و Applebot، که صفحات را هم برای ایجاد فهرستهای جستجو و هم برای جمعآوری دادههای آموزشی برای مدلهای هوش مصنوعی واکشی میکنند. از لحاظ تاریخی، مالک سایتی که میخواست از آموزش هوش مصنوعی انصراف دهد، یک ابزار صریح داشت - robots.txt Disallow - و استفاده از آن خطر حذف کامل از نتایج جستجو را داشت.
تنظیم جدید Disallow AI Training Cloudflare به دلیل دستوری است که در فایل robots.txt سایت منتشر می کند. وقتی فعال باشد، اولویت بدون آموزش سایت با robots.txt همگامسازی میشود، خزندههای کاربری مختلط پاسخگو برای اهداف جستجو مجاز باقی میمانند و هر خزنده آموزشی دیگری مسدود میشود. Cloudflare خاطرنشان میکند که مسدود کردن خزندههای آموزشی - خزندههای آموزشی که توسط آمازون، آنتروپیک، متا و OpenAI اجرا میشوند نام میبرد - هرگز در وهله اول بر جستجو تأثیری نداشت.
چه چیزی یک خزنده را "پاسخگو" می کند
برای کسب عنوان Accountable، یک اپراتور ربات باید مجموعه ای از الزامات مندرج در پست وبلاگ را برآورده کند یا متعهد به برآوردن آن باشد:
- مکانیزمی برای انصراف صاحبان سایت از آموزش هوش مصنوعی، از طریق robots.txt یا استانداردی مشابه
- مکانیزمی برای انصراف از خلاصههای هوش مصنوعی، که مستقیماً با اپراتور و سال آینده از طریق Cloudflare تنظیم شده است.
- قابلیت مشاهده در سطح URL که در آن صفحات برای آموزش در دسترس قرار گرفته اند، به علاوه معیارهایی که نشان می دهد محتوا چگونه در جستجو ظاهر می شود
- اطمینان از اینکه انصراف از آموزش هوش مصنوعی بر رتبه بندی جستجوی سنتی تأثیر نمی گذارد
Cloudflare می گوید اپل، گوگل و مایکروسافت در حال حاضر نشان می دهند که واجد شرایط هستند و قابلیت های موجود امروز را با تعهدات محدود زمانی برای ویژگی هایی که هنوز در حال توسعه هستند ترکیب می کنند.
تنظیمات جدید، ابزارهای منسوخ شده
این تغییر، کنترلهای مدیریت ربات Cloudflare را بازسازی میکند، که اکنون ترافیک خزنده را به سه رفتار طبقهبندی میکند: جستجو، آموزش و عامل. با اضافه شدن Disallow AI Training، تنظیمات موجود عبارتند از Allow، Disallow AI Training، Block on pages with ads و Block.
دو ابزار قدیمی در حال منسوخ شدن هستند. گزینه گسترده «Block AI Bots» جای خود را به کنترلهای جستجو، آموزش و عامل دقیقتر میدهد و Managed Robots.txt با سیستمی به نام Bot Preference Sync جایگزین میشود و مشتریان فعلی بهطور خودکار مهاجرت میکنند. Disallow AI Training نیز بخشی از پیکربندی پیشنهادی Cloudflare برای برخی دامنههای جدید خواهد بود.
مهم ترین سوئیچ مربوط به خود تنظیم Block است. قبلاً، Block و «Block on pages with ads» برای خزندههای با کاربرد مختلط اعمال نمیشد، زیرا مسدود کردن آنها میتواند به قابلیت کشف جستجو آسیب برساند. از 15 سپتامبر، این تنظیمات اکنون برای همه خزندههای آموزشی، از جمله Applebot، Bingbot و Googlebot اعمال میشود - به این معنی که سایتی که Block را انتخاب میکند، اکنون پیامدهای رتبهبندی جستجوی آن انتخاب را میپذیرد.
"عدم اجازه" برای نمایندگان - هنوز
یک شکاف باقی مانده است. دستهبندی Cloudflare's Agent، عوامل هدایتشده توسط کاربر، مانند عوامل استفاده از مرورگر و رباتهای واکشی چت، بازدید از یک صفحه از طرف یک شخص را پوشش میدهد. این شرکت مینویسد که عاملها مانند خزندههای مختلط، معاوضه جستجو و کشف را ایجاد نمیکنند، و اینترنت فاقد یک دستورالعمل کاملاً تثبیت شده برای بیان ترجیحات غیرمجاز به عوامل است. در حال حاضر هیچ تنظیم Disallow برای Agents وجود ندارد، اگرچه Cloudflare میگوید با تکمیل استانداردهایی مانند ai-prefs، این رویکرد را مجدداً بررسی خواهد کرد.
چرا برای ناشران مهم است
برای سازمانهای خبری و سایتهای محتوا، این اعلام نزدیکترین چیزی است که هنوز به یک مسیر میانی قابل اجرا در بنبست بین صنعت نشر و توسعهدهندگان هوش مصنوعی وجود دارد. ناشران استدلال کرده اند که آموزش کار آنها بدون پرداخت پول یا مجوز استخراج است. شرکتهای هوش مصنوعی استدلال کردهاند که خزیدن یک روش استاندارد است و robots.txt هرگز برای تمایزات دوره هوش مصنوعی طراحی نشده است.
Cloudflare با رسمی کردن یک تعیین برای خزندهها که نمایهسازی جستجو را از استفاده آموزشی جدا میکند – و با اعمال آن از طریق کنترلهای پیشفرض – به طور موثر از آزمایشگاههای هوش مصنوعی و شرکتهای پلتفرم میخواهد تا بر اساس شرایط ناشر پسند رقابت کنند. سه اپراتور حسابدار مؤسس شرکتهایی هستند که کسبوکار اصلی آنها به جستجو و سیستمهای عامل بستگی دارد، نه آموزش مدل، که بعید است تصادفی باشد.
سوال باز، اجرا و اقتصاد است. Cloudflare میتواند رفتار و اولویتهای همگامسازی را طبقهبندی کند، اما شرایط مالی مجوزهای آموزشی همچنان یک موضوع بازار خصوصی بین ناشران و شرکتهای هوش مصنوعی است. آنچه در این هفته تغییر میکند، پیش پا افتادهتر و معنادارتر است: سایتی که به آموزش هوش مصنوعی نه میگوید، اکنون میتواند این کار را بدون قربانی کردن جایگاه خود در نتایج جستجو انجام دهد. برای صنعتی که شاهد اختلافات ترافیکی ارجاع و آموزشی است که همزمان آشکار می شود، این جدایی مدت زیادی است که در راه است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →