Компанія, що займається веб-інфраструктурою, Cloudflare представила новий елемент керування, який дозволяє видавцям веб-сайтів блокувати використання їхнього вмісту для навчання моделі штучного інтелекту, зберігаючи при цьому його повну доступність у традиційних результатах пошуку — відокремлення, яке екосистема сканера ніколи раніше не підтримувала.

Функція, анонсована в блозі Cloudflare 15 вересня, з’являється разом із новим позначенням «Відповідальний» для операторів сканера. За даними Cloudflare, Apple, Google і Microsoft є першими компаніями, чиї сканери відповідають вимогам. Усі, хто стежить за [найновішими новинами штучного інтелекту] (https://aibuzzwire.news) цього року, знають, що питання про те, хто може збирати опублікований вміст, стало однією з найбільш суперечливих політичних боїв в Інтернеті.

Проблема сканера змішаного використання

Основна проблема полягає в тому, що Cloudflare називає сканерами змішаного використання: окремі боти, такі як Googlebot, Bingbot і Applebot, які отримують сторінки як для створення пошукових індексів, так і для збору навчальних даних для моделей ШІ. Традиційно власник сайту, який хотів відмовитися від навчання штучному інтелекту, мав один грубий інструмент — заборону файлу robots.txt — і його використання ризикувало повністю зникнути з результатів пошуку.

Нове налаштування Disallow AI Training Cloudflare названо на честь директиви, яку воно публікує у файлі robots.txt сайту. Якщо ввімкнено, параметри сайту щодо відсутності навчання синхронізуються з robots.txt, багатофункціональні сканери Accountable залишаються дозволеними для пошуку, а всі інші навчальні сканери блокуються. Cloudflare зазначає, що блокування сканерів, призначених лише для навчання, — це імена навчальних сканерів, якими керують Amazon, Anthropic, Meta та OpenAI — ніколи не впливало на пошук.

Що робить сканера «підзвітним»

Щоб отримати звання відповідального, оператор бота повинен відповідати або взяти на себе зобов’язання відповідати набору вимог, викладених у публікації блогу:

  • Механізм, за допомогою якого власники сайтів можуть відмовитися від навчання ШІ за допомогою robots.txt або подібного стандарту
  • Механізм відмови від підсумків штучного інтелекту, встановлений безпосередньо оператором, а наступного року через Cloudflare
  • Видимість на рівні URL-адрес, які сторінки були доступні для навчання, а також показники, що показують, як вміст з’являється в пошуку
  • Гарантія того, що відмова від навчання штучному інтелекту не вплине на рейтинг традиційного пошуку

Cloudflare каже, що Apple, Google і Microsoft наразі демонструють, що вони відповідають вимогам, поєднуючи доступні сьогодні можливості з обмеженими за часом зобов’язаннями щодо функцій, які ще розробляються.

Нові налаштування, застарілі інструменти

Ця зміна переробляє елементи керування роботом Cloudflare, які тепер класифікують трафік сканера за трьома способами: пошук, навчання та агент. Після додавання Disallow AI Training доступні параметри: «Дозволити», «Disallow AI Training», «Блокувати на сторінках з рекламою» та «Блокувати».

Два давні інструменти припиняються. Широка опція «Блокувати AI-ботів» поступається місцем більш детальним елементам керування Пошуком, Навчанням і Агентами, а Managed Robots.txt замінено системою під назвою Bot Preference Sync з автоматичною міграцією наявних клієнтів. Disallow AI Training також стане частиною рекомендованої конфігурації Cloudflare для деяких нових доменів.

Найбільш важливий перемикач стосується самого параметра блокування. Раніше параметри «Блокувати» та «Блокувати на сторінках з рекламою» не застосовувалися до багатофункціональних сканерів, оскільки їх блокування могло зашкодити видимості пошуку. Станом на 15 вересня ці налаштування тепер застосовуються до всіх навчальних сканерів, включаючи Applebot, Bingbot і Googlebot, тобто сайт, який вибирає Блокувати, тепер приймає наслідки цього вибору для рейтингу пошуку.

Немає «Заборони» для агентів — поки що

Залишилася одна прогалина. Категорія агентів Cloudflare охоплює керованих користувачами агентів, таких як агенти, що використовують браузер, і боти-чати, які відвідують сторінку від імені людини. Компанія пише, що агенти не створюють такий самий компроміс пошуку та виявленості, як багатофункціональні сканери, і що в Інтернеті немає добре встановленої директиви для вираження параметрів заборони для агентів. Наразі немає параметра Disallow для агентів, хоча Cloudflare каже, що перегляне цей підхід у міру розвитку таких стандартів, як ai-prefs.

Чому це важливо для видавців

Для новинних організацій і контент-сайтів це оголошення є найближчим до працездатного середнього шляху в протистоянні між видавничою індустрією та розробниками ШІ. Видавці стверджували, що навчання їх роботі без оплати чи дозволу є вилученням; Компанії штучного інтелекту стверджують, що сканування є стандартною практикою і що robots.txt ніколи не створювався для відмінностей епохи штучного інтелекту.

Формалізувавши позначення для сканерів, які відокремлюють пошукову індексацію від використання навчання — і забезпечуючи його за допомогою елементів керування за замовчуванням — Cloudflare фактично вимагає від лабораторій ШІ та компаній-платформ конкурувати на зручних для видавців умовах. Три засновники Accountable operators – це компанії, основний бізнес яких залежить від пошукових та операційних систем, а не від навчання моделей, що навряд чи є випадковим збігом.

Відкритим питанням є правозастосування та економіка. Cloudflare може класифікувати поведінку та налаштування синхронізації, але фінансові умови ліцензій на навчання залишаються приватною справою між видавцями та компаніями штучного інтелекту. Те, що змінилося цього тижня, є більш приземленим і більш значущим: сайт, який каже «ні» навчання штучному інтелекту, тепер може робити це, не жертвуючи своїм місцем у результатах пошуку. Для індустрії, яка спостерігає за трафіком рефералів і навчальними суперечками, які розгортаються одночасно, це розставання було довгоочікуваним.

---

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →