Společnost Cloudflare zabývající se webovou infrastrukturou zavedla nový ovládací prvek, který umožňuje vydavatelům webových stránek zablokovat použití jejich obsahu pro školení modelu AI a zároveň jej zachovat plně dostupný v tradičních výsledcích vyhledávání – což je oddělení, které ekosystém prohledávače nikdy předtím čistě nepodporoval.
Funkce, oznámená na blogu Cloudflare 15. září, přichází spolu s novým označením „Accountable“ pro operátory prohledávače. Podle Cloudflare jsou Apple, Google a Microsoft prvními společnostmi, jejichž prohledávače se kvalifikují. Každý, kdo tento rok sleduje nejnovější zprávy o AI, ví, že otázka, kdo může seškrábat publikovaný obsah, se stala jedním z nejspornějších politických bojů na internetu.
Problém prohledávače se smíšeným použitím
Klíčovým problémem je to, co Cloudflare nazývá prohledávače se smíšeným použitím: jednotlivé roboty, jako je Googlebot, Bingbot a Applebot, kteří načítají stránky za účelem vytváření indexů vyhledávání a shromažďování školicích dat pro modely umělé inteligence. Historicky měl vlastník webu, který se chtěl odhlásit ze školení AI, jeden neomalený nástroj – zákaz robots.txt – a jeho používáním hrozilo, že z výsledků vyhledávání zmizí úplně.
Nové nastavení Disallow AI Training Cloudflare je pojmenováno podle směrnice, kterou publikuje v souboru robots.txt webu. Je-li tato možnost povolena, předvolba zákazu školení na webu se synchronizuje do souboru robots.txt, pro účely vyhledávání zůstávají povoleny odpovědné prohledávače se smíšeným použitím a každý další prohledávač školení je blokován. Cloudflare poznamenává, že blokování prohledávačů určených pouze pro trénování – jmenuje cvičné prohledávače provozované společnostmi Amazon, Anthropic, Meta a OpenAI – nikdy neovlivnilo vyhledávání.
Co dělá prohledávač „zodpovědným“
Aby provozovatel robota získal označení Zodpovědný, musí splnit nebo se zavázat splnit soubor požadavků uvedených v příspěvku na blogu:
– Mechanismus pro vlastníky stránek k odhlášení ze školení AI prostřednictvím souboru robots.txt nebo podobného standardu
- Mechanismus pro odhlášení ze souhrnů AI, nastavený přímo u operátora a v příštím roce prostřednictvím Cloudflare
- Viditelnost stránek na úrovni URL, které byly zpřístupněny pro školení, plus metriky ukazující, jak se obsah objevil ve vyhledávání
- Zajištění, že odhlášení ze školení AI neovlivní tradiční hodnocení ve vyhledávání
Cloudflare říká, že Apple, Google a Microsoft v současné době prokazují, že splňují kvalifikaci a kombinují dnes dostupné možnosti s časově omezenými závazky pro funkce, které jsou stále ve vývoji.
Nová nastavení, zastaralé nástroje
Tato změna přepracovává ovládací prvky správy botů Cloudflare, které nyní klasifikují provoz prohledávače do tří typů chování: vyhledávání, školení a agent. Po přidání Zakázat školení AI jsou dostupná nastavení Povolit, Zakázat školení AI, Blokovat na stránkách s reklamami a Blokovat.
Dva dlouhodobé nástroje jsou zastaralé. Široká možnost „Block AI Bots“ ustupuje podrobnějším ovládacím prvkům Search, Training a Agent a Managed Robots.txt je nahrazen systémem nazvaným Bot Preference Sync, přičemž stávající zákazníci migrují automaticky. Disallow AI Training se také stane součástí doporučené konfigurace Cloudflare pro určité nové domény.
Nejdůležitější přepínač se týká samotného nastavení Block. Dříve se blokování a „Blokovat na stránkách s reklamami“ nevztahovaly na prohledávače se smíšeným použitím, protože jejich zablokování by mohlo poškodit viditelnost vyhledávání. Od 15. září se tato nastavení nyní vztahují na všechny cvičné prohledávače, včetně Applebota, Bingbota a Googlebota – což znamená, že web, který zvolí Block, nyní akceptuje důsledky této volby pro hodnocení.
Žádné 'Disallow' pro agenty — zatím
Zbývá jedna mezera. Kategorie agentů Cloudflare zahrnuje agenty řízené uživateli, jako jsou agenti používající prohlížeč a roboti pro načítání chatu, kteří navštěvují stránku jménem osoby. Společnost píše, že agenti nevytvářejí stejný kompromis mezi vyhledáváním a objevováním jako prohledávače se smíšeným použitím a že na internetu chybí dobře zavedená směrnice pro vyjádření zákazových preferencí agentům. Prozatím neexistuje žádné nastavení Disallow pro agenty, i když Cloudflare říká, že tento přístup přehodnotí, protože standardy jako ai-prefs dospějí.
Proč je to pro vydavatele důležité
Pro zpravodajské organizace a obsahové weby je oznámení zatím nejblíže funkční střední cestě ve sporu mezi vydavatelským průmyslem a vývojáři AI. Vydavatelé tvrdili, že školení o jejich práci bez placení nebo povolení je těžba; Společnosti zabývající se umělou inteligencí tvrdily, že procházení je standardní praxí a že soubor robots.txt nebyl nikdy navržen pro rozlišení v době umělé inteligence.
Formalizací označení pro prohledávače, které oddělují indexování vyhledávání od používání školení – a jeho vynucením prostřednictvím výchozích ovládacích prvků – Cloudflare účinně žádá laboratoře AI a platformy, aby soutěžily za podmínek přívětivých pro vydavatele. Tři zakládající odpovědní operátoři jsou shodou okolností společnosti, jejichž hlavní podnikání závisí na vyhledávacích a operačních systémech, nikoli na modelovém školení, což pravděpodobně nebude náhoda.
Otevřenou otázkou je vymahatelnost a ekonomika. Cloudflare dokáže klasifikovat chování a synchronizovat preference, ale finanční podmínky školicích licencí zůstávají záležitostí soukromého trhu mezi vydavateli a společnostmi s umělou inteligencí. To, co se tento týden změní, je všednější a smysluplnější: web, který říká ne školení AI, to nyní může udělat, aniž by obětoval své místo ve výsledcích vyhledávání. Pro průmysl, který sleduje doporučující provoz a zároveň se odvíjejí spory o školení, toto oddělení trvalo dlouho.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →