Webinfrastructuurbedrijf Cloudflare heeft een nieuwe controle geïntroduceerd waarmee website-uitgevers kunnen voorkomen dat hun inhoud wordt gebruikt voor AI-modeltraining, terwijl deze volledig beschikbaar blijft in traditionele zoekresultaten – een ontkoppeling die het crawler-ecosysteem nog nooit eerder goed heeft ondersteund.

De functie, aangekondigd op de Cloudflare-blog op 15 september, komt samen met een nieuwe ‘Accountable’-aanduiding voor crawleroperators. Volgens Cloudflare zijn Apple, Google en Microsoft de eerste bedrijven waarvan de crawlers in aanmerking komen. Iedereen die dit jaar het laatste AI-nieuws (https://aibuzzwire.news) volgt, weet dat de vraag wie de gepubliceerde inhoud mag schrappen, een van de meest omstreden beleidsgevechten op internet is geworden.

Het crawlerprobleem voor gemengd gebruik

Het kernprobleem is wat Cloudflare crawlers voor gemengd gebruik noemt: afzonderlijke bots, zoals Googlebot, Bingbot en Applebot, die pagina's ophalen om zowel zoekindexen op te bouwen als trainingsgegevens voor AI-modellen te verzamelen. Historisch gezien had een site-eigenaar die zich wilde afmelden voor AI-training één bot instrument – ​​de robots.txt disallow – en het gebruik ervan liep het risico volledig uit de zoekresultaten te verdwijnen.

De nieuwe Disallow AI Training-instelling van Cloudflare is genoemd naar de richtlijn die deze publiceert in het robots.txt-bestand van een site. Indien ingeschakeld, wordt de voorkeur voor geen training van de site gesynchroniseerd met robots.txt. Accountable crawlers voor gemengd gebruik blijven toegestaan ​​voor zoekdoeleinden en elke andere trainingscrawler wordt geblokkeerd. Cloudflare merkt op dat het blokkeren van crawlers die alleen voor training bedoeld zijn (het noemt de trainingscrawlers van Amazon, Anthropic, Meta en OpenAI) de zoekresultaten überhaupt niet heeft beïnvloed.

Wat maakt een crawler 'verantwoordelijk'

Om de Accountable-aanduiding te verdienen, moet een botoperator voldoen aan een reeks vereisten die in de blogpost worden uiteengezet, of zich ertoe verbinden hieraan te voldoen:

  • Een mechanisme waarmee site-eigenaren zich kunnen afmelden voor AI-training, via robots.txt of een vergelijkbare standaard
  • Een mechanisme om u af te melden voor AI-samenvattingen, rechtstreeks ingesteld bij de operator en volgend jaar via Cloudflare
  • Zichtbaarheid op URL-niveau van welke pagina's beschikbaar zijn gemaakt voor training, plus statistieken die laten zien hoe inhoud in de zoekresultaten werd weergegeven
  • De zekerheid dat het afmelden voor AI-training geen invloed zal hebben op de traditionele zoekresultaten

Cloudflare zegt dat Apple, Google en Microsoft momenteel aantonen dat ze aan de kwalificaties voldoen, door de mogelijkheden die vandaag de dag beschikbaar zijn te combineren met tijdgebonden verplichtingen voor functies die nog in ontwikkeling zijn.

Nieuwe instellingen, verouderde tools

De wijziging herwerkt de botbeheercontroles van Cloudflare, die het crawlerverkeer nu classificeren in drie gedragingen: Zoeken, Training en Agent. Als AI-training niet toestaan ​​is toegevoegd, zijn de beschikbare instellingen Toestaan, AI-training niet toestaan, Blokkeren op pagina's met advertenties en Blokkeren.

Twee al lang bestaande tools worden verouderd. De brede optie ‘Block AI Bots’ maakt plaats voor de meer gedetailleerde zoek-, training- en agentcontroles, en Managed Robots.txt wordt vervangen door een systeem genaamd Bot Preference Sync, waarbij bestaande klanten automatisch worden gemigreerd. Disallow AI Training zal ook onderdeel worden van de aanbevolen configuratie van Cloudflare voor bepaalde nieuwe domeinen.

De meest consequente overstap betreft de Block-instelling zelf. Voorheen waren Blokkeren en 'Blokkeren op pagina's met advertenties' niet van toepassing op crawlers voor gemengd gebruik, omdat het blokkeren ervan de vindbaarheid van zoekopdrachten zou kunnen schaden. Vanaf 15 september zijn deze instellingen nu van toepassing op alle trainingscrawlers, inclusief Applebot, Bingbot en Googlebot. Dit betekent dat een site die voor Block kiest nu de gevolgen van die keuze voor de zoekresultaten accepteert.

Nog geen 'Disallow' voor agenten

Er blijft één leemte bestaan. De Agent-categorie van Cloudflare omvat door de gebruiker aangestuurde agenten, zoals browsergebruiksagenten en chat-fetch-bots, die namens iemand een pagina bezoeken. Het bedrijf schrijft dat agenten niet dezelfde afweging maken tussen zoek- en vindbaarheid als crawlers voor gemengd gebruik, en dat het internet een gevestigde richtlijn mist voor het kenbaar maken van niet-toegestane voorkeuren aan agenten. Voorlopig is er geen Disallow-instelling voor Agents, hoewel Cloudflare zegt dat het de aanpak zal herzien naarmate standaarden zoals ai-prefs volwassener worden.

Waarom het belangrijk is voor uitgevers

Voor nieuwsorganisaties en inhoudssites komt de aankondiging nog het dichtst in de buurt van een werkbare middenweg in de impasse tussen de uitgeverijsector en AI-ontwikkelaars. Uitgevers hebben betoogd dat het trainen van hun werk zonder betaling of toestemming extractie is; AI-bedrijven hebben betoogd dat crawlen de standaardpraktijk is en dat robots.txt nooit is ontworpen voor onderscheidingen uit het AI-tijdperk.

Door een aanduiding te formaliseren voor crawlers die zoekindexering scheiden van trainingsgebruik – en door dit af te dwingen via standaardcontroles – vraagt ​​Cloudflare in feite AI-laboratoria en platformbedrijven om te concurreren op uitgeversvriendelijke voorwaarden. De drie oprichtende Accountable-operators zijn bedrijven waarvan de kernactiviteiten afhankelijk zijn van zoek- en besturingssystemen, en niet van modeltraining, wat waarschijnlijk geen toeval is.

De open vraag is handhaving en economie. Cloudflare kan gedrag classificeren en voorkeuren synchroniseren, maar de financiële voorwaarden van trainingslicenties blijven een zaak van de particuliere markt tussen uitgevers en AI-bedrijven. Wat deze week verandert, is alledaagser en betekenisvoller: een site die nee zegt tegen AI-training kan dat nu doen zonder zijn plaats in de zoekresultaten op te offeren. Voor een sector die ziet dat verwijzingsverkeer en trainingsgeschillen zich tegelijkertijd voordoen, wacht die scheiding al lang.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →