Cloudflare heeft nieuwe controles aangekondigd waarmee websites onafhankelijk kunnen bepalen of ze willen dat hun inhoud verschijnt in zoekmachines, wordt gebruikt voor het trainen van kunstmatige intelligentiemodellen of geraadpleegd wordt door AI-agents. Het bedrijf introduceert ook een nieuwe categorie van crawlers, “Accountable”, en wijst Apple, Google en Microsoft aan als operators die aan hun criteria voldoen of deadlines hebben gesteld om dat te doen.
De kernprincipes voor webinhoudscontrole in 20 seconden
- 36,6% van het verkeer van geverifieerde crawlers binnen Cloudflare komt van mixed-use crawlers.
- De nieuwe controle maakt het mogelijk AI-training te blokkeren zonder dat de website uit de zoekresultaten verdwijnt.
- Cloudflare scheidt nu de voorkeuren voor zoekmachines, training en AI-agenten.
- Apple, Google en Microsoft worden beschouwd als “Accountable” operators volgens de criteria van Cloudflare.
- Het bedrijf werkt aan een systeem om ook het gebruik van inhoud in AI-genererende samenvattingen te beheren.
Gedurende bijna drie decennia was het functioneren van het web relatief eenvoudig: zoekmachines crawlden pagina’s, namen de inhoud op in hun indexen en stuurden bezoekers naar de oorspronkelijke sites. De opkomst van kunstmatige intelligentie heeft een tweede gebruik van dezelfde inhoud geïntroduceerd: het voeden van trainingsmodellen, antwoordsystemen en agents die pagina’s raadplegen om taken uit te voeren.
Deze verandering heeft voor uitgevers problemen veroorzaakt. Het blokkeren van bepaalde crawlers kon verhinderen dat hun inhoud werd gebruikt voor training, maar ook hun aanwezigheid in zoekmachines beïnvloeden als beide doelen van dezelfde crawler afhingen.
Cloudflare wil deze beslissingen scheiden.
Drie aparte toestemmingen voor dezelfde website
De belangrijkste vernieuwing is de vervanging van de oude schakelaar “Block AI Bots” door drie onafhankelijke controles. Website-eigenaren kunnen voor elk gebruik afzonderlijk beslissen: crawling voor zoekopdrachten, AI-training en toegang door AI-agenten.
Dit kan belangrijk zijn voor digitale media, webwinkels, blogs, technische documentatie en elke site waarvan het verkeer afhankelijk is van zoekmachines.
Cloudflare stelt bovendien een initiële configuratie voor op basis van het bedrijfsmodel. Voor sites met advertenties wordt aanbevolen het crawlen voor zoekopdrachten te laten, AI-training te blokkeren en AI-agenten op pagina’s met advertenties te beperken.
Voor andere sites is de aanbevolen configuratie het toestaan van alle drie het gebruik.
Het zijn aanbevelingen van Cloudflare, geen universele regel voor het gehele internet. Elke eigenaar kan ze aanpassen aan eigen behoeften.
Daarnaast wijzigt het bedrijf het systeem voor robotsvoorkeuren. “Managed Robots.txt” wordt vervangen door Bot Preference Sync, ontworpen zodat eigenaren hun voorkeuren eenmalig kunnen instellen en automatisch laten toepassen op compatibele crawlers.
Het doel is een van de problemen te verminderen die ontstaan door de proliferatie van bots: het is niet meer genoeg om enkel “zoekmachine” en “AI-tool” te onderscheiden, omdat sommige operators crawlers voor meerdere functies gebruiken.
Mixed-use crawlers vormen de grootste uitdaging
Cloudflare stelt dat mixed-use crawlers, die informatie verzamelen voor zowel zoekindices als AI-systemen, verantwoordelijk zijn voor 36,6% van het verkeer van geverifieerde crawlers dat in hun netwerk wordt waargenomen. Dit is momenteel de grootste afzonderlijke categorie.
De website-eigenaren vertonen duidelijke verschillen in hun gedrag voor de twee toepassingen. Cloudflare wijst erop dat minder dan 1% crawlers voor zoekopdrachten blokkeren, terwijl 17% het gebruik voor AI-training beperken.
De interpretatie van Cloudflare is dat de meeste sites willen dat hun inhoud vindbaar blijft via zoekmachines, terwijl een groeiend deel niet wil dat hetzelfde materiaal wordt gebruikt voor het trainen van modellen.
Tot nu toe kon het blokkeren van een crawler dat niet onderscheidde tussen functies, gevolgen hebben voor beide doeleinden. De nieuwe instelling van Cloudflare probeert dat risico te minimaliseren.
Het systeem vertrouwt niet alleen op de classificatie van een bot als zoekmachine of AI-hulpmiddel. Het bedrijf creëert een categorie genaamd Accountable, bedoeld om operators te identificeren die bepaalde controlemaatregelen en afspraken over het gebruik van inhoud aanbieden.
Wat vereist Cloudflare van een “Accountable” crawler
Cloudflare stelt vier criteria op waaraan een verantwoordelijke en transparante AI-gerelateerde crawler moet voldoen.
De eerste is het bieden van een duidelijke manier voor eigenaren om het gebruik voor training te verbieden, bijvoorbeeld via robots.txt of een vergelijkbaar protocol.
De tweede vereist dat websites kunnen weigeren dat hun inhoud wordt gebruikt in AI-gegenereerde samenvattingen.
De derde betreft zichtbaarheid: operatoren moeten per URL aangeven hoe inhoud wordt gebruikt, zowel voor zoekopdrachten als voor training.
De vierde stipuleert dat weigering van training niet mag leiden tot een achterstand in zoekrangschikking.
Cloudflare noemt momenteel Apple, Google en Microsoft als operators die voldoen aan deze criteria of deadlines aangeven om dat te doen.
Google bijvoorbeeld beschikt over Google-Extended, een mechanisme waarmee websites bepaalde gebruiksrechten kunnen regelen zonder inhoud volledig te verwijderen uit Google Search. De classificatie van Cloudflare betreft haar eigen criteria en betekent niet dat alle gebruikswijzen van een bedrijf universeel worden erkend.
Het bedrijf meldt ook dat andere operators aparte crawlers inzetten voor zoekopdrachten en training. In die gevallen kan Cloudflare hiermee specifiek de crawlers voor training blokkeren zonder zoekbots te hinderen.
De lijst van operators die aan de criteria voldoen, wordt gepubliceerd op Cloudflare Radar.
De volgende uitdaging: AI-samenvattingen
Het controleren van gebruik voor training is slechts een deel van het probleem. Zoekmachines en assistenten integreren meer en meer antwoorden die direct uit webpagina’s worden gegenereerd, wat de relatie tussen originele inhoud en verkeer verandert.
Cloudflare stelt dat alle operators die als “Accountable” worden bestempeld, ook opties moeten bieden waarmee eigenaars het gebruik voor AI-samenvattingen kunnen weigeren.
Momenteel wordt die keuze, volgens de partij, aangeboden als een eenvoudige ja/nee-optie die individueel ingesteld moet worden per operator. Cloudflare plaatst voor begin 2027 een systeem in het vooruitzicht waarmee bezoekers via één centrale plek kunnen controleren hoeveel content elke operator daarvoor mag gebruiken.
Deze datum is een doelstelling; de implementatie is nog niet gegarandeerd.
Cloudflare werkt ook mee aan de ontwikkeling van ai-prefs, een specificatie binnen de Internet Engineering Task Force (IETF). Deze moet een gestandaardiseerde en overdraagbare manier creëren om webvoorkeuren ten aanzien van AI-toegang uit te drukken.
De onderliggende technische vraag wordt steeds belangrijker. Een website kan graag geïndexeerd willen worden door Google, in een AI-zoekmachine willen verschijnen, toelaten dat haar inhoud wordt gebruikt voor training, en tegelijk dat een agent bepaalde pagina’s raadpleegt. Simpele regels zoals “toestaan” of “blokkeren” maken dat lastig te regelen.
Cloudflare’s voorstel vertaalt die voorkeuren in gescheiden controls en delegeert een deel van de beslissingen van crawlers naar de contentpublicanten.
Voor media en andere digitale ondernemingen kan deze ontwikkeling bijzonder interessant zijn omdat het mogelijk wordt om de zichtbaarheid in zoekmachines en het gebruik voor training van modellen als aparte beslissingen te beschouwen. Echter, het bestaan van technische controle betekent niet automatisch dat alle crawlers, modellen en agents in het ecosysteem die respecteren. Daarom is het belangrijk dat er standaarden zoals robots.txt blijven en dat de ontwikkelingen rondom ai-prefs voortzetten.
