Skip to content
Tech AI Wire

Cloudflare trennt KI-Training von der Suchindexierung

Ein Schalter namens Disallow AI Training lässt eine Seite Trainings-Crawler abweisen und in der Suche bleiben. Mischnutzer machen 36,6% des geprüften Crawler-Verkehrs aus.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
The wall of lava lamps in the lobby of Cloudflare's San Francisco office.
Foto: Wikimedia Commons / FASTILY, CC BY-SA 4.0

Die Zahlen

of verified crawler traffic from mixed-use crawlers
36.6%
controls: Search, AI Training and AI Agents
3
when the new settings were announced
Sept 15

Cloudflare hat zwei Dinge getrennt, die früher mit demselben Crawler ankamen. Seit dem 15. September 2026 kann eine Seite es ablehnen, dass ihre Inhalte für KI-Training genutzt werden, und trotzdem vollständig in der Suche erscheinen. Cloudflare nennt die Einstellung "Disallow AI Training" und legt sie in die Sicherheitseinstellungen.

Bisher war das eine Entscheidung und nicht zwei. Ein Crawler, der Seiten für einen Suchindex und für Modelltraining sammelte, war ein einziger Besucher; wer das Training blockierte, verschwand aus der Suche. Cloudflares Pressemitteilung bemisst dieses Problem mit 36,6% des geprüften Crawler-Verkehrs im eigenen Netz. Der Bedarf ist breit: PYMNTS berichtet, dass fast 90% der Organisationen den Umgang mit Bot-Verkehr als Herausforderung bezeichnen.

Wie das Signal wirklich reist

Der Mechanismus ist bewusst unspektakulär, und genau das macht ihn brauchbar. Cloudflare veröffentlicht Ihre Präferenz in der robots.txt über eine Funktion, die jetzt Bot Preference Sync heißt und Managed Robots.txt ersetzt. Die Einstellung selbst ersetzt den älteren Schalter "Block AI Bots".

Cloudflares Pressemitteilung nennt die robots.txt als primären Opt-out und sagt, vergleichbare Standards würden ebenfalls akzeptiert, darunter Präferenzsignale per HTTP-Header aus der entstehenden ai-prefs-Arbeit bei der IETF.

Die Kontrollen teilen den Verkehr in drei unabhängig schaltbare Kategorien: Search, AI Training und AI Agents. Die dritte ist die, über die man nachdenken sollte, denn ein Agent, der eine Seite im Auftrag eines Nutzers holt, indexiert sie nicht und trainiert nicht darauf.

Die Durchsetzung hat zwei Hälften. Von Crawlern, die Cloudflare als rechenschaftspflichtig einordnet, wird erwartet, dass sie die Präferenz einhalten. Mischnutzer, die ihre Zwecke nicht trennen, werden bei aktivierten Beschränkungen vollständig blockiert, und Cloudflare sagt, es berichte die Einhaltung über Radar.

Wer mitmacht, und was standardmäßig gilt

Die Liste der Unterstützer zählt mehr als die Funktion, denn eine Präferenz wirkt nur, wenn Crawler sie lesen.

PunktDetail
Rechenschaftspflichtige MischnutzerApple, Google und Microsoft erfüllen die Kriterien oder haben es zugesagt
Trennen Suche und Training bereitsAmazon, Anthropic, Meta und OpenAI
ZeitplanURL-Werkzeuge von Apple und Google für Anfang 2025 genannt; Microsofts robots.txt-Unterstützung für Anfang 2027 angestrebt
Neue werbefinanzierte DomainsAI Training und Agent auf Seiten mit Werbung standardmäßig blockiert, Search erlaubt
Neue Domains ohne WerbungSearch, Training und Agents alle standardmäßig erlaubt
Bestehende DomainsEinstellungen werden so übernommen, dass die praktische Wirkung bleibt
VerfügbarkeitAlle Kunden, in jedem Tarif

Die Standardaufteilung sollte man zweimal lesen. Cloudflare zieht die Linie ausdrücklich um werbefinanzierte Seiten, und das ist eine Aussage darüber, wessen Geschäftsmodell es für gefährdet hält.

Was das für Entwickler bedeutet

Wer eine Seite bei Cloudflare betreibt, sollte den eigenen Zustand prüfen statt ihn anzunehmen. Bestehende Domains behalten ihre Wirkung, neue bekommen Standards, die davon abhängen, ob die Domain Werbung zeigt, und der alte Schalter "Block AI Bots" ist ersetzt. Aus diesen drei Punkten folgt: Ihre aktuelle Einstellung ist wahrscheinlich nicht die, die Sie heute wählen würden.

Entscheiden Sie die Agenten-Frage getrennt von der Trainings-Frage. AI Agents zu blockieren hindert Assistenten daran, Ihre Seiten für einen Nutzer zu holen, der danach gefragt hat. Das ist näher daran, einen Browser zu blockieren, als einen Scraper. Wenn Ihr Produkt darauf setzt, dass Menschen es über einen Assistenten erreichen, schneidet dieser Schalter einen Weg ab, den Sie offen haben wollen.

Halten Sie die robots.txt nicht für Durchsetzung. Sie ist eine Bitte, die rechenschaftspflichtige Crawler einhalten, und Cloudflares eigene Darstellung teilt die Welt in Crawler, die Präferenzen respektieren, und solche, die es mit Gewalt blockiert. Zähne hat das Blockieren, und es gilt nur für Verkehr, den Cloudflare identifizieren kann.

Achten Sie auf die Termine, bevor Sie sich darauf verlassen. Microsofts robots.txt-Unterstützung ist für Anfang 2027 angestrebt, das Versprechen und die Leitungen landen also nicht gleichzeitig. Das ist dasselbe Argument wie bei Cloudflares Gateway-Funktion, die MCP-Verkehr erkennt. Die Netzwerkebene entscheidet, was ein KI-System mit Ihren Inhalten tun darf.

Quellen

  1. Have it both ways: stay discoverable in search while disallowing AI training - Cloudflare
  2. Cloudflare Helps End the Search-or-AI-Training Tradeoff - Cloudflare
  3. Cloudflare Helps Website Owners Block AI Scraping Without Losing Search Visibility - PYMNTS

Ähnliche Artikel