Cloudflare trennt KI-Training von der Suchindexierung
Ein Schalter namens Disallow AI Training lässt eine Seite Trainings-Crawler abweisen und in der Suche bleiben. Mischnutzer machen 36,6% des geprüften Crawler-Verkehrs aus.
3 Min. Lesezeit

Die Zahlen
- of verified crawler traffic from mixed-use crawlers
- 36.6%
- controls: Search, AI Training and AI Agents
- 3
- when the new settings were announced
- Sept 15
Cloudflare hat zwei Dinge getrennt, die früher mit demselben Crawler ankamen. Seit dem 15. September 2026 kann eine Seite es ablehnen, dass ihre Inhalte für KI-Training genutzt werden, und trotzdem vollständig in der Suche erscheinen. Cloudflare nennt die Einstellung "Disallow AI Training" und legt sie in die Sicherheitseinstellungen.
Bisher war das eine Entscheidung und nicht zwei. Ein Crawler, der Seiten für einen Suchindex und für Modelltraining sammelte, war ein einziger Besucher; wer das Training blockierte, verschwand aus der Suche. Cloudflares Pressemitteilung bemisst dieses Problem mit 36,6% des geprüften Crawler-Verkehrs im eigenen Netz. Der Bedarf ist breit: PYMNTS berichtet, dass fast 90% der Organisationen den Umgang mit Bot-Verkehr als Herausforderung bezeichnen.
Wie das Signal wirklich reist
Der Mechanismus ist bewusst unspektakulär, und genau das macht ihn brauchbar. Cloudflare veröffentlicht Ihre Präferenz in der robots.txt über eine Funktion, die jetzt Bot Preference Sync heißt und Managed Robots.txt ersetzt. Die Einstellung selbst ersetzt den älteren Schalter "Block AI Bots".
Cloudflares Pressemitteilung nennt die robots.txt als primären Opt-out und sagt, vergleichbare Standards würden ebenfalls akzeptiert, darunter Präferenzsignale per HTTP-Header aus der entstehenden ai-prefs-Arbeit bei der IETF.
Die Kontrollen teilen den Verkehr in drei unabhängig schaltbare Kategorien: Search, AI Training und AI Agents. Die dritte ist die, über die man nachdenken sollte, denn ein Agent, der eine Seite im Auftrag eines Nutzers holt, indexiert sie nicht und trainiert nicht darauf.
Die Durchsetzung hat zwei Hälften. Von Crawlern, die Cloudflare als rechenschaftspflichtig einordnet, wird erwartet, dass sie die Präferenz einhalten. Mischnutzer, die ihre Zwecke nicht trennen, werden bei aktivierten Beschränkungen vollständig blockiert, und Cloudflare sagt, es berichte die Einhaltung über Radar.
Wer mitmacht, und was standardmäßig gilt
Die Liste der Unterstützer zählt mehr als die Funktion, denn eine Präferenz wirkt nur, wenn Crawler sie lesen.
| Punkt | Detail |
|---|---|
| Rechenschaftspflichtige Mischnutzer | Apple, Google und Microsoft erfüllen die Kriterien oder haben es zugesagt |
| Trennen Suche und Training bereits | Amazon, Anthropic, Meta und OpenAI |
| Zeitplan | URL-Werkzeuge von Apple und Google für Anfang 2025 genannt; Microsofts robots.txt-Unterstützung für Anfang 2027 angestrebt |
| Neue werbefinanzierte Domains | AI Training und Agent auf Seiten mit Werbung standardmäßig blockiert, Search erlaubt |
| Neue Domains ohne Werbung | Search, Training und Agents alle standardmäßig erlaubt |
| Bestehende Domains | Einstellungen werden so übernommen, dass die praktische Wirkung bleibt |
| Verfügbarkeit | Alle Kunden, in jedem Tarif |
Die Standardaufteilung sollte man zweimal lesen. Cloudflare zieht die Linie ausdrücklich um werbefinanzierte Seiten, und das ist eine Aussage darüber, wessen Geschäftsmodell es für gefährdet hält.
Was das für Entwickler bedeutet
Wer eine Seite bei Cloudflare betreibt, sollte den eigenen Zustand prüfen statt ihn anzunehmen. Bestehende Domains behalten ihre Wirkung, neue bekommen Standards, die davon abhängen, ob die Domain Werbung zeigt, und der alte Schalter "Block AI Bots" ist ersetzt. Aus diesen drei Punkten folgt: Ihre aktuelle Einstellung ist wahrscheinlich nicht die, die Sie heute wählen würden.
Entscheiden Sie die Agenten-Frage getrennt von der Trainings-Frage. AI Agents zu blockieren hindert Assistenten daran, Ihre Seiten für einen Nutzer zu holen, der danach gefragt hat. Das ist näher daran, einen Browser zu blockieren, als einen Scraper. Wenn Ihr Produkt darauf setzt, dass Menschen es über einen Assistenten erreichen, schneidet dieser Schalter einen Weg ab, den Sie offen haben wollen.
Halten Sie die robots.txt nicht für Durchsetzung. Sie ist eine Bitte, die rechenschaftspflichtige Crawler einhalten, und Cloudflares eigene Darstellung teilt die Welt in Crawler, die Präferenzen respektieren, und solche, die es mit Gewalt blockiert. Zähne hat das Blockieren, und es gilt nur für Verkehr, den Cloudflare identifizieren kann.
Achten Sie auf die Termine, bevor Sie sich darauf verlassen. Microsofts robots.txt-Unterstützung ist für Anfang 2027 angestrebt, das Versprechen und die Leitungen landen also nicht gleichzeitig. Das ist dasselbe Argument wie bei Cloudflares Gateway-Funktion, die MCP-Verkehr erkennt. Die Netzwerkebene entscheidet, was ein KI-System mit Ihren Inhalten tun darf.
Quellen
Ähnliche Artikel

SourceHut verbietet ab 10. September LLM-gestützten Code und Tickets
SourceHut verbietet ab dem 10. September 2026 von LLMs geschriebenen Code, Tickets und E-Mails. Die Durchsetzung beruht auf Ehrlichkeit, ganz ohne automatische KI-Erkennungswerkzeuge.

Microsofts KI-Verhaltenskodex ist ein Entwurf, keine Regel
Microsoft veröffentlichte am 14. September 2026 absolute Grenzen für seine MAI-Modelle und sagte dann, die aktuellen Modelle seien noch nicht darauf trainiert.

Südkorea wählt drei Betreiber für kostenlose KI für alle Einwohner
Südkoreas Wissenschaftsministerium benannte Konsortien unter Führung von SK Telecom, KT und Kakao, die kostenlose KI ohne Limits für das ganze Land betreiben. Der Großteil muss auf koreanischen Modellen laufen.