Cloudflare sépare l'entraînement IA de l'indexation
Un réglage « Disallow AI Training » permet de refuser les robots d'entraînement et de rester dans la recherche. Les robots à double usage font 36,6% du trafic vérifié.
3 min de lecture

En chiffres
- of verified crawler traffic from mixed-use crawlers
- 36.6%
- controls: Search, AI Training and AI Agents
- 3
- when the new settings were announced
- Sept 15
Cloudflare a séparé deux choses qui arrivaient jusqu'ici par le même robot. Depuis le 15 septembre 2026, un site peut refuser que son contenu serve à l'entraînement d'IA tout en restant pleinement indexé dans la recherche. Cloudflare appelle ce réglage « Disallow AI Training » et le place dans ses paramètres de sécurité.
Jusqu'ici c'était un seul choix, pas deux. Un robot qui collectait des pages pour un index de recherche et pour l'entraînement d'un modèle était un visiteur unique : bloquer l'entraînement vous faisait donc sortir de la recherche. Le communiqué de Cloudflare chiffre ce problème à 36,6% du trafic de robots vérifiés sur son réseau. La demande est large : PYMNTS rapporte que près de 90% des organisations jugent la gestion du trafic de robots difficile.
Comment le signal circule vraiment
Le mécanisme est volontairement ennuyeux, et c'est ce qui le rend utilisable. Cloudflare publie votre préférence dans robots.txt via une fonction désormais appelée Bot Preference Sync, qui remplace Managed Robots.txt. Le réglage lui-même remplace l'ancien interrupteur « Block AI Bots ».
Le communiqué de Cloudflare désigne robots.txt comme l'opt-out principal et indique accepter aussi des standards comparables, dont les signaux de préférence par en-tête HTTP issus des travaux ai-prefs en cours à l'IETF.
Les contrôles divisent le trafic en trois catégories indépendantes : Search, AI Training et AI Agents. La troisième est celle à laquelle il faut réfléchir, car un agent qui va chercher votre page pour un utilisateur ne l'indexe pas et ne s'entraîne pas dessus.
L'application a deux moitiés. Les robots que Cloudflare considère comme responsables sont censés respecter la préférence. Les robots à double usage qui ne séparent pas leurs finalités sont bloqués purement et simplement quand vous activez les restrictions, et Cloudflare dit publier la conformité via Radar.
Qui a signé, et ce qui s'applique par défaut
La liste des soutiens compte plus que la fonction, car une préférence n'agit que si les robots la lisent.
| Élément | Détail |
|---|---|
| Robots à double usage responsables | Apple, Google et Microsoft remplissent les critères ou s'y sont engagés |
| Séparent déjà recherche et entraînement | Amazon, Anthropic, Meta et OpenAI |
| Calendrier | Outils d'URL d'Apple et Google cités pour début 2025 ; prise en charge robots.txt de Microsoft visée début 2027 |
| Nouveaux domaines avec publicité | AI Training et Agent bloqués par défaut sur les pages portant des publicités ; Search autorisé |
| Nouveaux domaines sans publicité | Search, Training et Agents tous autorisés par défaut |
| Domaines existants | Les réglages migrent en préservant leur effet pratique |
| Disponibilité | Tous les clients, sur toutes les offres |
La répartition par défaut mérite deux lectures. Cloudflare trace la ligne spécifiquement autour des pages financées par la publicité, ce qui dit quelque chose sur l'économie qu'il juge menacée.
Ce que cela signifie pour les développeurs
Si vous exploitez un site chez Cloudflare, vérifiez dans quel état vous êtes au lieu de le supposer. Les domaines existants conservent leur comportement effectif, les nouveaux reçoivent des défauts qui dépendent de la présence de publicité, et l'ancien interrupteur « Block AI Bots » a été remplacé. Ces trois faits signifient que votre réglage actuel n'est probablement pas celui que vous choisiriez aujourd'hui.
Décidez de la question des agents séparément de celle de l'entraînement. Bloquer AI Agents empêche les assistants d'aller chercher vos pages pour un utilisateur qui l'a demandé, ce qui ressemble plus à bloquer un navigateur qu'un aspirateur de contenu. Si votre produit compte sur des visiteurs arrivant via un assistant, cet interrupteur coupe une voie que vous voulez peut-être ouverte.
Ne prenez pas robots.txt pour une application contraignante. C'est une demande que les robots responsables honorent, et le cadrage de Cloudflare lui-même divise le monde entre robots qui respectent les préférences et robots qu'il bloque par la force. C'est le blocage qui a des dents, et il ne vaut que pour le trafic que Cloudflare peut identifier.
Regardez les échéances avant de vous appuyer dessus. La prise en charge de robots.txt par Microsoft est visée pour début 2027 : la promesse et la plomberie n'arrivent donc pas ensemble. C'est le même argument que la fonction Gateway de Cloudflare qui détecte le trafic MCP. La couche réseau décide de ce qu'un système d'IA peut faire de votre contenu.
Sources
Articles liés

SourceHut interdit le code et les tickets assistés par LLM dès le 10 septembre
SourceHut interdira le code, les tickets et les e-mails écrits par des LLM à partir du 10 septembre 2026. L'application repose sur l'honneur, sans aucun outil automatique de détection d'IA.

Le code de conduite IA de Microsoft n'est qu'un projet
Microsoft a publié le 14 septembre 2026 des contraintes absolues pour ses modèles MAI, puis a précisé que ses modèles actuels n'y sont pas encore entraînés.

La Corée du Sud choisit trois opérateurs pour l'IA gratuite pour tous
Le ministère sud-coréen des Sciences a désigné des consortiums menés par SK Telecom, KT et Kakao pour exploiter une IA gratuite et sans limite. L'essentiel doit tourner sur des modèles coréens.