Skip to content
Tech AI Wire

Cloudflare sépare l'entraînement IA de l'indexation

Un réglage « Disallow AI Training » permet de refuser les robots d'entraînement et de rester dans la recherche. Les robots à double usage font 36,6% du trafic vérifié.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
The wall of lava lamps in the lobby of Cloudflare's San Francisco office.
Photo: Wikimedia Commons / FASTILY, CC BY-SA 4.0

En chiffres

of verified crawler traffic from mixed-use crawlers
36.6%
controls: Search, AI Training and AI Agents
3
when the new settings were announced
Sept 15

Cloudflare a séparé deux choses qui arrivaient jusqu'ici par le même robot. Depuis le 15 septembre 2026, un site peut refuser que son contenu serve à l'entraînement d'IA tout en restant pleinement indexé dans la recherche. Cloudflare appelle ce réglage « Disallow AI Training » et le place dans ses paramètres de sécurité.

Jusqu'ici c'était un seul choix, pas deux. Un robot qui collectait des pages pour un index de recherche et pour l'entraînement d'un modèle était un visiteur unique : bloquer l'entraînement vous faisait donc sortir de la recherche. Le communiqué de Cloudflare chiffre ce problème à 36,6% du trafic de robots vérifiés sur son réseau. La demande est large : PYMNTS rapporte que près de 90% des organisations jugent la gestion du trafic de robots difficile.

Comment le signal circule vraiment

Le mécanisme est volontairement ennuyeux, et c'est ce qui le rend utilisable. Cloudflare publie votre préférence dans robots.txt via une fonction désormais appelée Bot Preference Sync, qui remplace Managed Robots.txt. Le réglage lui-même remplace l'ancien interrupteur « Block AI Bots ».

Le communiqué de Cloudflare désigne robots.txt comme l'opt-out principal et indique accepter aussi des standards comparables, dont les signaux de préférence par en-tête HTTP issus des travaux ai-prefs en cours à l'IETF.

Les contrôles divisent le trafic en trois catégories indépendantes : Search, AI Training et AI Agents. La troisième est celle à laquelle il faut réfléchir, car un agent qui va chercher votre page pour un utilisateur ne l'indexe pas et ne s'entraîne pas dessus.

L'application a deux moitiés. Les robots que Cloudflare considère comme responsables sont censés respecter la préférence. Les robots à double usage qui ne séparent pas leurs finalités sont bloqués purement et simplement quand vous activez les restrictions, et Cloudflare dit publier la conformité via Radar.

Qui a signé, et ce qui s'applique par défaut

La liste des soutiens compte plus que la fonction, car une préférence n'agit que si les robots la lisent.

ÉlémentDétail
Robots à double usage responsablesApple, Google et Microsoft remplissent les critères ou s'y sont engagés
Séparent déjà recherche et entraînementAmazon, Anthropic, Meta et OpenAI
CalendrierOutils d'URL d'Apple et Google cités pour début 2025 ; prise en charge robots.txt de Microsoft visée début 2027
Nouveaux domaines avec publicitéAI Training et Agent bloqués par défaut sur les pages portant des publicités ; Search autorisé
Nouveaux domaines sans publicitéSearch, Training et Agents tous autorisés par défaut
Domaines existantsLes réglages migrent en préservant leur effet pratique
DisponibilitéTous les clients, sur toutes les offres

La répartition par défaut mérite deux lectures. Cloudflare trace la ligne spécifiquement autour des pages financées par la publicité, ce qui dit quelque chose sur l'économie qu'il juge menacée.

Ce que cela signifie pour les développeurs

Si vous exploitez un site chez Cloudflare, vérifiez dans quel état vous êtes au lieu de le supposer. Les domaines existants conservent leur comportement effectif, les nouveaux reçoivent des défauts qui dépendent de la présence de publicité, et l'ancien interrupteur « Block AI Bots » a été remplacé. Ces trois faits signifient que votre réglage actuel n'est probablement pas celui que vous choisiriez aujourd'hui.

Décidez de la question des agents séparément de celle de l'entraînement. Bloquer AI Agents empêche les assistants d'aller chercher vos pages pour un utilisateur qui l'a demandé, ce qui ressemble plus à bloquer un navigateur qu'un aspirateur de contenu. Si votre produit compte sur des visiteurs arrivant via un assistant, cet interrupteur coupe une voie que vous voulez peut-être ouverte.

Ne prenez pas robots.txt pour une application contraignante. C'est une demande que les robots responsables honorent, et le cadrage de Cloudflare lui-même divise le monde entre robots qui respectent les préférences et robots qu'il bloque par la force. C'est le blocage qui a des dents, et il ne vaut que pour le trafic que Cloudflare peut identifier.

Regardez les échéances avant de vous appuyer dessus. La prise en charge de robots.txt par Microsoft est visée pour début 2027 : la promesse et la plomberie n'arrivent donc pas ensemble. C'est le même argument que la fonction Gateway de Cloudflare qui détecte le trafic MCP. La couche réseau décide de ce qu'un système d'IA peut faire de votre contenu.

Sources

  1. Have it both ways: stay discoverable in search while disallowing AI training - Cloudflare
  2. Cloudflare Helps End the Search-or-AI-Training Tradeoff - Cloudflare
  3. Cloudflare Helps Website Owners Block AI Scraping Without Losing Search Visibility - PYMNTS

Articles liés