Cloudflare separa el entrenamiento de IA de la indexación
Un ajuste llamado Disallow AI Training permite rechazar rastreadores de entrenamiento y seguir en búsqueda. Los rastreadores mixtos son el 36,6% del tráfico verificado.
3 min de lectura

En cifras
- of verified crawler traffic from mixed-use crawlers
- 36.6%
- controls: Search, AI Training and AI Agents
- 3
- when the new settings were announced
- Sept 15
Cloudflare ha separado dos cosas que hasta ahora llegaban en el mismo rastreador. Desde el 15 de septiembre de 2026, un sitio puede negarse a que su contenido se use para entrenar IA y seguir plenamente indexado en búsqueda. Cloudflare llama al ajuste "Disallow AI Training" y lo coloca en sus opciones de seguridad.
Hasta ahora era una sola decisión, no dos. Un rastreador que recogía páginas para un índice de búsqueda y para entrenar modelos era un único visitante, así que bloquear el entrenamiento te sacaba de la búsqueda. El comunicado de Cloudflare cifra ese problema en el 36,6% del tráfico de rastreadores verificados de su red. La demanda es amplia: PYMNTS informa de que casi el 90% de las organizaciones considera un reto gestionar el tráfico de bots.
Cómo viaja de verdad la señal
El mecanismo es deliberadamente aburrido, y eso es lo que lo hace utilizable. Cloudflare publica tu preferencia en robots.txt mediante una función que ahora llama Bot Preference Sync, que sustituye a Managed Robots.txt. El ajuste en sí sustituye al viejo interruptor "Block AI Bots".
El comunicado de Cloudflare señala robots.txt como la vía principal de exclusión y dice aceptar también estándares comparables, entre ellos señales de preferencia por cabecera HTTP del trabajo ai-prefs que se cuece en el IETF.
Los controles dividen el tráfico en tres categorías conmutables por separado: Search, AI Training y AI Agents. La tercera es la que hay que pensar, porque un agente que busca tu página por encargo de una persona no la indexa ni entrena con ella.
La aplicación tiene dos mitades. De los rastreadores que Cloudflare considera responsables se espera que respeten la preferencia. Los rastreadores mixtos que no separan sus fines quedan bloqueados por completo cuando activas las restricciones, y Cloudflare dice informar del cumplimiento a través de Radar.
Quién se ha apuntado y qué ocurre por defecto
La lista de apoyos importa más que la función, porque una preferencia solo sirve si los rastreadores la leen.
| Elemento | Detalle |
|---|---|
| Rastreadores mixtos responsables | Apple, Google y Microsoft cumplen los criterios o se han comprometido |
| Ya separan búsqueda y entrenamiento | Amazon, Anthropic, Meta y OpenAI |
| Plazos | Herramientas de URL de Apple y Google citadas para principios de 2025; soporte de robots.txt de Microsoft previsto para principios de 2027 |
| Dominios nuevos con publicidad | AI Training y Agent bloqueados por defecto en páginas con anuncios; Search permitido |
| Dominios nuevos sin publicidad | Search, Training y Agents permitidos por defecto |
| Dominios existentes | Los ajustes migran preservando su efecto práctico |
| Disponibilidad | Todos los clientes, en cualquier plan |
El reparto por defecto merece leerse dos veces. Cloudflare traza la línea justo alrededor de las páginas con publicidad, y eso dice algo sobre qué economía considera en riesgo.
Qué significa esto para los desarrolladores
Si tienes un sitio en Cloudflare, comprueba en qué estado estás en vez de suponerlo. Los dominios existentes conservan su comportamiento efectivo, los nuevos reciben valores por defecto que dependen de si el dominio muestra anuncios, y el viejo interruptor "Block AI Bots" ha sido sustituido. De esos tres hechos se sigue que tu ajuste actual probablemente no es el que elegirías hoy.
Decide la cuestión de los agentes por separado de la del entrenamiento. Bloquear AI Agents impide que los asistentes recojan tus páginas para una persona que lo ha pedido, lo que se parece más a bloquear un navegador que a bloquear un raspador. Si tu producto espera que la gente llegue a través de un asistente, ese interruptor corta un camino que quizá quieras abierto.
No tomes robots.txt por un mecanismo de obligación. Es una petición que los rastreadores responsables honran, y el propio planteamiento de Cloudflare divide el mundo entre rastreadores que respetan preferencias y rastreadores a los que bloquea por la fuerza. Lo que tiene dientes es el bloqueo, y solo alcanza al tráfico que Cloudflare puede identificar.
Mira los plazos antes de depender de esto. El soporte de robots.txt de Microsoft está previsto para principios de 2027, así que la promesa y la fontanería no aterrizan juntas. Es el mismo argumento que la función Gateway de Cloudflare que detecta tráfico MCP. La capa de red está decidiendo qué puede hacer un sistema de IA con tu contenido.
Fuentes
Artículos relacionados

SourceHut prohíbe el código y los tickets hechos con LLM desde el 10 de septiembre
SourceHut prohibirá el código, los tickets y los correos escritos con LLM desde el 10 de septiembre de 2026. El control se basa en la honestidad, sin ninguna herramienta automática de detección de IA.

El código de conducta de IA de Microsoft es un borrador
Microsoft publicó el 14 de septiembre de 2026 restricciones absolutas para sus modelos MAI, y luego dijo que sus modelos actuales aún no están entrenados con el documento.

Corea del Sur elige tres operadores para dar IA gratis a todos
El ministerio de Ciencia surcoreano designó consorcios liderados por SK Telecom, KT y Kakao para operar una IA gratuita y sin límites. La mayor parte debe ejecutarse en modelos coreanos.