Skip to content
Tech AI Wire

Cloudflare separa el entrenamiento de IA de la indexación

Un ajuste llamado Disallow AI Training permite rechazar rastreadores de entrenamiento y seguir en búsqueda. Los rastreadores mixtos son el 36,6% del tráfico verificado.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
The wall of lava lamps in the lobby of Cloudflare's San Francisco office.
Foto: Wikimedia Commons / FASTILY, CC BY-SA 4.0

En cifras

of verified crawler traffic from mixed-use crawlers
36.6%
controls: Search, AI Training and AI Agents
3
when the new settings were announced
Sept 15

Cloudflare ha separado dos cosas que hasta ahora llegaban en el mismo rastreador. Desde el 15 de septiembre de 2026, un sitio puede negarse a que su contenido se use para entrenar IA y seguir plenamente indexado en búsqueda. Cloudflare llama al ajuste "Disallow AI Training" y lo coloca en sus opciones de seguridad.

Hasta ahora era una sola decisión, no dos. Un rastreador que recogía páginas para un índice de búsqueda y para entrenar modelos era un único visitante, así que bloquear el entrenamiento te sacaba de la búsqueda. El comunicado de Cloudflare cifra ese problema en el 36,6% del tráfico de rastreadores verificados de su red. La demanda es amplia: PYMNTS informa de que casi el 90% de las organizaciones considera un reto gestionar el tráfico de bots.

Cómo viaja de verdad la señal

El mecanismo es deliberadamente aburrido, y eso es lo que lo hace utilizable. Cloudflare publica tu preferencia en robots.txt mediante una función que ahora llama Bot Preference Sync, que sustituye a Managed Robots.txt. El ajuste en sí sustituye al viejo interruptor "Block AI Bots".

El comunicado de Cloudflare señala robots.txt como la vía principal de exclusión y dice aceptar también estándares comparables, entre ellos señales de preferencia por cabecera HTTP del trabajo ai-prefs que se cuece en el IETF.

Los controles dividen el tráfico en tres categorías conmutables por separado: Search, AI Training y AI Agents. La tercera es la que hay que pensar, porque un agente que busca tu página por encargo de una persona no la indexa ni entrena con ella.

La aplicación tiene dos mitades. De los rastreadores que Cloudflare considera responsables se espera que respeten la preferencia. Los rastreadores mixtos que no separan sus fines quedan bloqueados por completo cuando activas las restricciones, y Cloudflare dice informar del cumplimiento a través de Radar.

Quién se ha apuntado y qué ocurre por defecto

La lista de apoyos importa más que la función, porque una preferencia solo sirve si los rastreadores la leen.

ElementoDetalle
Rastreadores mixtos responsablesApple, Google y Microsoft cumplen los criterios o se han comprometido
Ya separan búsqueda y entrenamientoAmazon, Anthropic, Meta y OpenAI
PlazosHerramientas de URL de Apple y Google citadas para principios de 2025; soporte de robots.txt de Microsoft previsto para principios de 2027
Dominios nuevos con publicidadAI Training y Agent bloqueados por defecto en páginas con anuncios; Search permitido
Dominios nuevos sin publicidadSearch, Training y Agents permitidos por defecto
Dominios existentesLos ajustes migran preservando su efecto práctico
DisponibilidadTodos los clientes, en cualquier plan

El reparto por defecto merece leerse dos veces. Cloudflare traza la línea justo alrededor de las páginas con publicidad, y eso dice algo sobre qué economía considera en riesgo.

Qué significa esto para los desarrolladores

Si tienes un sitio en Cloudflare, comprueba en qué estado estás en vez de suponerlo. Los dominios existentes conservan su comportamiento efectivo, los nuevos reciben valores por defecto que dependen de si el dominio muestra anuncios, y el viejo interruptor "Block AI Bots" ha sido sustituido. De esos tres hechos se sigue que tu ajuste actual probablemente no es el que elegirías hoy.

Decide la cuestión de los agentes por separado de la del entrenamiento. Bloquear AI Agents impide que los asistentes recojan tus páginas para una persona que lo ha pedido, lo que se parece más a bloquear un navegador que a bloquear un raspador. Si tu producto espera que la gente llegue a través de un asistente, ese interruptor corta un camino que quizá quieras abierto.

No tomes robots.txt por un mecanismo de obligación. Es una petición que los rastreadores responsables honran, y el propio planteamiento de Cloudflare divide el mundo entre rastreadores que respetan preferencias y rastreadores a los que bloquea por la fuerza. Lo que tiene dientes es el bloqueo, y solo alcanza al tráfico que Cloudflare puede identificar.

Mira los plazos antes de depender de esto. El soporte de robots.txt de Microsoft está previsto para principios de 2027, así que la promesa y la fontanería no aterrizan juntas. Es el mismo argumento que la función Gateway de Cloudflare que detecta tráfico MCP. La capa de red está decidiendo qué puede hacer un sistema de IA con tu contenido.

Fuentes

  1. Have it both ways: stay discoverable in search while disallowing AI training - Cloudflare
  2. Cloudflare Helps End the Search-or-AI-Training Tradeoff - Cloudflare
  3. Cloudflare Helps Website Owners Block AI Scraping Without Losing Search Visibility - PYMNTS

Artículos relacionados