Skip to content
Tech AI Wire

Cloudflare separa treino de IA da indexação de busca

Um ajuste chamado Disallow AI Training permite recusar rastreadores de treino e permanecer na busca. Rastreadores mistos são 36,6% do tráfego verificado.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
The wall of lava lamps in the lobby of Cloudflare's San Francisco office.
Foto: Wikimedia Commons / FASTILY, CC BY-SA 4.0

Em números

of verified crawler traffic from mixed-use crawlers
36.6%
controls: Search, AI Training and AI Agents
3
when the new settings were announced
Sept 15

A Cloudflare separou duas coisas que até agora chegavam pelo mesmo rastreador. Desde 15 de setembro de 2026, um site pode recusar que seu conteúdo seja usado para treinar IA e continuar totalmente indexado na busca. A Cloudflare chama o ajuste de "Disallow AI Training" e o coloca nas configurações de segurança.

Até agora isso era uma escolha só, não duas. Um rastreador que coletava páginas para um índice de busca e para treinar modelos era um único visitante, então bloquear o treino tirava você da busca. O comunicado da Cloudflare mede esse problema em 36,6% do tráfego de rastreadores verificados da sua rede. A demanda é ampla: a PYMNTS relata que quase 90% das organizações consideram um desafio gerenciar o tráfego de bots.

Como o sinal realmente viaja

O mecanismo é deliberadamente sem graça, e é isso que o torna usável. A Cloudflare publica a sua preferência no robots.txt por meio de um recurso que agora chama de Bot Preference Sync, substituindo o Managed Robots.txt. O ajuste em si substitui o antigo botão "Block AI Bots".

O comunicado da Cloudflare aponta o robots.txt como a via principal de recusa e diz aceitar também padrões comparáveis, entre eles sinais de preferência por cabeçalho HTTP vindos do trabalho ai-prefs em andamento na IETF.

Os controles dividem o tráfego em três categorias com chaves independentes: Search, AI Training e AI Agents. A terceira é a que exige reflexão, porque um agente que busca a sua página a pedido de uma pessoa não a indexa nem treina com ela.

A aplicação tem duas metades. Espera-se que os rastreadores que a Cloudflare considera responsáveis respeitem a preferência. Rastreadores mistos que não separam suas finalidades são bloqueados por completo quando você ativa as restrições, e a Cloudflare diz relatar a conformidade pelo Radar.

Quem entrou, e o que vale por padrão

A lista de apoios importa mais que o recurso, porque uma preferência só funciona se os rastreadores a lerem.

ItemDetalhe
Rastreadores mistos responsáveisApple, Google e Microsoft cumprem os critérios ou se comprometeram
Já separam busca e treinoAmazon, Anthropic, Meta e OpenAI
PrazosFerramentas de URL de Apple e Google citadas para o início de 2025; suporte a robots.txt da Microsoft previsto para o início de 2027
Novos domínios com anúnciosAI Training e Agent bloqueados por padrão nas páginas com anúncios; Search permitido
Novos domínios sem anúnciosSearch, Training e Agents todos permitidos por padrão
Domínios existentesOs ajustes migram preservando o efeito prático atual
DisponibilidadeTodos os clientes, em qualquer plano

A divisão padrão merece duas leituras. A Cloudflare traça a linha especificamente em torno das páginas sustentadas por anúncios, e isso diz algo sobre qual economia ela considera em risco.

O que isso significa para os desenvolvedores

Se você mantém um site na Cloudflare, verifique em que estado está, em vez de supor. Domínios existentes mantêm o comportamento efetivo, os novos recebem padrões que dependem de o domínio exibir anúncios, e o antigo botão "Block AI Bots" foi substituído. Desses três fatos decorre que o seu ajuste atual provavelmente não é o que você escolheria hoje.

Decida a questão dos agentes separadamente da questão do treino. Bloquear AI Agents impede que assistentes busquem as suas páginas para uma pessoa que pediu, o que se parece mais com bloquear um navegador do que um raspador. Se o seu produto conta com pessoas chegando por um assistente, essa chave corta um caminho que talvez você queira aberto.

Não trate o robots.txt como imposição. Ele é um pedido que rastreadores responsáveis honram, e o próprio enquadramento da Cloudflare divide o mundo entre rastreadores que respeitam preferências e rastreadores que ela bloqueia à força. O que tem dentes é o bloqueio, e ele só alcança o tráfego que a Cloudflare consegue identificar.

Observe os prazos antes de depender disso. O suporte a robots.txt da Microsoft é previsto para o início de 2027, então a promessa e o encanamento não chegam juntos. É o mesmo argumento do recurso Gateway da Cloudflare que detecta tráfego MCP. A camada de rede está decidindo o que um sistema de IA pode fazer com o seu conteúdo.

Fontes

  1. Have it both ways: stay discoverable in search while disallowing AI training - Cloudflare
  2. Cloudflare Helps End the Search-or-AI-Training Tradeoff - Cloudflare
  3. Cloudflare Helps Website Owners Block AI Scraping Without Losing Search Visibility - PYMNTS

Artigos relacionados