Cloudflare separa treino de IA da indexação de busca
Um ajuste chamado Disallow AI Training permite recusar rastreadores de treino e permanecer na busca. Rastreadores mistos são 36,6% do tráfego verificado.
3 min de leitura

Em números
- of verified crawler traffic from mixed-use crawlers
- 36.6%
- controls: Search, AI Training and AI Agents
- 3
- when the new settings were announced
- Sept 15
A Cloudflare separou duas coisas que até agora chegavam pelo mesmo rastreador. Desde 15 de setembro de 2026, um site pode recusar que seu conteúdo seja usado para treinar IA e continuar totalmente indexado na busca. A Cloudflare chama o ajuste de "Disallow AI Training" e o coloca nas configurações de segurança.
Até agora isso era uma escolha só, não duas. Um rastreador que coletava páginas para um índice de busca e para treinar modelos era um único visitante, então bloquear o treino tirava você da busca. O comunicado da Cloudflare mede esse problema em 36,6% do tráfego de rastreadores verificados da sua rede. A demanda é ampla: a PYMNTS relata que quase 90% das organizações consideram um desafio gerenciar o tráfego de bots.
Como o sinal realmente viaja
O mecanismo é deliberadamente sem graça, e é isso que o torna usável. A Cloudflare publica a sua preferência no robots.txt por meio de um recurso que agora chama de Bot Preference Sync, substituindo o Managed Robots.txt. O ajuste em si substitui o antigo botão "Block AI Bots".
O comunicado da Cloudflare aponta o robots.txt como a via principal de recusa e diz aceitar também padrões comparáveis, entre eles sinais de preferência por cabeçalho HTTP vindos do trabalho ai-prefs em andamento na IETF.
Os controles dividem o tráfego em três categorias com chaves independentes: Search, AI Training e AI Agents. A terceira é a que exige reflexão, porque um agente que busca a sua página a pedido de uma pessoa não a indexa nem treina com ela.
A aplicação tem duas metades. Espera-se que os rastreadores que a Cloudflare considera responsáveis respeitem a preferência. Rastreadores mistos que não separam suas finalidades são bloqueados por completo quando você ativa as restrições, e a Cloudflare diz relatar a conformidade pelo Radar.
Quem entrou, e o que vale por padrão
A lista de apoios importa mais que o recurso, porque uma preferência só funciona se os rastreadores a lerem.
| Item | Detalhe |
|---|---|
| Rastreadores mistos responsáveis | Apple, Google e Microsoft cumprem os critérios ou se comprometeram |
| Já separam busca e treino | Amazon, Anthropic, Meta e OpenAI |
| Prazos | Ferramentas de URL de Apple e Google citadas para o início de 2025; suporte a robots.txt da Microsoft previsto para o início de 2027 |
| Novos domínios com anúncios | AI Training e Agent bloqueados por padrão nas páginas com anúncios; Search permitido |
| Novos domínios sem anúncios | Search, Training e Agents todos permitidos por padrão |
| Domínios existentes | Os ajustes migram preservando o efeito prático atual |
| Disponibilidade | Todos os clientes, em qualquer plano |
A divisão padrão merece duas leituras. A Cloudflare traça a linha especificamente em torno das páginas sustentadas por anúncios, e isso diz algo sobre qual economia ela considera em risco.
O que isso significa para os desenvolvedores
Se você mantém um site na Cloudflare, verifique em que estado está, em vez de supor. Domínios existentes mantêm o comportamento efetivo, os novos recebem padrões que dependem de o domínio exibir anúncios, e o antigo botão "Block AI Bots" foi substituído. Desses três fatos decorre que o seu ajuste atual provavelmente não é o que você escolheria hoje.
Decida a questão dos agentes separadamente da questão do treino. Bloquear AI Agents impede que assistentes busquem as suas páginas para uma pessoa que pediu, o que se parece mais com bloquear um navegador do que um raspador. Se o seu produto conta com pessoas chegando por um assistente, essa chave corta um caminho que talvez você queira aberto.
Não trate o robots.txt como imposição. Ele é um pedido que rastreadores responsáveis honram, e o próprio enquadramento da Cloudflare divide o mundo entre rastreadores que respeitam preferências e rastreadores que ela bloqueia à força. O que tem dentes é o bloqueio, e ele só alcança o tráfego que a Cloudflare consegue identificar.
Observe os prazos antes de depender disso. O suporte a robots.txt da Microsoft é previsto para o início de 2027, então a promessa e o encanamento não chegam juntos. É o mesmo argumento do recurso Gateway da Cloudflare que detecta tráfego MCP. A camada de rede está decidindo o que um sistema de IA pode fazer com o seu conteúdo.
Fontes
Artigos relacionados

SourceHut proíbe código e tickets feitos com LLM a partir de 10 de setembro
O SourceHut vai proibir código, tickets e e-mails escritos por LLM a partir de 10 de setembro de 2026. A fiscalização é baseada na honestidade, sem nenhuma ferramenta automática de detecção de IA.

O código de conduta de IA da Microsoft é um rascunho
A Microsoft publicou em 14 de setembro de 2026 restrições absolutas para seus modelos MAI e depois disse que os modelos atuais ainda não são treinados com o documento.

Coreia do Sul escolhe três operadores para dar IA grátis a todos
O ministério da Ciência sul-coreano nomeou consórcios liderados por SK Telecom, KT e Kakao para operar IA gratuita e sem limites. A maior parte precisa rodar em modelos coreanos.