A Cloudflare introduziu um novo mecanismo, chamado Content Signals Policy, que estende o arquivo robots.txt padrão para permitir que donos de sites especifiquem permissões separadas para indexação de busca e treinamento de modelos de IA. Antes, sites que optavam por bloquear crawlers de IA enfrentavam uma escolha tudo-ou-nada: bloquear um crawler para impedir o uso em treinamento também removia o site do índice daquele crawler, cortando a visibilidade em respostas de busca geradas por IA e em chats.
O novo formato de sinal permite que um site declare, por exemplo, que determinado crawler pode indexar e citar suas páginas em resultados de busca e mecanismos de resposta de IA, mas não pode usar o conteúdo coletado para treinar ou ajustar um modelo. A Cloudflare descreve isso como uma forma de dar aos publishers um jeito de continuar descobríveis na fatia crescente de pesquisas feitas por assistentes de IA, sem entregar automaticamente o conteúdo para pipelines de treinamento de modelos.
A adoção depende de os operadores de crawlers respeitarem o sinal voluntariamente; diretivas de robots.txt, incluindo esse novo campo, não têm força legal e dependem de o crawler se comportar conforme instruído. A Cloudflare afirmou que ajudará a fazer cumprir a política para crawlers que passam por sua rede, mas a cobertura para bots de IA que contornam a infraestrutura da Cloudflare permanece não confirmada.
Para empresas B2B que publicam páginas de comparação, documentação ou estudos de caso como parte do funil de vendas e suporte, a descobribilidade dentro de mecanismos de resposta de IA se tornou uma fonte relevante de tráfego e leads, ao lado da busca orgânica tradicional. Essa atualização dá aos operadores uma forma documentada e padronizada de separar 'ser encontrado' de 'ser usado para treino', em vez de precisar escolher um ou outro. Empresas que rodam pipelines orientados a conteúdo devem revisar sua configuração atual de robots.txt, confirmar se seu CMS ou as configurações de zona da Cloudflare expõem esse novo sinal, e decidir a política por crawler, em vez de aplicar uma regra genérica de bloqueio ou permissão.