Skip to content

Cloudflare permite bloquear treinamento de IA sem perder visibilidade em buscas de IA

Resposta curta

A Cloudflare lançou uma extensão do robots.txt chamada Content Signals Policy, que permite aos donos de sites autorizar crawlers de IA a indexar e citar conteúdo em buscas e respostas de chat, ao mesmo tempo em que proíbem explicitamente o uso desse conteúdo para treinar modelos — substituindo o antigo bloqueio tudo-ou-nada.

O que isso significa na operação

Para uma empresa B2B de 10 a 200 pessoas, isso é uma alavanca direta sobre geração de leads via busca por IA. Compradores cada vez mais pesquisam fornecedores pelo ChatGPT, Perplexity e AI Overviews em vez de clicar em links tradicionais, então ser recuperável e citável nessas respostas importa para o pipeline comercial. Até agora, bloquear crawlers de IA para proteger conteúdo proprietário (páginas de preço, estudos de caso, documentação técnica) também arriscava tirar a empresa completamente das respostas geradas por IA. Com esse novo sinal, um operador pode dizer aos crawlers: indexe e cite nosso conteúdo, mas não treine com ele. Times de marketing e RevOps devem atualizar o robots.txt para declarar essa política explicitamente, em vez de depender do comportamento padrão dos crawlers, e devem auditar quais bots de IA (da OpenAI, Anthropic, Google, Perplexity) realmente respeitam essa diretriz, já que a conformidade é voluntária.

A Cloudflare introduziu um novo mecanismo, chamado Content Signals Policy, que estende o arquivo robots.txt padrão para permitir que donos de sites especifiquem permissões separadas para indexação de busca e treinamento de modelos de IA. Antes, sites que optavam por bloquear crawlers de IA enfrentavam uma escolha tudo-ou-nada: bloquear um crawler para impedir o uso em treinamento também removia o site do índice daquele crawler, cortando a visibilidade em respostas de busca geradas por IA e em chats.

O novo formato de sinal permite que um site declare, por exemplo, que determinado crawler pode indexar e citar suas páginas em resultados de busca e mecanismos de resposta de IA, mas não pode usar o conteúdo coletado para treinar ou ajustar um modelo. A Cloudflare descreve isso como uma forma de dar aos publishers um jeito de continuar descobríveis na fatia crescente de pesquisas feitas por assistentes de IA, sem entregar automaticamente o conteúdo para pipelines de treinamento de modelos.

A adoção depende de os operadores de crawlers respeitarem o sinal voluntariamente; diretivas de robots.txt, incluindo esse novo campo, não têm força legal e dependem de o crawler se comportar conforme instruído. A Cloudflare afirmou que ajudará a fazer cumprir a política para crawlers que passam por sua rede, mas a cobertura para bots de IA que contornam a infraestrutura da Cloudflare permanece não confirmada.

Para empresas B2B que publicam páginas de comparação, documentação ou estudos de caso como parte do funil de vendas e suporte, a descobribilidade dentro de mecanismos de resposta de IA se tornou uma fonte relevante de tráfego e leads, ao lado da busca orgânica tradicional. Essa atualização dá aos operadores uma forma documentada e padronizada de separar 'ser encontrado' de 'ser usado para treino', em vez de precisar escolher um ou outro. Empresas que rodam pipelines orientados a conteúdo devem revisar sua configuração atual de robots.txt, confirmar se seu CMS ou as configurações de zona da Cloudflare expõem esse novo sinal, e decidir a política por crawler, em vez de aplicar uma regra genérica de bloqueio ou permissão.

Fonte: Cloudflare Blog · No Atlas: Cloudflare OS →

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.