Cloudflare presentó un nuevo mecanismo, llamado Content Signals Policy, que extiende el archivo estándar robots.txt para que los propietarios de sitios web puedan especificar permisos separados para la indexación en buscadores frente al entrenamiento de modelos de IA. Anteriormente, los propietarios de sitios que optaban por bloquear rastreadores de IA enfrentaban una disyuntiva de todo o nada: bloquear un rastreador para impedir su uso en entrenamiento también eliminaba el sitio del índice de ese rastreador, cortando la visibilidad en respuestas de búsqueda generadas por IA y en chats.
El nuevo formato de señal permite que un sitio declare, por ejemplo, que un rastreador determinado puede indexar y citar sus páginas en resultados de búsqueda y motores de respuesta de IA, pero no puede usar el contenido rastreado para entrenar o ajustar (fine-tune) un modelo. Cloudflare plantea esto como una forma de que los editores permanezcan descubribles en la proporción creciente de investigación realizada a través de asistentes de IA, sin ceder por defecto el contenido a los procesos de entrenamiento de modelos.
La adopción depende de que los operadores de rastreadores respeten la señal de forma voluntaria; las directivas de robots.txt, incluido este nuevo campo, no son legalmente exigibles y dependen de que el rastreador se comporte según lo indicado. Cloudflare ha declarado que ayudará a hacer cumplir la política para los rastreadores que pasan por su red, pero la cobertura para bots de IA que evitan la infraestructura de Cloudflare no está confirmada.
Para las empresas B2B que publican páginas comparativas, documentación o casos de estudio como parte de su embudo de ventas y soporte, la capacidad de ser descubiertas dentro de los motores de respuesta de IA se ha convertido en una fuente relevante de tráfico y leads, junto con la búsqueda orgánica tradicional. Esta actualización ofrece a los operadores una forma documentada y estandarizada de separar 'ser encontrado' de 'ser usado para entrenar', en lugar de tener que elegir entre uno u otro. Las empresas que dependen de pipelines impulsados por contenido deberían revisar su configuración actual de robots.txt, confirmar si su CMS o la configuración de su zona en Cloudflare expone esta nueva señal, y decidir la política por cada rastreador en lugar de aplicar una regla general de bloqueo o permiso.