La empresa de infraestructura web Cloudflare ha introducido un nuevo control que permite a los editores de sitios web bloquear el uso de su contenido para el entrenamiento del modelo de IA y, al mismo tiempo, mantenerlo completamente disponible en los resultados de búsqueda tradicionales, una desvinculación que el ecosistema de rastreadores nunca antes había respaldado de manera limpia.
La característica, anunciada en el blog de Cloudflare el 15 de septiembre, llega junto con una nueva designación "Responsable" para los operadores de rastreadores. Según Cloudflare, Apple, Google y Microsoft son las primeras empresas cuyos rastreadores califican. Cualquiera que siga las últimas noticias sobre IA este año sabe que la cuestión de quién puede extraer el contenido publicado se ha convertido en una de las luchas políticas más disputadas en Internet.
El problema del rastreador de uso mixto
El problema central es lo que Cloudflare llama rastreadores de uso mixto: robots únicos, como Googlebot, Bingbot y Applebot, que recuperan páginas para crear índices de búsqueda y recopilar datos de entrenamiento para modelos de IA. Históricamente, el propietario de un sitio que quería optar por no recibir capacitación en IA tenía un instrumento contundente (el archivo robots.txt no permitido) y al usarlo corría el riesgo de desaparecer por completo de los resultados de búsqueda.
La nueva configuración No permitir entrenamiento de IA de Cloudflare lleva el nombre de la directiva que publica en el archivo robots.txt de un sitio. Cuando está habilitada, la preferencia de no capacitación del sitio se sincroniza con robots.txt, los rastreadores de uso mixto responsables siguen estando permitidos para fines de búsqueda y todos los demás rastreadores de capacitación están bloqueados. Cloudflare señala que bloquear los rastreadores de solo entrenamiento (nombra los rastreadores de entrenamiento administrados por Amazon, Anthropic, Meta y OpenAI) nunca afectó la búsqueda en primer lugar.
¿Qué hace que un rastreador sea 'responsable'?
Para obtener la designación Responsable, un operador de bot debe cumplir o comprometerse a cumplir una serie de requisitos establecidos en la publicación del blog:
- Un mecanismo para que los propietarios de sitios opten por no recibir capacitación en IA, a través de robots.txt o un estándar similar.
- Un mecanismo para optar por no recibir resúmenes de IA, establecido directamente con el operador y, el próximo año, a través de Cloudflare.
- Visibilidad a nivel de URL sobre qué páginas estuvieron disponibles para capacitación, además de métricas que muestran cómo apareció el contenido en la búsqueda.
- Garantía de que la exclusión voluntaria de la capacitación en IA no afectará las clasificaciones de búsqueda tradicionales.
Cloudflare dice que Apple, Google y Microsoft actualmente demuestran que cumplen con los requisitos, combinando capacidades disponibles hoy con compromisos con plazos determinados para funciones aún en desarrollo.
Nuevas configuraciones, herramientas obsoletas
El cambio modifica los controles de administración de bots de Cloudflare, que ahora clasifican el tráfico de los rastreadores en tres comportamientos: búsqueda, capacitación y agente. Con la adición de No permitir entrenamiento de IA, las configuraciones disponibles son Permitir, No permitir entrenamiento de IA, Bloquear en páginas con anuncios y Bloquear.
Dos herramientas de larga data están quedando obsoletas. La amplia opción "Bloquear bots AI" da paso a controles más granulares de búsqueda, capacitación y agentes, y Managed Robots.txt se reemplaza por un sistema llamado Bot Preference Sync, y los clientes existentes se migran automáticamente. Disallow AI Training también formará parte de la configuración recomendada de Cloudflare para ciertos dominios nuevos.
El cambio más importante se refiere a la configuración de Bloqueo en sí. Anteriormente, Bloquear y "Bloquear páginas con anuncios" no se aplicaban a los rastreadores de uso mixto, porque bloquearlos podría dañar la visibilidad de la búsqueda. A partir del 15 de septiembre, esas configuraciones ahora se aplican a todos los rastreadores de capacitación, incluidos Applebot, Bingbot y Googlebot, lo que significa que un sitio que elige Bloquear ahora acepta las consecuencias de esa elección en el ranking de búsqueda.
No hay 'No permitir' para agentes, todavía
Queda una brecha. La categoría de Agente de Cloudflare cubre agentes dirigidos por el usuario, como agentes de uso del navegador y bots de búsqueda de chat, que visitan una página en nombre de una persona. La compañía escribe que los agentes no crean la misma compensación de búsqueda-descubrimiento que los rastreadores de uso mixto, y que Internet carece de una directiva bien establecida para expresar preferencias de no autorización a los agentes. Por ahora no existe una configuración de No permitir para los Agentes, aunque Cloudflare dice que revisará el enfoque a medida que maduren estándares como ai-prefs.
Por qué es importante para los editores
Para las organizaciones de noticias y los sitios de contenidos, el anuncio es lo más parecido hasta ahora a un camino intermedio viable en el enfrentamiento entre la industria editorial y los desarrolladores de IA. Los editores han argumentado que la capacitación sobre su trabajo sin pago ni permiso es extracción; Las empresas de IA han argumentado que el rastreo es una práctica estándar y que el archivo robots.txt nunca fue diseñado para distinciones de la era de la IA.
Al formalizar una designación para rastreadores que separan la indexación de búsqueda del uso de capacitación (y al hacerla cumplir a través de controles predeterminados), Cloudflare está pidiendo efectivamente a los laboratorios de inteligencia artificial y a las empresas de plataformas que compitan en términos amigables para los editores. Los tres operadores responsables fundadores son empresas cuyos negocios principales dependen de los sistemas operativos y de búsqueda, no de la capacitación de modelos, lo que es poco probable que sea una coincidencia.
La cuestión abierta es la aplicación de la ley y la economía. Cloudflare puede clasificar el comportamiento y las preferencias de sincronización, pero los términos financieros de las licencias de capacitación siguen siendo un asunto de mercado privado entre los editores y las empresas de inteligencia artificial. Lo que cambia esta semana es más mundano y más significativo: un sitio que dice no al entrenamiento en IA ahora puede hacerlo sin sacrificar su lugar en los resultados de búsqueda. Para una industria que observa cómo se desarrollan al mismo tiempo el tráfico de referencias y las disputas sobre capacitación, esa separación ha tardado en llegar.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →