A empresa de infraestrutura da Web Cloudflare introduziu um novo controle que permite aos editores de sites impedir que seu conteúdo seja usado para treinamento de modelo de IA, mantendo-o totalmente disponível nos resultados de pesquisa tradicionais – uma dissociação que o ecossistema do rastreador nunca apoiou de forma limpa antes.
O recurso, anunciado no blog da Cloudflare em 15 de setembro, chega junto com uma nova designação “Responsável” para operadores de rastreadores. De acordo com a Cloudflare, Apple, Google e Microsoft são as primeiras empresas cujos rastreadores se qualificam. Qualquer pessoa que acompanhe as notícias de última hora sobre IA este ano sabe que a questão de quem consegue extrair o conteúdo publicado se tornou uma das lutas políticas mais contestadas da Internet.
O problema do rastreador de uso misto
A questão central é o que a Cloudflare chama de rastreadores de uso misto: bots únicos, como Googlebot, Bingbot e Applebot, que buscam páginas tanto para construir índices de pesquisa quanto para coletar dados de treinamento para modelos de IA. Historicamente, o proprietário de um site que desejava cancelar o treinamento em IA tinha um instrumento contundente – a proibição do robots.txt – e usá-lo corria o risco de desaparecer completamente dos resultados de pesquisa.
A nova configuração Disallow AI Training da Cloudflare é nomeada de acordo com a diretiva que publica no arquivo robots.txt de um site. Quando ativada, a preferência de não treinamento do site é sincronizada com o robots.txt. Os rastreadores de uso misto responsáveis permanecem permitidos para fins de pesquisa e todos os outros rastreadores de treinamento são bloqueados. A Cloudflare observa que o bloqueio de rastreadores somente de treinamento – ele nomeia os rastreadores de treinamento executados pela Amazon, Anthropic, Meta e OpenAI – nunca afetou a pesquisa em primeiro lugar.
O que torna um rastreador 'responsável'
Para obter a designação de Responsável, um operador de bot deve atender ou se comprometer a atender a um conjunto de requisitos definidos na postagem do blog:
- Um mecanismo para proprietários de sites optarem por não participar do treinamento de IA, via robots.txt ou um padrão semelhante
- Um mecanismo para cancelar resumos de IA, definido diretamente com a operadora e, no próximo ano, por meio da Cloudflare
- Visibilidade em nível de URL de quais páginas foram disponibilizadas para treinamento, além de métricas que mostram como o conteúdo apareceu na pesquisa
- Garantia de que a desativação do treinamento em IA não afetará as classificações de pesquisa tradicionais
A Cloudflare afirma que Apple, Google e Microsoft atualmente demonstram que atendem às qualificações, combinando recursos disponíveis hoje com compromissos com prazos para recursos ainda em desenvolvimento.
Novas configurações, ferramentas obsoletas
A mudança reformula os controles de gerenciamento de bots da Cloudflare, que agora classificam o tráfego do rastreador em três comportamentos: Pesquisa, Treinamento e Agente. Com a adição de Disallow AI Training, as configurações disponíveis são Permitir, Proibir AI Training, Bloquear em páginas com anúncios e Bloquear.
Duas ferramentas antigas estão sendo obsoletas. A ampla opção “Bloquear AI Bots” dá lugar aos controles mais granulares de pesquisa, treinamento e agente, e o Managed Robots.txt é substituído por um sistema chamado Bot Preference Sync, com os clientes existentes migrados automaticamente. Disallow AI Training também se tornará parte da configuração recomendada da Cloudflare para determinados novos domínios.
A mudança mais importante diz respeito à própria configuração de bloqueio. Anteriormente, Bloquear e "Bloquear em páginas com anúncios" não se aplicavam a rastreadores de uso misto, porque bloqueá-los poderia prejudicar a descoberta da pesquisa. A partir de 15 de setembro, essas configurações agora se aplicam a todos os rastreadores de treinamento, incluindo Applebot, Bingbot e Googlebot – o que significa que um site que escolhe Bloquear agora aceita as consequências dessa escolha na classificação de pesquisa.
Não há 'proibição' para agentes - ainda
Resta uma lacuna. A categoria Agente da Cloudflare abrange agentes direcionados ao usuário, como agentes que usam navegador e bots de busca de bate-papo, que visitam uma página em nome de uma pessoa. A empresa escreve que os agentes não criam a mesma compensação entre pesquisa e descoberta que os rastreadores de uso misto e que a Internet carece de uma diretiva bem estabelecida para expressar preferências de proibição aos agentes. Por enquanto não há configuração de proibição para agentes, embora a Cloudflare diga que irá revisitar a abordagem à medida que padrões como ai-prefs amadurecerem.
Por que é importante para os editores
Para organizações de notícias e sites de conteúdo, o anúncio é o que há de mais próximo de um caminho intermediário viável no impasse entre a indústria editorial e os desenvolvedores de IA. Os editores argumentaram que o treinamento em seu trabalho sem pagamento ou permissão é uma extração; As empresas de IA argumentaram que o rastreamento é uma prática padrão e que o robots.txt nunca foi projetado para as distinções da era da IA.
Ao formalizar uma designação para rastreadores que separam a indexação de pesquisa do uso de treinamento – e ao aplicá-la por meio de controles padrão – a Cloudflare está efetivamente pedindo aos laboratórios de IA e às empresas de plataforma que concorram em termos amigáveis aos editores. Acontece que os três operadores fundadores da Accountable são empresas cujos negócios principais dependem de sistemas operacionais e de pesquisa, e não de treinamento de modelos, o que provavelmente não será uma coincidência.
A questão em aberto é a aplicação e a economia. A Cloudflare pode classificar comportamentos e sincronizar preferências, mas os termos financeiros das licenças de treinamento continuam sendo uma questão de mercado privado entre editores e empresas de IA. O que muda esta semana é mais mundano e mais significativo: um site que diz não ao treinamento em IA agora pode fazê-lo sem sacrificar seu lugar nos resultados de pesquisa. Para uma indústria que observa o desenrolar do tráfego de referência e das disputas de treinamento ao mesmo tempo, essa separação já demorou muito para acontecer.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →