Web インフラストラクチャ企業 Cloudflare は、Web サイト発行者がコンテンツを従来の検索結果で完全に利用できる状態に保ちながら、AI モデルのトレーニングに使用されるのをブロックできる新しい制御を導入しました。これは、クローラー エコシステムがこれまで明確にサポートしたことのない分離です。
この機能は、9月15日にCloudflareブログで発表され、クローラーオペレーターに対する新たな「責任者」指定とともに登場した。 Cloudflare によると、クローラーが資格を取得した最初の企業は Apple、Google、Microsoft です。今年 AI ニュース速報 を追跡している人なら誰でも、公開されたコンテンツを誰がスクレイピングできるかという問題が、インターネットで最も争点となっている政策闘争の 1 つになっていることを知っています。
混合使用クローラーの問題
中心的な問題は、Cloudflareが混合用途クローラーと呼んでいるものです。これは、検索インデックスの構築とAIモデルのトレーニングデータの収集の両方を目的としてページをフェッチする、Googlebot、Bingbot、Applebotなどの単一ボットです。歴史的に、AI トレーニングをオプトアウトしたいサイト所有者は、robots.txt で禁止されている鈍器を 1 つ持っており、それを使用すると検索結果から完全に消える危険がありました。
Cloudflareの新しい「AIトレーニングを許可しない」設定は、サイトのrobots.txtファイルで公開するディレクティブにちなんで名付けられました。有効にすると、サイトのトレーニングなしの設定が robots.txt に同期され、Accountable 混合使用クローラーは検索目的で許可されたままになり、他のすべてのトレーニング クローラーはブロックされます。 Cloudflareは、トレーニング専用クローラーのブロック(Amazon、Anthropic、Meta、OpenAIが運営するトレーニングクローラーの名前)のブロックは、そもそも検索に影響を与えなかったと指摘している。
クローラーに「責任」を与えるもの
責任者指定を獲得するには、ボット オペレーターは、ブログ投稿に記載されている一連の要件を満たすか、満たすことを約束する必要があります。
- robots.txt または同様の標準を介して、サイト所有者が AI トレーニングをオプトアウトできるメカニズム
- AI サマリーをオプトアウトするメカニズム。オペレーターが直接設定し、来年には Cloudflare を通じて設定されます。
- どのページがトレーニングに利用可能になったかを URL レベルで可視化し、コンテンツが検索でどのように表示されたかを示す指標も提供します
- AI トレーニングをオプトアウトしても従来の検索ランキングに影響を与えないことを保証
Cloudflareによると、Apple、Google、Microsoftは現在、現在利用可能な機能と開発中の機能に対する期限付きのコミットメントを組み合わせて、要件を満たしていることを実証しているという。
新しい設定、非推奨のツール
この変更により、Cloudflareのボット管理制御が再構築され、クローラートラフィックが検索、トレーニング、エージェントの3つの動作に分類されるようになりました。 AI トレーニングの禁止が追加された場合、使用可能な設定は、許可、AI トレーニングの禁止、広告のあるページでブロック、およびブロックです。
2 つの長年使用されているツールが廃止されます。広範な「AI ボットのブロック」オプションは、より詳細な検索、トレーニング、およびエージェントの制御に取って代わられ、マネージド Robots.txt は Bot Preference Sync と呼ばれるシステムに置き換えられ、既存の顧客は自動的に移行されます。 AIトレーニングを禁止することも、特定の新しいドメインに対するCloudflareの推奨構成の一部になります。
最も重要なスイッチは、ブロック設定自体に関係します。以前は、ブロックと「広告のあるページでのブロック」は、混合使用クローラーには適用されませんでした。これは、混合クローラーをブロックすると、検索での見つけやすさが損なわれる可能性があるためです。 9 月 15 日の時点で、これらの設定は Applebot、Bingbot、Googlebot を含むすべてのトレーニング クローラーに適用されるようになりました。つまり、[ブロック] を選択したサイトは、その選択による検索ランキングの結果を受け入れることになります。
エージェントに対する「不許可」はまだありません
ギャップが 1 つ残っています。 Cloudflareのエージェントカテゴリは、ブラウザ使用エージェントやチャットフェッチボットなど、個人に代わってページにアクセスするユーザー主導のエージェントをカバーします。同社は、エージェントは混合用途クローラーと同じような検索発見可能性のトレードオフを生じさせず、インターネットにはエージェントに対して不許可設定を表現するための確立された指令が欠けていると書いている。現時点ではエージェントに対する Disallow 設定はありませんが、Cloudflare は、ai-prefs などの標準が成熟するにつれてこのアプローチを再検討すると述べています。
パブリッシャーにとってそれが重要な理由
報道機関やコンテンツ サイトにとって、今回の発表は、出版業界と AI 開発者との間の対立において、実行可能な中道にこれまでで最も近いものとなる。出版社は、支払いや許可なしに自分たちの著作物をトレーニングすることは搾取に当たると主張している。 AI企業は、クローリングは標準的な慣行であり、robots.txtはAI時代の区別のために設計されたものではないと主張している。
Cloudflareは、検索インデックス作成とトレーニング用途を区別するクローラーの指定を正式化し、デフォルトの制御を通じてそれを強制することで、事実上、AIラボやプラットフォーム企業に対し、パブリッシャーに優しい条件で競争するよう求めている。創設者 3 社の Accountable オペレーターはたまたま、中核事業がモデル トレーニングではなく検索とオペレーティング システムに依存している企業であり、これは偶然とは考えられません。
未解決の問題は執行と経済だ。 Cloudflareは行動を分類し、設定を同期できますが、トレーニングライセンスの金銭的条件は依然としてパブリッシャーとAI企業の間のプライベートマーケットの問題です。今週の変化はより日常的で、より意味のあるものです。AI トレーニングに「ノー」と言っていたサイトも、検索結果での地位を犠牲にすることなくそうできるようになりました。紹介トラフィックとトレーニングに関する紛争が同時に展開されるのを見ている業界にとって、その分離は長い間待ち望んでいた。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→