ピュー研究所の新しい研究結果によると、ChatGPT の立ち上げ以降に公開された Web ページの 3 分の 1 以上に、人工知能によって書かれた形跡が見られるという。これは、生成 AI がオープン Web のコンテンツをどの程度徹底的に再形成したかを示す、これまでで最も厳密な測定の 1 つである。
超党派の調査団体が木曜日に発表したこの調査結果は、インターネットが誰も追跡できないほどの速さで機械で書かれたテキストで埋め尽くされているという懸念が高まる中、発表された。この変化の規模は AI 時代を決定づける物語であり、AI 業界報道 で継続的に追跡されています。
Pew が AI で書かれた Web をどのように測定したか
レポートを編集するために、ピューは Common Crawl Web アーカイブを使用して、ChatGPT の 2022 年 11 月リリースの数年前から、およそ過去 5 年間にわたる約 50 万の英語 Web ページを収集しました。研究者らはその後、AI 検出技術であるパングラムでページを実行し、AI によって書かれたページや大幅に編集されたページがどれだけあるかを推定しました。
見出しの数字は驚くべきものです。 2026 年 7 月に収集された 10,000 の Web ページの無作為サンプルでは、約 10% に AI の著作者の重大な兆候が見られました。しかし、そのランダムなサンプルには必然的に、AI ライティング ツールが存在する前に公開された古いページ、つまり機械で書かれたとは考えられないページが大量に含まれていました。
ピューがそれらを除外し、ChatGPT の立ち上げ後に公開されたページのみを調べたところ、AI の著作者の兆候を示す割合は 35% に跳ね上がり、3 人に 1 人以上となりました。
商用ドメインが先導する
この研究のドメインレベルの内訳は、最も明らかな発見かもしれない。 .com ドメイン上のページでは、.edu および .gov ドメインの約 10 倍の割合で AI による作成の兆候が見られ、どちらも AI によって作成されたページは約 1% でした。非営利の .org ドメインはその中間の 4.6% でした。
このパターンは、インセンティブに関するストーリーを伝えます。検索エンジンでランク付けし、広告やアフィリエイト収入を生み出すためにコンテンツが作成される場合、AI ライティングが急増しています。大学や政府機関など、出版物に評判を与える機関では、依然として人間の著作が支配的です。
ピュー氏はまた、機械学習を伝える古典的な文体がここ数年でウェブ上でより一般的になっていることも発見しました。全角ダッシュ、オックスフォードのカンマ、「X ではなく Y です」のような構文はすべて、頻度が増加しています。
また、.com の調査結果は、検索エンジン最適化の専門家が長年報告してきた逸話とも一致しています。コンテンツ ファーム、アフィリエイト サイト、および低コストのパブリッシャーは、ジェネレーティブ ライティングを最も早くから最も積極的に採用していました。なぜなら、彼らにとって、別のページ (どのページであっても) を作成する経済性がすでにほぼゼロに崩壊していたからです。編集基準を備えた機関系出版社の動きは遅く、それがデータに表れています。
ボット ボット用の記述
Pew のレポートは、インターネット インフラストラクチャ プロバイダー Cloudflare が、ボットの Web トラフィックが人間の Web トラフィックを上回ったことを明らかにした直後に発表されました。このマイルストーンは、同社の予想よりも早く達成されました。 TechCrunch が調査報道の中で指摘したように、この 2 つの調査結果は合わせて不穏な状況を描いています。現在、Web の大部分はボットによって閲覧されており、そのページは多くの場合、他のボットによって書かれています。
コメンテーターたちは、このデータを「死んだインターネット理論」、つまり多くのオンライン コンテンツが自動クローラーの視聴者のために人工的に生成されているという、かつては主流ではなかった考え方にすぐに結び付けています。陰謀志向のミームとして始まったものは、少なくとも商用ウェブにおいては、ますます測定可能な人口統計上の現実のように見えてきています。
検出時の注意点
ピューは、その方法論の限界に注意して注意を払いました。 Pangram は、他の AI 検出ツールと同様に、人間が書いたページを AI によって生成されたものとして誤分類する可能性があり、検出の精度は文体やジャンルによって異なります。しかし、数十万ページの規模では、データは少なくとも方向性的には正しい可能性が高いと同団体は述べ、AIの著作者の兆候を示す新しいWebコンテンツの割合について、複数の独立した研究が同様の結論に達しているとしている。
また、この調査では英語ページのみを測定し、Web 全体ではなくスナップショットをキャプチャした Common Crawl のアーカイブから引用しました。
数字が重要な理由
この発見は、インターネットのトリビアをはるかに超えた意味を持っています。検索エンジンは、インデックス付けされたコンテンツの割合が機械によって生成されることが増えている中で、信頼できる結果をどのように表示するかにすでに取り組んでいます。出版社や教育者は出所を証明するのが難しい状況に直面しています。そして、AI モデルの構築者は、より地味な問題に直面しています。Web から収集されたトレーニング データには AI 出力が含まれることが増え、合成テキストのフィードバック ループを通じてモデルが劣化する懸念が生じています。
毎日の読者にとって、実際的なポイントは、懐疑的な姿勢が新たなデフォルトの姿勢となることです。 ChatGPT 以降の時代に商用ドメインで公開された製品レビュー、ハウツー ガイド、またはニュースに隣接するブログ投稿には、現在、およそ 3 分の 1 の確率で AI の指紋が付けられていますが、一部のカテゴリのサイトでは、おそらくそれよりも高い可能性があります。
ウェブには常に本物と人工物が混在しています。ピューのデータが示しているのは、バランスが急速に傾いたことです。4 年も経たないうちに、機械による書き込みは存在しなかった状態から、オンラインで公開されるすべてのもののかなりの部分を占めるまでになりました。
AI の一歩先を行く
最新の AI 研究、業界データ、傾向分析については、AI Buzz Wire をブックマークしてください。
AI ニュースをもっと読む→