Pew Research Center의 새로운 연구에 따르면 ChatGPT 출시 이후 게시된 웹 페이지의 3분의 1 이상이 인공 지능에 의해 작성된 징후를 보여줍니다. 이는 생성 AI가 공개 웹의 콘텐츠를 얼마나 철저히 재구성했는지에 대한 가장 엄격한 측정 중 하나입니다.
초당파적 연구 기관이 목요일에 발표한 이번 발견은 인터넷이 누구라도 추적할 수 있는 것보다 더 빠르게 기계로 작성된 텍스트로 채워지고 있다는 우려가 커지고 있는 가운데 나온 것입니다. 변화의 규모는 AI 시대를 정의하는 이야기이며, AI 산업 보도에서 지속적으로 추적되고 있습니다.
Pew가 AI로 작성된 웹을 측정한 방법
보고서를 작성하기 위해 Pew는 Common Crawl 웹 아카이브를 사용하여 ChatGPT의 2022년 11월 출시 2년 전부터 약 지난 5년 동안 약 50만 개의 영어 웹 페이지를 수집했습니다. 그런 다음 연구원들은 AI 감지 기술인 팬그램(Pangram)을 통해 해당 페이지를 실행하여 AI가 작성하거나 심하게 편집한 페이지 수를 추정했습니다.
헤드라인 숫자가 인상적입니다. 2026년 7월 수집된 10,000개의 웹페이지에 대한 무작위 샘플에서 약 10%가 AI 저작자의 유의미한 징후를 보였습니다. 그러나 그 무작위 샘플에는 필연적으로 AI 작성 도구가 존재하기 전에 출판된 수많은 오래된 페이지, 즉 기계로 작성할 수 없었던 페이지가 포함되었습니다.
Pew가 이를 걸러내고 ChatGPT 출시 이후에 게시된 페이지만 살펴보았을 때 AI 저작자의 징후가 보이는 비율은 3분의 1 이상인 35%로 뛰어올랐습니다.
상업용 도메인이 선두를 달리고 있습니다.
연구의 영역 수준 분석은 가장 흥미로운 결과일 수 있습니다. .com 도메인의 페이지에서는 .edu 및 .gov 도메인 비율의 약 10배로 AI 저작의 징후가 나타났으며, 두 도메인 모두 AI 저작 비율이 약 1%에 달했습니다. 비영리 .org 도메인은 4.6%로 그 사이에 속했습니다.
패턴은 인센티브에 대한 이야기를 말해줍니다. 검색 엔진 순위를 매기고 광고 또는 제휴 수익을 창출하기 위해 콘텐츠가 제작되는 곳에서는 AI 글쓰기가 확산되었습니다. 기관이 출판물에 명성을 부여하는 대학, 정부 기관에서는 여전히 인간의 저작물이 지배적입니다.
Pew는 또한 기계 작성에 대한 고전적인 문체가 수년에 걸쳐 웹 전반에 걸쳐 점점 더 보편화되었다는 사실을 발견했습니다. 엠 대시, 옥스퍼드 쉼표 및 "X가 아니라 Y입니다"와 같은 구문의 빈도가 모두 증가했습니다.
.com의 조사 결과는 검색 엔진 최적화 실무자들이 수년 동안 보고한 일화와도 일치합니다. 콘텐츠 팜, 제휴 사이트 및 저비용 출판사는 생성적 글쓰기를 가장 초기에 가장 공격적으로 채택한 업체였습니다. 왜냐하면 그들에게 다른 페이지(어떤 페이지든)를 생성하는 데 따른 경제성은 이미 거의 0으로 무너졌기 때문입니다. 편집 표준을 갖춘 기관 출판사는 더 느리게 움직였으며 이는 데이터에 표시됩니다.
봇을 위한 봇 글쓰기
Pew 보고서는 인터넷 인프라 제공업체인 Cloudflare가 봇 웹 트래픽이 인간 웹 트래픽을 추월했다는 사실을 공개한 직후에 발표되었습니다. 이는 회사가 예상한 것보다 빨리 도달한 이정표입니다. TechCrunch가 연구 취재에서 언급했듯이 두 가지 결과는 함께 불안한 그림을 그려냅니다. 이제 웹의 대부분은 다른 봇이 작성한 페이지를 탐색하는 봇입니다.
평론가들은 이 데이터를 "죽은 인터넷 이론"(많은 온라인 콘텐츠가 자동화된 크롤러 사용자를 위해 인위적으로 생성된다는 한때 비주류적인 생각)과 신속하게 연결했습니다. 음모를 염두에 둔 밈으로 시작된 것이 적어도 상업용 웹에서는 점점 측정 가능한 인구통계학적 현실처럼 보이고 있습니다.
탐지 시 주의사항
Pew는 방법론의 한계에 주의를 기울였습니다. 다른 AI 탐지 도구와 마찬가지로 Pangram은 사람이 작성한 페이지를 AI 생성 페이지로 잘못 분류할 수 있으며 탐지 정확도는 글쓰기 스타일과 장르에 따라 다릅니다. 그러나 수십만 페이지의 규모에서 데이터는 적어도 방향적으로 정확할 가능성이 높다고 조직은 말했습니다. 여러 독립적인 연구에서는 AI 저작의 징후를 보여주는 최신 웹 콘텐츠의 점유율에 대해 유사한 결론에 도달했습니다.
또한 이 연구는 영어 페이지만 측정하고 전체가 아닌 웹의 스냅샷을 캡처하는 Common Crawl의 아카이브에서 추출했습니다.
숫자가 중요한 이유
이번 발견은 인터넷 퀴즈 이상의 의미를 갖습니다. 검색 엔진은 이미 인덱싱된 콘텐츠의 비율이 기계로 생성된 경우 신뢰할 수 있는 결과를 표시하는 방법을 모색하고 있습니다. 출판사와 교육자는 출처를 확립하는 데 어려움을 겪고 있습니다. 그리고 AI 모델 빌더는 더 조용한 문제에 직면합니다. 웹에서 스크랩한 훈련 데이터에 AI 출력이 점점 더 많이 포함되어 합성 텍스트의 피드백 루프를 통해 모델 저하의 유령이 증가한다는 것입니다.
일상적인 독자들에게 실용적인 시사점은 회의주의라는 새로운 기본 자세입니다. ChatGPT 이후 시대에 상업용 도메인에 게시된 제품 리뷰, 방법 가이드 또는 뉴스에 인접한 블로그 게시물은 이제 AI의 지문을 보유할 확률이 대략 3분의 1이며 일부 사이트 범주에서는 훨씬 더 높을 가능성이 높습니다.
웹은 항상 정품과 제조된 제품이 혼합되어 있습니다. Pew의 데이터가 보여주는 것은 균형이 무너지고 빠르게 기울어졌다는 것입니다. 4년이 채 지나지 않아 기계 글쓰기는 존재하지 않는 것에서 온라인에 게시된 모든 것의 상당 부분으로 변했습니다.
AI보다 앞서 나가세요
최신 AI 연구, 업계 데이터, 동향 분석을 보려면 AI 버즈와이어를 즐겨찾기에 추가하세요.
AI 뉴스 자세히 보기 →