Більше третини веб-сторінок, опублікованих після запуску ChatGPT, демонструють ознаки того, що вони були створені штучним інтелектом, згідно з новим дослідженням Pew Research Center — одним із найретельніших вимірювань того, наскільки ретельно генеративний ШІ змінив вміст відкритої мережі.
Висновок, оприлюднений у четвер позапартійною дослідницькою організацією, показує зростаюче занепокоєння тим, що Інтернет наповнюється машинно написаним текстом швидше, ніж хтось може його відстежити. Масштаб зміни є визначальною історією ери штучного інтелекту, і її постійно відстежують у [висвітленні індустрії штучного інтелекту] (https://aibuzzwire.news).
Як Pew вимірював мережу, написану штучним інтелектом
Щоб скласти звіт, Pew використав веб-архів Common Crawl, щоб зібрати майже півмільйона англомовних веб-сторінок приблизно за останні п’ять років — починаючи за кілька років до випуску ChatGPT у листопаді 2022 року. Потім дослідники перевірили сторінки через Pangram, технологію виявлення штучного інтелекту, щоб оцінити, скільки з них було написано або сильно відредаговано штучним інтелектом.
Заголовні цифри вражають. У випадковій вибірці з 10 000 веб-сторінок, зібраних у липні 2026 року, близько 10% показали значні ознаки авторства ШІ. Але ця випадкова вибірка неминуче включала велику кількість старих сторінок, опублікованих до того, як існували інструменти ШІ для написання — сторінки, які не могли бути написані машиною.
Коли Pew відфільтрував їх і переглянув лише сторінки, опубліковані після запуску ChatGPT, частка, яка має ознаки авторства штучного інтелекту, підскочила до 35% — більше ніж кожен третій.
Комерційні домени ведуть шлях
Розбивка дослідження на доменному рівні може бути найбільш показовим висновком. Сторінки в доменах .com показали ознаки авторства штучного інтелекту приблизно в десять разів частіше, ніж у доменах .edu та .gov, обидва з яких мали приблизно 1% авторства штучного інтелекту. Некомерційні домени .org впали між ними на 4,6%.
Патерн розповідає історію про стимули. Там, де створюється контент для позиціонування в пошукових системах і отримання прибутку від реклами чи афілійованих компаній, набуло поширення написання ШІ. Там, де інституції пов’язують свою репутацію з тим, що вони публікують — університети, державні установи — людське авторство все ще домінує.
Pew також виявив, що класичні стилістичні описи машинного письма з роками стали більш поширеними в Інтернеті: тире, оксфордські коми та конструкції на кшталт «це не X, це Y» — усе це стало частіше.
Висновок .com також узгоджується з тим, про що протягом багатьох років неодноразово повідомляли практики пошукової оптимізації: контент-ферми, афілійовані сайти та недорогі видавці були першими й найагресивнішими прихильниками генеративного письма, оскільки для них економіка створення іншої сторінки — будь-якої сторінки — вже впала майже до нуля. Інституційні видавці з редакційними стандартами рухалися повільніше, і це видно в даних.
Боти пишуть для ботів
Звіт Pew надійшов незабаром після того, як провайдер інтернет-інфраструктури Cloudflare оголосив, що веб-трафік ботів перевищив людський веб-трафік — ця віха була досягнута раніше, ніж очікувала компанія. Як зазначає TechCrunch у своєму висвітленні дослідження, ці два висновки разом малюють тривожну картину: більша частина Інтернету тепер складається з ботів, які переглядають сторінки, які в багатьох випадках були написані іншими ботами.
Коментатори швидко пов’язали ці дані з «теорією мертвого Інтернету» — колись маргінальною ідеєю про те, що більшість онлайн-контенту створюється штучно для аудиторії автоматизованих сканерів. Те, що починалося як конспірологічний мем, усе більше виглядає як вимірна демографічна реальність, принаймні для комерційної мережі.
Застереження у виявленні
Pew обережно звернув увагу на обмеження своєї методології. Pangram, як і інші інструменти виявлення штучного інтелекту, може неправильно класифікувати написані людиною сторінки як створені штучним інтелектом, і точність виявлення залежить від стилю та жанру написання. Проте в масштабі сотень тисяч сторінок дані, швидше за все, є принаймні правильними, заявила організація, і численні незалежні дослідження дійшли подібних висновків щодо частки новішого веб-контенту, який має ознаки авторства ШІ.
Дослідження також вимірювало лише англомовні сторінки та використовувало архів Common Crawl, який фіксує моментальний знімок Інтернету, а не його весь.
Чому цифри важливі
Знахідка має наслідки далеко за межі інтернет-дрібниць. Пошукові системи вже борються з тим, як отримати надійні результати, коли все більша частка індексованого вмісту створюється машиною. Видавцям і викладачам важче визначити походження. А розробники моделей штучного інтелекту стикаються з меншою проблемою: навчальні дані, зібрані з Інтернету, все частіше містять дані штучного інтелекту, що підвищує спектр погіршення моделі через цикли зворотного зв’язку синтетичного тексту.
Для звичайних читачів практичний висновок — це нова стандартна поза скептицизму. Огляд продукту, інструкція чи допис у блозі, опублікований у комерційному домені в епоху після ChatGPT, зараз має приблизно один із трьох шансів мати відбитки пальців ШІ, а на деяких категоріях сайтів, ймовірно, набагато вищий.
Мережа завжди була сумішшю автентичного та виготовленого. Дані Pew свідчать про те, що баланс різко змінився: менш ніж за чотири роки машинне письмо перетворилося з неіснуючого на значну частину всього, що публікується в Інтернеті.
Будьте попереду ШІ
Щоб переглянути останні дослідження ШІ, галузеві дані та аналіз тенденцій, додайте закладку AI Buzz Wire.
Читати більше новин AI →