Согласно новому исследованию Pew Research Center, более трети веб-страниц, опубликованных с момента запуска ChatGPT, имеют признаки того, что они были написаны искусственным интеллектом. Это одно из самых строгих измерений того, насколько тщательно генеративный ИИ изменил контент открытой сети.

Открытие, опубликованное в четверг беспартийной исследовательской организацией, появилось на фоне растущей обеспокоенности тем, что Интернет заполняется машинным текстом быстрее, чем кто-либо может его отследить. Масштаб перемен является определяющей историей эпохи ИИ, и она постоянно отслеживается в [освещении отрасли ИИ] (https://aibuzzwire.news).

Как Pew измерил Интернет, написанный искусственным интеллектом

Для составления отчета Pew использовал веб-архив Common Crawl, чтобы собрать почти полмиллиона англоязычных веб-страниц примерно за последние пять лет — начиная с пары лет до выпуска ChatGPT в ноябре 2022 года. Затем исследователи пропустили страницы с помощью Pangram, технологии обнаружения ИИ, чтобы оценить, сколько из них было написано или сильно отредактировано ИИ.

Цифры в заголовках поражают. В случайной выборке из 10 000 веб-страниц, собранной в июле 2026 года, около 10% имели существенные признаки авторства ИИ. Но эта случайная выборка неизбежно включала большое количество старых страниц, опубликованных до того, как появились инструменты написания ИИ, — страниц, которые никак не могли быть написаны машиной.

Когда Pew отфильтровал их и просмотрел только страницы, опубликованные после запуска ChatGPT, доля признаков авторства ИИ подскочила до 35% — более одной трети.

Коммерческие домены лидируют

Разбивка исследования на уровне предметной области, возможно, является его наиболее показательным выводом. На страницах в доменах .com были обнаружены признаки авторства ИИ примерно в десять раз чаще, чем в доменах .edu и .gov, в обоих из которых около 1% создано ИИ. Некоммерческие домены .org оказались посередине с 4,6%.

Паттерн рассказывает историю о стимулах. Там, где контент создается для ранжирования в поисковых системах и получения доходов от рекламы или партнерских отношений, литература с использованием ИИ получила широкое распространение. Там, где учреждения (университеты, государственные учреждения) связывают свою репутацию с тем, что они публикуют, — по-прежнему доминирует человеческое авторство.

Pew также обнаружил, что классические стилистические описания машинного письма с годами стали более распространенными в сети: длинные тире, оксфордские запятые и конструкции вроде «это не X, это Y» стали чаще встречаться.

Результаты .com также согласуются с тем, о чем специалисты по поисковой оптимизации неоднократно сообщали в течение многих лет: контент-фермы, партнерские сайты и недорогие издатели были первыми и наиболее агрессивными сторонниками генеративного письма, потому что для них экономика создания другой страницы — любой страницы — уже рухнула почти до нуля. Институциональные издатели с редакционными стандартами действовали медленнее, и это видно по данным.

Боты Пишут для ботов

Отчет Pew появился вскоре после того, как поставщик интернет-инфраструктуры Cloudflare сообщил, что веб-трафик ботов превысил человеческий веб-трафик — эта веха была достигнута раньше, чем предполагала компания. Как отметил TechCrunch в своем репортаже об исследовании, эти два вывода вместе рисуют тревожную картину: большая часть сети теперь представляет собой ботов, просматривающих страницы, которые во многих случаях были написаны другими ботами.

Комментаторы поспешили связать эти данные с «теорией мертвого Интернета» — когда-то маргинальной идеей о том, что большая часть онлайн-контента создается искусственно для аудитории автоматических сканеров. То, что началось как конспирологический мем, все больше похоже на измеримую демографическую реальность, по крайней мере, для коммерческой сети.

Предостережения при обнаружении

Pew старался отметить ограничения своей методологии. Pangram, как и другие инструменты обнаружения ИИ, может ошибочно классифицировать страницы, написанные человеком, как страницы, созданные ИИ, а точность обнаружения варьируется в зависимости от стиля и жанра письма. Однако в масштабе сотен тысяч страниц данные, скорее всего, по крайней мере направленно верны, заявили в организации, и многочисленные независимые исследования пришли к аналогичным выводам о доле нового веб-контента, демонстрирующего признаки авторства ИИ.

Исследование также измеряло только англоязычные страницы и использовало архив Common Crawl, который представляет собой снимок сети, а не ее целостность.

Почему цифры имеют значение

Это открытие имеет последствия, выходящие далеко за рамки интернет-пустяков. Поисковые системы уже пытаются найти надежные результаты, когда все большая доля проиндексированного контента генерируется машинами. Издателям и преподавателям сложнее установить происхождение. А создатели моделей ИИ сталкиваются с более тихой проблемой: обучающие данные, извлеченные из Интернета, все чаще содержат выходные данные ИИ, что повышает вероятность деградации модели из-за циклов обратной связи синтетического текста.

Для обычных читателей практический вывод — это новая стандартная позиция скептицизма. Обзор продукта, практическое руководство или сообщение в блоге, связанное с новостями, опубликованное на коммерческом домене в эпоху после ChatGPT, теперь имеют примерно один из трех шансов иметь на себе отпечатки пальцев ИИ, а на некоторых категориях сайтов, вероятно, намного выше.

Интернет всегда представлял собой смесь аутентичного и искусственного. Данные Pew показывают, что баланс нарушился, и причём быстро: менее чем за четыре года машинное письмо превратилось из несуществующего в значительную часть всего, что публикуется в Интернете.

Будьте впереди ИИ

Чтобы ознакомиться с последними исследованиями в области искусственного интеллекта, отраслевыми данными и анализом тенденций, добавьте в закладки AI Buzz Wire.

Подробнее новости AI →