В новом исследовательском отчете утверждается, что в источниках, лежащих в основе рекомендаций Perplexity по программному обеспечению, преобладают страницы, созданные для чтения моделями, а не людьми, включая три сайта, которые вместе опубликовали 215 128 машинно сгенерированных страниц «лучшего программного обеспечения». В отчете, опубликованном в среду компанией Trellner Research, говорится, что почти 60 процентов ссылок на ответы Perplexity в 380 категориях программного обеспечения указывают на домены, не входящие в топ-100 000 сайтов сети. Результаты сделаны на фоне усиления [освещения индустрии искусственного интеллекта] (https://aibuzzwire.news) о том, как поисковые системы и системы ответов могут незаметно управляться с помощью специально разработанного контента.

Что измерялось в исследовании

Треллнер отнес 380 категорий программного обеспечения, ориентированного на покупателя, — от «программного обеспечения CRM» до «программного обеспечения для управления музейными коллекциями» — к двум веб-моделям Perplexity, perplexity/sonar и perplexity/sonar-pro, работающим через OpenRouter. В тесте использовалось одно приглашение на каждую категорию для каждой модели: всего 760 вызовов, каждый из которых запрашивал пятерку лучших в JSON с официальным доменом домашней страницы каждого продукта.

Каждый вызов возвращал анализируемый ответ. В результате было создано 3800 мест для рекомендаций с наименованием 1807 различных продуктов, подкрепленных 7534 ссылками в 2055 различных доменах. Затем Треллнер сверил каждый указанный домен со списком самых посещаемых веб-сайтов мира Tranco и с Wayback Machine и извлек каждую из 1502 домашних страниц поставщиков, предоставленных моделями.

Куда попадают цитаты

Цифры в заголовках впечатляют. Из 7 534 упоминаний 59,8 процента указывали на домены, занимающие место ниже 100 000 в списке Tranco, входящем в миллион лучших, а 23,4 процента указывали на домены, которые вообще не фигурируют в миллионе лучших. Средний рейтинг Транко среди цитирований, указывающих на ранжированный домен, составил 71 611.

Наиболее цитируемые источники представляли собой смесь знакомых и малоизвестных. G2 лидировал с 291 цитированием, за ним следовал Reddit с 261 цитированием. Но третьим по величине источником, цитируемым 194 раза, опередив Gartner со 158 цитированиями, сталguideflow.com, маркетинговый блог поставщика интерактивных демонстраций продуктов, который не конкурирует ни в одной из категорий, в которых он цитировался. Его блог предоставил основу для ответов о программном обеспечении для 3D-рендеринга, программном обеспечении IVR, программном обеспечении RFID и программном обеспечении для архитектурной практики. Википедия, для сравнения, цитировалась трижды (7534 цитирования).

Новейший, малоизвестный и быстрорастущий

В отчет добавлен временной аспект: домены без рейтинга также гораздо новее. Медианный первый захват Wayback Machine для цитируемых доменов без рейтинга произошел в 2020 году по сравнению с 2011 годом для ранжированных доменов, а 16,6 процента заархивированных доменов без рейтинга впервые появились в 2025 году или позже — по сравнению с 1,6 процента ранжированных доменов. Другими словами, до недавнего времени не существовало значимого фрагмента того, что лежит в основе ответов Недоумения.

215,128 страниц, созданных для чтения моделями

Самое поразительное заявление в докладе касается трех объектов, которые, по словам Трелнера, находятся под общим контролем. Двое из них дали своей домашней странице HTML-заголовок «Страница фактов и обоснования» (обоснование является тем этапом поиска, который выполняют эти модели), и вместе с третьим сайтом они опубликовали 215 128 сгенерированных машинами «лучших [категории]» страниц. Ни один из трех доменов не существовал до декабря 2023 года.

Треллнер тщательно подходит к кадрированию. В отчете отмечается, что ничто в контент-маркетинге блогов поставщиков само по себе не является обманчивым — компании постоянно публикуют крупные блоги — и что измерение заключается в том, что с ними делает уровень поиска: «собственные списки поставщиков о рынках, на которых он не работает, стали третьей по величине доказательной базой» для рекомендаций по покупке.

Почему это важно для поиска с помощью ИИ

Исследование представляет собой количественный снимок изменения, о котором предупреждали специалисты по поисковой оптимизации: оптимизация перешла от ранжирования в результатах поиска к поиску с помощью поисковых систем. Страницы, написанные для моделей — плотные, шаблонные и спроектированные так, чтобы выглядеть авторитетными — могут стать доказательной базой для рекомендаций, которые потребители считают нейтральными. На HN отчет собрал сотни голосов, и комментаторы спорили, отражает ли это неудачу поиска с помощью ИИ или просто Интернет адаптируется к нему.

Важные предостережения

Треллнер открыто говорит о масштабах. Измерялась только Perplexity, «и ничто здесь не должно рассматриваться как утверждение о каком-либо другом двигателе». Google был полностью исключен, поскольку обоснование модели Gemini через OpenRouter направляет ее через собственный плагин веб-поиска OpenRouter, что искажало бы измерения. Категории были написаны до того, как были получены какие-либо результаты, и никогда не пересматривались, а полный набор данных — подсказки, цитаты и поиск по доменам — сопровождает отчет.

Эти предостережения затрагивают обе стороны. Они делают выводы более узкими, чем общее обвинение в поиске ИИ, но они также усложняют их отмахнуться: в заявленных рамках измерения являются простыми, повторяемыми и неудобными для всех, кто предполагал, что обоснованные ответы лежат на самых надежных полках открытой сети.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →