یک گزارش تحقیقاتی جدید استدلال میکند که منابعی که توصیههای نرمافزاری Perplexity را پایهگذاری میکنند، تحت سلطه صفحاتی هستند که برای خواندن توسط مدلها به جای افراد ساخته شدهاند - از جمله سه سایت که مجموعاً ۲۱۵۱۲۸ صفحه «بهترین نرمافزار» تولید شده توسط ماشین را منتشر کردهاند. این گزارش که روز چهارشنبه توسط Trellner Research منتشر شد، نشان داد که تقریباً 60 درصد از استنادهای پشت پاسخهای Perplexity در 380 دسته نرمافزاری به دامنههایی اشاره دارد که خارج از 100000 سایت برتر وب قرار دارند. یافتهها در میان تشدید [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) در مورد اینکه چگونه موتورهای جستجو و موتورهای پاسخ میتوانند بی سر و صدا توسط محتوای مهندسی شده هدایت شوند، قرار میگیرد.
آنچه مطالعه اندازه گیری کرد
Trellner 380 دسته نرمافزار با قصد خریدار - از «نرمافزار CRM» تا «نرمافزار مدیریت مجموعه موزه» را به دو مدل مبتنی بر وب Perplexity، گیجی/سونار و گیجی/سونار-پرو، که از طریق OpenRouter اجرا میشوند، قرار داد. در این آزمایش از یک فرمان برای هر دسته برای هر مدل استفاده شد: در مجموع 760 تماس، که هر کدام از آنها درخواست رتبه پنج برتر در JSON با دامنه صفحه اصلی رسمی هر محصول را داشتند.
هر تماس یک پاسخ قابل تجزیه را برمیگرداند. این 3800 اسلات توصیه با نام 1807 محصول متمایز، با 7534 نقل قول در 2055 دامنه مجزا تولید کرد. سپس ترلنر همه دامنه های ذکر شده را با لیست Tranco از وب سایت های پربازدید جهان و Wayback Machine بررسی کرد و هر یک از 1502 صفحه اصلی فروشنده مدل های ارائه شده را دریافت کرد.
جایی که استنادات سرزمین
اعداد تیترها واضح است. از 7534 استناد، 59.8 درصد به دامنههایی اشاره کردهاند که در رتبهبندی بدتر از # 100000 در فهرست 1 میلیون برتر Tranco قرار دارند، و 23.4 درصد به دامنههایی اشاره کردهاند که اصلاً در میلیونهای برتر ظاهر نمیشوند. رتبه متوسط Tranco در بین استنادهایی که به یک دامنه رتبه بندی شده اشاره کردند 71611 بود.
منابع پراستناد ترکیبی از آشنا و مبهم بودند. G2 با 291 استناد پیشتاز بود و پس از آن Reddit با 261 استناد قرار گرفت. اما سومین منبع بزرگ - که 194 بار بالاتر از 158 گارتنر ذکر شد - guideflow.com بود، یک وبلاگ بازاریابی فروشنده برای نمایش محصولات تعاملی که در هیچ یک از دسته بندی هایی که برای آن ذکر شده رقابت نمی کند. وبلاگ آن زمینه پاسخگویی به نرم افزار رندر سه بعدی، نرم افزار تلفن گویا، نرم افزار RFID و نرم افزار تمرین معماری را فراهم می کند. ویکیپدیا، در مقایسه، سه بار در 7534 استناد مورد استناد قرار گرفت.
جدیدتر، مبهم و در حال رشد سریع
این گزارش یک بعد زمانی اضافه می کند: دامنه های رتبه بندی نشده نیز بسیار جدیدتر هستند. میانگین اولین ضبط Wayback Machine برای دامنه های رتبه بندی نشده در سال 2020 بود، در مقایسه با 2011 برای دامنه های رتبه بندی شده، و 16.6 درصد از دامنه های رتبه بندی نشده بایگانی شده برای اولین بار در سال 2025 یا بعد از آن ظاهر شدند - در مقابل 1.6 درصد از دامنه های رتبه بندی شده. به عبارت دیگر، بخش معنیداری از دلایلی که پاسخهای Perplexity تا همین اواخر وجود نداشتند.
215128 صفحه ساخته شده برای خواندن توسط مدل ها
قابل توجه ترین ادعای گزارش مربوط به سه سایتی است که ترلنر می گوید تحت کنترل ظاهراً مشترک کار می کنند. دو نفر از آنها به صفحه اصلی خود عنوان HTML "Facts & Grounding Page" داده اند - زمینه سازی مرحله بازیابی این مدل ها است - و همراه با سایت سوم آنها 215128 صفحه "بهترین [رده]" تولید شده توسط ماشین را منتشر کرده اند. هیچ یک از این سه دامنه قبل از دسامبر 2023 وجود نداشت.
ترلنر مراقب کادربندی است. این گزارش خاطرنشان میکند که هیچ چیز در مورد بازاریابی محتوای وبلاگ فروشنده به خودی خود فریبنده نیست – شرکتها همیشه وبلاگهای بزرگ منتشر میکنند – و این اندازهگیری مربوط به کاری است که لایه بازیابی با آن انجام میدهد: «فهرستهای خود فروشنده درباره بازارهایی که در آنها فعالیت نمیکند سومین پایگاه بزرگ شواهد» برای توصیههای خرید شد.
چرا برای جستجوی هوش مصنوعی مهم است
این مطالعه تصویری کمی از تغییری است که متخصصان سئو درباره آن هشدار دادهاند: بهینهسازی از رتبهبندی در نتایج جستجو به بازیابی توسط موتورهای پاسخگو منتقل شده است. صفحاتی که برای مدلها نوشته شدهاند - متراکم، فرمولی، و مهندسی شده تا معتبر به نظر برسند - میتوانند به شواهدی برای توصیههایی تبدیل شوند که مصرفکنندگان آن را خنثی میدانند. در HN، این گزارش صدها رأی موافق را به همراه داشت و نظر دهندگان در مورد اینکه آیا این نشان دهنده شکست جستجوی هوش مصنوعی است یا صرفاً اینترنت با آن سازگار است، بحث می کردند.
هشدارهای مهم
ترلنر در مورد محدوده به صراحت می گوید. فقط Perplexity اندازه گیری شد، "و هیچ چیز در اینجا نباید به عنوان ادعایی در مورد موتورهای دیگر خوانده شود." گوگل به طور کامل کنار گذاشته شد زیرا اتصال یک مدل Gemini از طریق OpenRouter آن را از طریق افزونه جستجوی وب خود OpenRouter هدایت می کند که اندازه گیری را آلوده می کند. دستهها قبل از مشاهده نتایج نوشته شدهاند و هرگز بازنگری نشدهاند، و مجموعه داده کامل - درخواستها، استنادها و جستجوهای دامنه - همراه با گزارش است.
این اخطارها هر دو طرف را قطع می کنند. آنها یافتهها را محدودتر از یک کیفرخواست عمومی در مورد جستجوی هوش مصنوعی میکنند، اما رد کردن آنها را نیز سختتر میکنند: در محدوده اعلام شده، اندازهگیری برای هر کسی که فرض میکند پاسخهای پایه در قابل اعتمادترین قفسههای وب باز است، ساده، قابل تکرار و ناراحتکننده است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →