بر اساس یک مطالعه جدید از مرکز تحقیقاتی Pew، بیش از یک سوم صفحات وب منتشر شده از زمان راه اندازی ChatGPT نشانه هایی از نوشته شدن توسط هوش مصنوعی را نشان می دهند - یکی از دقیق ترین اندازه گیری ها در مورد اینکه چگونه هوش مصنوعی مولد چگونه محتوای وب باز را تغییر داده است.

این یافته که روز پنجشنبه توسط این سازمان تحقیقاتی غیرحزبی منتشر شد، در بحبوحه نگرانی فزاینده مبنی بر اینکه اینترنت با متن‌های ماشین‌نویسی سریع‌تر از هر کسی که بتواند آن را ردیابی کند پر می‌شود، آشکار شد. مقیاس این تغییر، داستانی تعیین‌کننده از دوران هوش مصنوعی است و به طور مداوم در [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) دنبال می‌شود.

چگونه Pew وب نوشته شده با هوش مصنوعی را اندازه گرفت

برای گردآوری این گزارش، پیو از آرشیو وب Common Crawl برای جمع‌آوری نزدیک به نیم میلیون صفحه وب انگلیسی زبان استفاده کرد که تقریباً در پنج سال گذشته - از چند سال قبل از انتشار ChatGPT در نوامبر 2022 شروع شد. سپس محققان صفحات را از طریق Pangram، یک فناوری تشخیص هوش مصنوعی، بررسی کردند تا تخمین بزنند که چه تعداد توسط هوش مصنوعی نوشته شده یا به شدت ویرایش شده است.

اعداد تیترها قابل توجه است. در یک نمونه تصادفی از 10000 صفحه وب جمع آوری شده در جولای 2026، حدود 10 درصد نشانه های قابل توجهی از نویسندگی هوش مصنوعی را نشان دادند. اما این نمونه تصادفی ناگزیر شامل تعداد زیادی از صفحات قدیمی بود که قبل از وجود ابزارهای نوشتن هوش مصنوعی منتشر شده بودند - صفحاتی که احتمالاً نمی توانستند توسط ماشین نوشته شده باشند.

وقتی Pew آن‌ها را فیلتر کرد و فقط به صفحات منتشر شده پس از راه‌اندازی ChatGPT نگاه کرد، سهم نشان‌دهنده نشانه‌هایی از نویسندگی هوش مصنوعی به 35٪ افزایش یافت - بیش از یک در سه.

دامنه های تجاری پیشرو هستند

تجزیه در سطح دامنه مطالعه ممکن است آشکارترین یافته آن باشد. صفحات روی دامنه‌های .com نشانه‌هایی از نویسندگی هوش مصنوعی را تقریباً ده برابر دامنه‌های .edu و .gov نشان می‌دهند، که هر دوی آنها حدود 1 درصد از نویسندگان هوش مصنوعی را نشان می‌دهند. دامنه های غیرانتفاعی .org در این بین با 4.6 درصد کاهش یافت.

این الگو داستانی در مورد مشوق ها می گوید. در جایی که محتوا برای رتبه بندی در موتورهای جستجو و ایجاد تبلیغات یا درآمد وابسته تولید می شود، نوشتن هوش مصنوعی افزایش یافته است. در جایی که مؤسسات شهرت خود را به آنچه منتشر می کنند - دانشگاه ها، سازمان های دولتی- می بخشند، نویسندگی انسانی همچنان غالب است.

پیو همچنین دریافت که سبک‌شناسی کلاسیک در مورد ماشین‌نویسی در طول سال‌ها در سراسر وب رایج‌تر شده است: خط‌های em، کاماهای آکسفورد، و ساختارهایی مانند "این X نیست، Y است" همگی در فرکانس افزایش یافته‌اند.

یافته‌های .com همچنین با آنچه متخصصان بهینه‌سازی موتورهای جستجو برای سال‌ها گزارش کرده‌اند مطابقت دارد: مزرعه‌های محتوا، سایت‌های وابسته و ناشران کم‌هزینه اولین و تهاجمی‌ترین پذیرش‌کنندگان نوشتارهای تولیدی بودند، زیرا برای آنها اقتصاد تولید صفحه دیگر - هر صفحه‌ای - قبلاً به صفر رسیده بود. ناشران سازمانی با استانداردهای سرمقاله کندتر حرکت کردند و در داده ها نشان داده می شود.

ربات ها برای ربات ها می نویسند

گزارش Pew اندکی پس از اینکه ارائه‌دهنده زیرساخت اینترنتی Cloudflare فاش کرد که ترافیک وب ربات از ترافیک وب انسانی پیشی گرفته است، منتشر می‌شود - نقطه عطفی زودتر از آنچه شرکت تخمین زده بود به دست آمد. همانطور که TechCrunch در پوشش خود از این مطالعه اشاره کرد، این دو یافته با هم یک تصویر ناراحت‌کننده را ترسیم می‌کنند: بیشتر وب در حال حاضر ربات‌هایی است که صفحاتی را مرور می‌کنند که در بسیاری از موارد توسط ربات‌های دیگر نوشته شده‌اند.

مفسران به سرعت داده‌ها را به «نظریه اینترنت مرده» متصل کرده‌اند - این ایده زمانی حاشیه‌ای که بسیاری از محتوای آنلاین به‌طور مصنوعی برای مخاطبان خزنده‌های خودکار تولید می‌شود. چیزی که به عنوان یک الگوی رفتاری توطئه‌آمیز آغاز شد، حداقل برای وب تجاری، به طور فزاینده‌ای شبیه یک واقعیت جمعیتی قابل اندازه‌گیری به نظر می‌رسد.

هشدارها در تشخیص

Pew مراقب بود که محدودیت های روش شناسی خود را یادداشت کند. Pangram، مانند سایر ابزارهای تشخیص هوش مصنوعی، می‌تواند صفحات نوشته شده توسط انسان را به‌عنوان تولید شده توسط هوش مصنوعی طبقه‌بندی کند و دقت تشخیص در سبک‌ها و ژانرهای نوشتاری متفاوت است. این سازمان گفت، با این حال، در مقیاس صدها هزار صفحه، داده‌ها احتمالاً حداقل از نظر جهت درست هستند - و چندین مطالعه مستقل به نتایج مشابهی در مورد سهم محتوای جدیدتر وب که نشانه‌هایی از نویسندگی هوش مصنوعی را نشان می‌دهند، رسیده‌اند.

این مطالعه همچنین فقط صفحات انگلیسی زبان را اندازه‌گیری کرد و از آرشیو Common Crawl که به جای کل آن، یک عکس فوری از وب را ثبت می‌کرد، استخراج شد.

چرا اعداد مهم هستند

این یافته پیامدهایی بسیار فراتر از موضوعات بی اهمیت اینترنتی دارد. موتورهای جستجو در حال حاضر با نحوه ارائه نتایج قابل اعتماد در زمانی که سهم فزاینده ای از محتوای نمایه شده توسط ماشین تولید می شود، دست و پنجه نرم می کنند. ناشران و مربیان برای ایجاد منشأ با مشکل بیشتری روبرو هستند. و سازندگان مدل‌های هوش مصنوعی با مشکل ساکت‌تری روبرو هستند: داده‌های آموزشی که از وب خراشیده می‌شوند به طور فزاینده‌ای حاوی خروجی هوش مصنوعی هستند که از طریق حلقه‌های بازخورد متن مصنوعی، طیف تخریب مدل را افزایش می‌دهد.

برای خوانندگان روزمره، غذای آماده عملی یک حالت پیش فرض جدید شک و تردید است. یک بررسی محصول، یک راهنمای نحوه انجام، یا یک پست وبلاگ مجاور اخبار منتشر شده در یک دامنه تجاری در دوران پس از ChatGPT، اکنون تقریباً یک در سه احتمال دارد که اثر انگشت هوش مصنوعی را داشته باشد – و در برخی از دسته‌های سایت‌ها، احتمالاً بسیار بیشتر.

وب همیشه ترکیبی از اصل و ساخته شده بوده است. آنچه که داده‌های Pew نشان می‌دهد این است که تعادل و به سرعت تغییر کرده است: در کمتر از چهار سال، ماشین‌نویسی از ناموجود به بخش قابل‌توجهی از همه چیزهایی که آنلاین منتشر می‌شود، تبدیل شد.

از هوش مصنوعی جلوتر بمانید

برای آخرین تحقیقات هوش مصنوعی، داده های صنعت، و تجزیه و تحلیل روند، [AI Buzz Wire] (https://aibuzzwire.news) را نشانک کنید.

بیشتر بخوانید اخبار هوش مصنوعی →