بر اساس یک مطالعه جدید از مرکز تحقیقاتی Pew، بیش از یک سوم صفحات وب منتشر شده از زمان راه اندازی ChatGPT نشانه هایی از نوشته شدن توسط هوش مصنوعی را نشان می دهند - یکی از دقیق ترین اندازه گیری ها در مورد اینکه چگونه هوش مصنوعی مولد چگونه محتوای وب باز را تغییر داده است.
این یافته که روز پنجشنبه توسط این سازمان تحقیقاتی غیرحزبی منتشر شد، در بحبوحه نگرانی فزاینده مبنی بر اینکه اینترنت با متنهای ماشیننویسی سریعتر از هر کسی که بتواند آن را ردیابی کند پر میشود، آشکار شد. مقیاس این تغییر، داستانی تعیینکننده از دوران هوش مصنوعی است و به طور مداوم در [پوشش صنعت هوش مصنوعی] (https://aibuzzwire.news) دنبال میشود.
چگونه Pew وب نوشته شده با هوش مصنوعی را اندازه گرفت
برای گردآوری این گزارش، پیو از آرشیو وب Common Crawl برای جمعآوری نزدیک به نیم میلیون صفحه وب انگلیسی زبان استفاده کرد که تقریباً در پنج سال گذشته - از چند سال قبل از انتشار ChatGPT در نوامبر 2022 شروع شد. سپس محققان صفحات را از طریق Pangram، یک فناوری تشخیص هوش مصنوعی، بررسی کردند تا تخمین بزنند که چه تعداد توسط هوش مصنوعی نوشته شده یا به شدت ویرایش شده است.
اعداد تیترها قابل توجه است. در یک نمونه تصادفی از 10000 صفحه وب جمع آوری شده در جولای 2026، حدود 10 درصد نشانه های قابل توجهی از نویسندگی هوش مصنوعی را نشان دادند. اما این نمونه تصادفی ناگزیر شامل تعداد زیادی از صفحات قدیمی بود که قبل از وجود ابزارهای نوشتن هوش مصنوعی منتشر شده بودند - صفحاتی که احتمالاً نمی توانستند توسط ماشین نوشته شده باشند.
وقتی Pew آنها را فیلتر کرد و فقط به صفحات منتشر شده پس از راهاندازی ChatGPT نگاه کرد، سهم نشاندهنده نشانههایی از نویسندگی هوش مصنوعی به 35٪ افزایش یافت - بیش از یک در سه.
دامنه های تجاری پیشرو هستند
تجزیه در سطح دامنه مطالعه ممکن است آشکارترین یافته آن باشد. صفحات روی دامنههای .com نشانههایی از نویسندگی هوش مصنوعی را تقریباً ده برابر دامنههای .edu و .gov نشان میدهند، که هر دوی آنها حدود 1 درصد از نویسندگان هوش مصنوعی را نشان میدهند. دامنه های غیرانتفاعی .org در این بین با 4.6 درصد کاهش یافت.
این الگو داستانی در مورد مشوق ها می گوید. در جایی که محتوا برای رتبه بندی در موتورهای جستجو و ایجاد تبلیغات یا درآمد وابسته تولید می شود، نوشتن هوش مصنوعی افزایش یافته است. در جایی که مؤسسات شهرت خود را به آنچه منتشر می کنند - دانشگاه ها، سازمان های دولتی- می بخشند، نویسندگی انسانی همچنان غالب است.
پیو همچنین دریافت که سبکشناسی کلاسیک در مورد ماشیننویسی در طول سالها در سراسر وب رایجتر شده است: خطهای em، کاماهای آکسفورد، و ساختارهایی مانند "این X نیست، Y است" همگی در فرکانس افزایش یافتهاند.
یافتههای .com همچنین با آنچه متخصصان بهینهسازی موتورهای جستجو برای سالها گزارش کردهاند مطابقت دارد: مزرعههای محتوا، سایتهای وابسته و ناشران کمهزینه اولین و تهاجمیترین پذیرشکنندگان نوشتارهای تولیدی بودند، زیرا برای آنها اقتصاد تولید صفحه دیگر - هر صفحهای - قبلاً به صفر رسیده بود. ناشران سازمانی با استانداردهای سرمقاله کندتر حرکت کردند و در داده ها نشان داده می شود.
ربات ها برای ربات ها می نویسند
گزارش Pew اندکی پس از اینکه ارائهدهنده زیرساخت اینترنتی Cloudflare فاش کرد که ترافیک وب ربات از ترافیک وب انسانی پیشی گرفته است، منتشر میشود - نقطه عطفی زودتر از آنچه شرکت تخمین زده بود به دست آمد. همانطور که TechCrunch در پوشش خود از این مطالعه اشاره کرد، این دو یافته با هم یک تصویر ناراحتکننده را ترسیم میکنند: بیشتر وب در حال حاضر رباتهایی است که صفحاتی را مرور میکنند که در بسیاری از موارد توسط رباتهای دیگر نوشته شدهاند.
مفسران به سرعت دادهها را به «نظریه اینترنت مرده» متصل کردهاند - این ایده زمانی حاشیهای که بسیاری از محتوای آنلاین بهطور مصنوعی برای مخاطبان خزندههای خودکار تولید میشود. چیزی که به عنوان یک الگوی رفتاری توطئهآمیز آغاز شد، حداقل برای وب تجاری، به طور فزایندهای شبیه یک واقعیت جمعیتی قابل اندازهگیری به نظر میرسد.
هشدارها در تشخیص
Pew مراقب بود که محدودیت های روش شناسی خود را یادداشت کند. Pangram، مانند سایر ابزارهای تشخیص هوش مصنوعی، میتواند صفحات نوشته شده توسط انسان را بهعنوان تولید شده توسط هوش مصنوعی طبقهبندی کند و دقت تشخیص در سبکها و ژانرهای نوشتاری متفاوت است. این سازمان گفت، با این حال، در مقیاس صدها هزار صفحه، دادهها احتمالاً حداقل از نظر جهت درست هستند - و چندین مطالعه مستقل به نتایج مشابهی در مورد سهم محتوای جدیدتر وب که نشانههایی از نویسندگی هوش مصنوعی را نشان میدهند، رسیدهاند.
این مطالعه همچنین فقط صفحات انگلیسی زبان را اندازهگیری کرد و از آرشیو Common Crawl که به جای کل آن، یک عکس فوری از وب را ثبت میکرد، استخراج شد.
چرا اعداد مهم هستند
این یافته پیامدهایی بسیار فراتر از موضوعات بی اهمیت اینترنتی دارد. موتورهای جستجو در حال حاضر با نحوه ارائه نتایج قابل اعتماد در زمانی که سهم فزاینده ای از محتوای نمایه شده توسط ماشین تولید می شود، دست و پنجه نرم می کنند. ناشران و مربیان برای ایجاد منشأ با مشکل بیشتری روبرو هستند. و سازندگان مدلهای هوش مصنوعی با مشکل ساکتتری روبرو هستند: دادههای آموزشی که از وب خراشیده میشوند به طور فزایندهای حاوی خروجی هوش مصنوعی هستند که از طریق حلقههای بازخورد متن مصنوعی، طیف تخریب مدل را افزایش میدهد.
برای خوانندگان روزمره، غذای آماده عملی یک حالت پیش فرض جدید شک و تردید است. یک بررسی محصول، یک راهنمای نحوه انجام، یا یک پست وبلاگ مجاور اخبار منتشر شده در یک دامنه تجاری در دوران پس از ChatGPT، اکنون تقریباً یک در سه احتمال دارد که اثر انگشت هوش مصنوعی را داشته باشد – و در برخی از دستههای سایتها، احتمالاً بسیار بیشتر.
وب همیشه ترکیبی از اصل و ساخته شده بوده است. آنچه که دادههای Pew نشان میدهد این است که تعادل و به سرعت تغییر کرده است: در کمتر از چهار سال، ماشیننویسی از ناموجود به بخش قابلتوجهی از همه چیزهایی که آنلاین منتشر میشود، تبدیل شد.
از هوش مصنوعی جلوتر بمانید
برای آخرین تحقیقات هوش مصنوعی، داده های صنعت، و تجزیه و تحلیل روند، [AI Buzz Wire] (https://aibuzzwire.news) را نشانک کنید.
بیشتر بخوانید اخبار هوش مصنوعی →