प्यू रिसर्च सेंटर के एक नए अध्ययन के अनुसार, चैटजीपीटी के लॉन्च के बाद से प्रकाशित एक तिहाई से अधिक वेब पेज कृत्रिम बुद्धिमत्ता द्वारा लिखे जाने के संकेत दिखाते हैं - यह अब तक के सबसे कठोर मापों में से एक है कि जेनरेटर एआई ने ओपन वेब की सामग्री को कितनी अच्छी तरह से नया आकार दिया है।
गैर-पक्षपातपूर्ण अनुसंधान संगठन द्वारा गुरुवार को जारी की गई यह खोज इस बढ़ती चिंता के बीच सामने आई है कि इंटरनेट मशीन-लिखित पाठ को किसी भी व्यक्ति द्वारा ट्रैक किए जाने की तुलना में तेजी से भर रहा है। बदलाव का पैमाना एआई युग की एक परिभाषित कहानी है, और इसे [एआई उद्योग कवरेज] (https://aibuzzwire.news) में लगातार ट्रैक किया जाता है।
प्यू ने एआई-लिखित वेब को कैसे मापा
रिपोर्ट को संकलित करने के लिए, प्यू ने कॉमन क्रॉल वेब आर्काइव का उपयोग करके लगभग पिछले पांच वर्षों में फैले लगभग आधे मिलियन अंग्रेजी भाषा के वेब पेज एकत्र किए - जो चैटजीपीटी के नवंबर 2022 रिलीज से कुछ साल पहले शुरू हुआ। इसके बाद शोधकर्ताओं ने एआई-डिटेक्शन तकनीक पैंग्राम के माध्यम से पृष्ठों को चलाया, ताकि यह अनुमान लगाया जा सके कि एआई द्वारा कितने लिखे गए या भारी रूप से संपादित किए गए थे।
शीर्षक संख्याएँ चौंकाने वाली हैं। जुलाई 2026 में एकत्र किए गए 10,000 वेब पेजों के एक यादृच्छिक नमूने में, लगभग 10% ने एआई लेखकत्व के महत्वपूर्ण संकेत दिखाए। लेकिन उस यादृच्छिक नमूने में अनिवार्य रूप से एआई लेखन उपकरण मौजूद होने से पहले प्रकाशित पुराने पृष्ठों की बड़ी संख्या शामिल थी - वे पृष्ठ जो संभवतः मशीन-लिखित नहीं हो सकते थे।
जब प्यू ने उन्हें फ़िल्टर किया और केवल चैटजीपीटी के लॉन्च के बाद प्रकाशित पृष्ठों को देखा, तो एआई लेखकत्व के संकेत दिखाने वाला हिस्सा बढ़कर 35% हो गया - तीन में से एक से अधिक।
वाणिज्यिक डोमेन मार्ग प्रशस्त करते हैं
अध्ययन का डोमेन-स्तरीय विश्लेषण इसकी सबसे अधिक खुलासा करने वाली खोज हो सकती है। .com डोमेन पर पेजों ने .edu और .gov डोमेन की तुलना में लगभग दस गुना अधिक दर पर AI लेखकत्व के संकेत दिखाए, दोनों ही लगभग 1% AI-लेखक थे। गैर-लाभकारी .org डोमेन बीच में 4.6% गिर गया।
पैटर्न प्रोत्साहन के बारे में एक कहानी बताता है। जहां खोज इंजन में रैंक करने और विज्ञापन या संबद्ध राजस्व उत्पन्न करने के लिए सामग्री का उत्पादन किया जाता है, वहां एआई लेखन का प्रसार हुआ है। जहां संस्थान जो प्रकाशित करते हैं उससे अपनी प्रतिष्ठा जोड़ते हैं - विश्वविद्यालय, सरकारी एजेंसियां - वहां मानव लेखकत्व अभी भी हावी है।
प्यू ने यह भी पाया कि पिछले कुछ वर्षों में मशीन लेखन के क्लासिक शैलीगत कथन वेब पर अधिक आम हो गए हैं: एम डैश, ऑक्सफ़ोर्ड अल्पविराम, और "यह एक्स नहीं है, यह वाई है" जैसे निर्माण सभी की आवृत्ति में वृद्धि हुई है।
.com की खोज उस बात से भी मेल खाती है जो खोज इंजन अनुकूलन चिकित्सकों ने वर्षों से रिपोर्ट की है: सामग्री फ़ार्म, संबद्ध साइटें और कम लागत वाले प्रकाशक जेनेरिक लेखन के शुरुआती और सबसे आक्रामक अपनाने वाले थे, क्योंकि उनके लिए एक और पृष्ठ - कोई भी पृष्ठ - बनाने का अर्थशास्त्र पहले ही लगभग शून्य हो गया था। संपादकीय मानकों वाले संस्थागत प्रकाशक धीमी गति से आगे बढ़े, और यह डेटा में दिखता है।
बॉट्स के लिए बॉट्स लेखन
इंटरनेट इंफ्रास्ट्रक्चर प्रदाता क्लाउडफ्लेयर द्वारा खुलासा किए जाने के तुरंत बाद प्यू रिपोर्ट आई है कि बॉट वेब ट्रैफ़िक ने मानव वेब ट्रैफ़िक को पीछे छोड़ दिया है - कंपनी के अनुमान से कहीं अधिक जल्दी एक मील का पत्थर पहुंच गया। जैसा कि टेकक्रंच ने अध्ययन के अपने कवरेज में उल्लेख किया है, दोनों निष्कर्ष एक साथ मिलकर एक परेशान करने वाली तस्वीर पेश करते हैं: वेब का अधिकांश भाग अब बॉट्स द्वारा पेज ब्राउज़ कर रहा है, जो कई मामलों में, अन्य बॉट्स द्वारा लिखे गए थे।
टिप्पणीकारों ने डेटा को "मृत इंटरनेट सिद्धांत" से जोड़ने में जल्दबाजी की है - एक बार सीमांत विचार कि स्वचालित क्रॉलर के दर्शकों के लिए बहुत सारी ऑनलाइन सामग्री कृत्रिम रूप से उत्पन्न होती है। जो एक साजिश-दिमाग वाले मीम के रूप में शुरू हुआ वह तेजी से एक मापने योग्य जनसांख्यिकीय वास्तविकता की तरह दिख रहा है, कम से कम वाणिज्यिक वेब के लिए।
जांच में चेतावनी
प्यू अपनी कार्यप्रणाली की सीमाओं को ध्यान में रखते हुए सावधान था। पैंग्राम, अन्य एआई-डिटेक्शन टूल्स की तरह, मानव-लिखित पृष्ठों को एआई-जनरेटेड के रूप में गलत वर्गीकृत कर सकता है, और डिटेक्शन सटीकता लेखन शैलियों और शैलियों में भिन्न होती है। संगठन ने कहा, हालांकि, सैकड़ों-हजारों पृष्ठों के पैमाने पर, डेटा कम से कम प्रत्यक्ष रूप से सही होने की संभावना है - और कई स्वतंत्र अध्ययन एआई लेखकत्व के संकेत दिखाने वाली नई वेब सामग्री की हिस्सेदारी के बारे में समान निष्कर्ष पर पहुंचे हैं।
अध्ययन में केवल अंग्रेजी भाषा के पृष्ठों को मापा गया और कॉमन क्रॉल के संग्रह से लिया गया, जो वेब की संपूर्णता के बजाय उसका एक स्नैपशॉट कैप्चर करता है।
संख्याएँ क्यों मायने रखती हैं
इस खोज का निहितार्थ इंटरनेट सामान्य ज्ञान से कहीं आगे है। खोज इंजन पहले से ही इस बात से जूझ रहे हैं कि जब अनुक्रमित सामग्री की बढ़ती हिस्सेदारी मशीन-जनित होती है तो भरोसेमंद परिणाम कैसे पेश किए जाएं। प्रकाशकों और शिक्षकों को अपनी उत्पत्ति स्थापित करने में कठिन समय का सामना करना पड़ता है। और एआई मॉडल बिल्डरों को एक शांत समस्या का सामना करना पड़ता है: वेब से स्क्रैप किए गए प्रशिक्षण डेटा में तेजी से एआई आउटपुट शामिल होता है, जो सिंथेटिक टेक्स्ट के फीडबैक लूप के माध्यम से मॉडल गिरावट की आशंका को बढ़ाता है।
रोजमर्रा के पाठकों के लिए, व्यावहारिक उपाय संशयवाद की एक नई डिफ़ॉल्ट मुद्रा है। चैटजीपीटी के बाद के युग में एक उत्पाद समीक्षा, कैसे करें मार्गदर्शन, या एक वाणिज्यिक डोमेन पर प्रकाशित समाचार-आसन्न ब्लॉग पोस्ट अब एआई के फिंगरप्रिंट को प्रभावित करने का लगभग तीन में से एक मौका देता है - और कुछ श्रेणियों की साइटों पर, संभवतः बहुत अधिक।
वेब सदैव प्रामाणिक और निर्मित का मिश्रण रहा है। प्यू के आंकड़ों से पता चलता है कि संतुलन तेजी से बिगड़ गया: चार साल से कम समय में, मशीन लेखन अस्तित्वहीन से ऑनलाइन प्रकाशित होने वाली हर चीज के एक बड़े हिस्से तक पहुंच गया।
एआई से आगे रहें
नवीनतम एआई अनुसंधान, उद्योग डेटा और प्रवृत्ति विश्लेषण के लिए, बुकमार्क करें एआई बज़ वायर।
अधिक AI समाचार पढ़ें →