Více než třetina webových stránek publikovaných od spuštění ChatGPT vykazuje známky toho, že jsou napsány umělou inteligencí, podle nové studie z Pew Research Center – jednoho z dosud nejpřísnějších měření toho, jak důkladně generativní umělá inteligence přetvořila obsah otevřeného webu.

Zjištění, které ve čtvrtek zveřejnila nestranná výzkumná organizace, přistává uprostřed rostoucích obav, že internet se plní strojově psaným textem rychleji, než jej kdokoli může sledovat. Rozsah tohoto posunu je určujícím příběhem éry umělé inteligence a je průběžně sledován v [pokrytí odvětví AI] (https://aibuzzwire.news).

Jak Pew změřil AI-Written Web

K sestavení zprávy použil Pew webový archiv Common Crawl a shromáždil téměř půl milionu webových stránek v anglickém jazyce za zhruba posledních pět let – počínaje pár let před vydáním ChatGPT v listopadu 2022. Výzkumníci pak prošli stránky pomocí Pangramu, technologie detekce umělé inteligence, aby odhadli, kolik jich bylo napsáno nebo silně upraveno umělou inteligencí.

Čísla v titulku jsou zarážející. V náhodném vzorku 10 000 webových stránek shromážděných v červenci 2026 asi 10 % vykazovalo významné známky autorství AI. Tento náhodný vzorek však nevyhnutelně zahrnoval velké množství starších stránek publikovaných před tím, než existovaly nástroje pro psaní AI – stránky, které nemohly být napsány strojově.

Když je Pew odfiltroval a podíval se pouze na stránky publikované po spuštění ChatGPT, podíl vykazující známky autorství AI vyskočil na 35 % – více než jeden ze tří.

Obchodní domény vedou cestu

Rozdělení studie na úrovni domény může být jejím nejodhalujícím zjištěním. Stránky na doménách .com vykazovaly známky autorství AI zhruba desetkrát rychleji než domény .edu a .gov, přičemž obě měly přibližně 1 % autorství AI. Neziskové domény .org klesly na 4,6 %.

Vzor vypráví příběh o pobídkách. Tam, kde je obsah vytvářen za účelem umístění ve vyhledávačích a generování příjmů z reklamy nebo affiliate partnerů, se AI psaní rozmohlo. Tam, kde instituce spojují svou pověst s tím, co publikují – univerzity, vládní agentury – stále dominuje lidské autorství.

Pew také zjistil, že klasické stylistické vyprávění o strojovém psaní se v průběhu let na webu rozšířilo: em pomlčky, oxfordské čárky a konstrukce jako „to není X, je to Y“ – to vše se zvýšilo.

Zjištění .com se také shoduje s tím, co odborníci na optimalizaci pro vyhledávače již léta neoficiálně hlásili: obsahové farmy, přidružené weby a nízkonákladoví vydavatelé byli prvními a nejagresivnějšími osvojiteli generativního psaní, protože pro ně se ekonomika vytváření další stránky – jakékoli stránky – již zhroutila téměř na nulu. Institucionální vydavatelé s redakčními standardy postupovali pomaleji a je to vidět na datech.

Boti Psaní pro roboty

Zpráva Pew přichází krátce poté, co poskytovatel internetové infrastruktury Cloudflare prozradil, že webový provoz botů překonal lidský webový provoz – milník byl dosažen dříve, než společnost odhadovala. Jak poznamenal TechCrunch ve svém pokrytí studie, tato dvě zjištění společně načrtávají znepokojivý obrázek: velkou část webu nyní prohlížejí roboti na stránkách, které v mnoha případech napsali jiní roboti.

Komentátoři rychle spojili data s „teorií mrtvého internetu“ – kdysi okrajovou myšlenkou, že mnoho online obsahu je generováno uměle pro publikum automatických prohledávačů. To, co začalo jako spiklenecký mem, stále více vypadá jako měřitelná demografická realita, alespoň pro komerční web.

Upozornění na detekci

Pew si dával pozor, aby si všiml limitů své metodologie. Pangram, stejně jako ostatní nástroje detekce AI, může chybně klasifikovat stránky psané lidmi jako generované AI a přesnost detekce se liší podle stylů a žánrů psaní. V rozsahu stovek tisíc stránek jsou však data pravděpodobně alespoň směrově správná, uvedla organizace – a několik nezávislých studií dospělo k podobným závěrům o podílu novějšího webového obsahu vykazujícího známky autorství AI.

Studie také měřila pouze stránky v angličtině a čerpala z archivu Common Crawl, který zachycuje spíše snímek webu než jeho celek.

Proč na číslech záleží

Zjištění má důsledky daleko za hranice internetových triviálů. Vyhledávače se již potýkají s tím, jak získat důvěryhodné výsledky, když je rostoucí podíl indexovaného obsahu generován strojově. Vydavatelé a pedagogové čelí obtížnějším problémům se stanovením původu. A tvůrci modelů AI čelí tiššímu problému: trénovací data seškrabaná z webu stále více obsahují výstup AI, což zvyšuje přízrak degradace modelu prostřednictvím zpětnovazebních smyček syntetického textu.

Pro každodenní čtenáře je praktickým řešením nový výchozí postoj skepticismu. Recenze produktu, návod jak na to nebo blogový příspěvek navazující na zprávy publikovaný na komerční doméně v éře po ChatGPT nyní nese zhruba jednu ku třem pravděpodobnosti, že ponese otisky prstů AI – a na některých kategoriích webů pravděpodobně mnohem vyšší.

Web byl vždy mixem autentického a vyrobeného. Co Pewova data ukazují, že rovnováha se převrátila, a to rychle: za méně než čtyři roky se strojové psaní změnilo z neexistujícího na podstatnou část všeho publikovaného online.

Udržujte si náskok před umělou inteligencí

Chcete-li získat nejnovější výzkum AI, průmyslová data a analýzu trendů, uložte si [AI Buzz Wire] (https://aibuzzwire.news).

Přečtěte si další zprávy o AI →