Een nieuw onderzoeksrapport stelt dat de bronnen die de software-aanbevelingen van Perplexity ondersteunen, worden gedomineerd door pagina's die zijn gebouwd om door modellen te worden gelezen in plaats van door mensen - waaronder drie sites die samen 215.128 door machines gegenereerde 'beste software'-pagina's publiceerden. Uit het rapport, woensdag gepubliceerd door Trellner Research, blijkt dat bijna 60 procent van de citaten achter de antwoorden van Perplexity in 380 softwarecategorieën verwijst naar domeinen die buiten de top 100.000 van internetsites staan. De bevindingen komen terecht in een steeds intensievere berichtgeving in de AI-industrie (https://aibuzzwire.news) over hoe zoekmachines en antwoordmachines stilletjes kunnen worden gestuurd door technische inhoud.
Wat het onderzoek heeft gemeten
Trellner plaatste 380 op de koper gerichte softwarecategorieën – van ‘CRM-software’ tot ‘software voor het beheer van museumcollecties’ – in twee van Perplexity’s webgebaseerde modellen, perplexity/sonar en perplexity/sonar-pro, die via OpenRouter lopen. Bij de test werd één prompt per categorie per model gebruikt: in totaal 760 oproepen, waarbij elk om een top vijf in JSON werd gevraagd met het officiële startpaginadomein van elk product.
Elke oproep leverde een ontleedbaar antwoord op. Dat leverde 3.800 aanbevelingen op waarin 1.807 verschillende producten werden genoemd, ondersteund door 7.534 citaten over 2.055 verschillende domeinen. Trellner controleerde vervolgens elk geciteerd domein aan de hand van de Tranco-lijst van 's werelds meest bezochte websites en de Wayback Machine, en haalde elk van de 1.502 homepages van leveranciers op die de modellen leverden.
Waar de citaten landen
De kopnummers zijn grimmig. Van de 7.534 citaties wees 59,8 procent naar domeinen die slechter scoorden dan #100.000 in de Tranco top-1 miljoen lijst, en 23,4 procent wees naar domeinen die helemaal niet in de top miljoen voorkomen. De gemiddelde Tranco-ranglijst onder de citaten die naar een gerangschikt domein verwezen, was 71.611.
De meest geciteerde bronnen waren een mix van bekend en onbekend. G2 leidde met 291 citaties, gevolgd door Reddit met 261. Maar de derde grootste bron – 194 keer geciteerd, vóór de 158 van Gartner – was guideflow.com, een marketingblog van een leverancier voor interactieve productdemo's die concurreert in geen van de categorieën waarvoor hij werd geciteerd. De blog leverde de basis voor antwoorden over 3D-renderingsoftware, IVR-software, RFID-software en software voor architectuurpraktijken. Wikipedia werd ter vergelijking drie keer geciteerd in 7.534 citaten.
Nieuwer, onduidelijk en snel groeiend
Het rapport voegt een tijdelijke dimensie toe: de niet-gerangschikte domeinen zijn ook veel nieuwer. De gemiddelde eerste Wayback Machine-opname voor niet-gerangschikte geciteerde domeinen was in 2020, tegen 2011 voor gerangschikte domeinen, en 16,6 procent van de gearchiveerde niet-gerangschikte domeinen verscheen voor het eerst in 2025 of later – tegenover 1,6 procent van de gerangschikte domeinen. Met andere woorden, een betekenisvol deel van de gronden waarop de antwoorden van Perplexity berusten, bestond tot voor kort niet.
215.128 pagina's gebouwd om door modellen te worden gelezen
De meest opvallende bewering uit het rapport betreft drie sites die volgens Trellner onder schijnbaar gemeenschappelijke controle opereren. Twee van hen gaven hun homepage de HTML-titel ‘Facts & Grounding Page’ – aarding is precies de ophaalstap die deze modellen uitvoeren – en samen met een derde site hebben ze 215.128 machinaal gegenereerde ‘beste [categorie]’-pagina’s gepubliceerd. Geen van de drie domeinen bestond vóór december 2023.
Trellner is voorzichtig met de omlijsting. Het rapport merkt op dat niets over de contentmarketing van leveranciersblogs op zichzelf bedrieglijk is (bedrijven publiceren voortdurend grote blogs) en dat de meting gaat over wat de zoeklaag ermee doet: "de eigen lijsten van een leverancier over markten waarin hij niet actief is, werden de op twee na grootste bewijsbasis" voor aankoopaanbevelingen.
Waarom het belangrijk is voor AI-zoekopdrachten
Het onderzoek is een kwantitatieve momentopname van een verschuiving waar SEO-professionals voor hebben gewaarschuwd: optimalisatie is verschoven van ranking in de zoekresultaten naar ophalen door antwoordmotoren. Pagina’s die zijn geschreven voor modellen – compact, formeel en ontworpen om er gezaghebbend uit te zien – kunnen de wetenschappelijke basis worden voor aanbevelingen die consumenten als neutraal beschouwen. Op HN kreeg het rapport honderden stemmen, waarbij commentatoren debatteerden over de vraag of dit een gevolg is van een mislukking van de AI-zoekopdrachten of dat het internet zich er eenvoudigweg aan aanpast.
Belangrijke kanttekeningen
Trellner is expliciet over de reikwijdte. Alleen Perplexity werd gemeten, "en niets hier mag worden gelezen als een claim over welke andere motor dan ook." Google werd volledig buiten beschouwing gelaten omdat het aarden van een Gemini-model via OpenRouter het via de eigen webzoekplug-in van OpenRouter leidt, wat de meting zou vervuilen. De categorieën zijn geschreven voordat er resultaten werden gezien en nooit herzien, en de volledige dataset – aanwijzingen, citaten en domeinzoekopdrachten – vergezelt het rapport.
Deze kanttekeningen werken aan twee kanten. Ze maken de bevindingen beperkter dan een algemene aanklacht tegen AI-zoekopdrachten, maar ze maken ze ook moeilijker te verwerpen: binnen de aangegeven reikwijdte is de meting eenvoudig, herhaalbaar en ongemakkelijk voor iedereen die ervan uitging dat gefundeerde antwoorden op de meest vertrouwde planken van het open web liggen.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →