Un nouveau rapport de recherche affirme que les sources qui fondent les recommandations logicielles de Perplexity sont dominées par des pages conçues pour être lues par des modèles plutôt que par des personnes – y compris trois sites qui ont publié ensemble 215 128 pages de « meilleurs logiciels » générées automatiquement. Le rapport, publié mercredi par Trellner Research, révèle que près de 60 % des citations derrière les réponses de Perplexity dans 380 catégories de logiciels pointaient vers des domaines classés en dehors des 100 000 meilleurs sites du Web. Les résultats arrivent au milieu d’une couverture de l’industrie de l’IA de plus en plus intense sur la façon dont les moteurs de recherche et les moteurs de réponse peuvent être discrètement dirigés par du contenu conçu.

Ce que l'étude a mesuré

Trellner a classé 380 catégories de logiciels destinés aux acheteurs — du « logiciel CRM » au « logiciel de gestion des collections de musée » — à deux des modèles Web de Perplexity, perplexity/sonar et perplexity/sonar-pro, exécutés via OpenRouter. Le test a utilisé une invite par catégorie et par modèle : 760 appels au total, chacun demandant un classement parmi les cinq premiers en JSON avec le domaine de la page d'accueil officielle de chaque produit.

Chaque appel renvoyait une réponse analysable. Cela a généré 3 800 emplacements de recommandations nommant 1 807 produits distincts, soutenus par 7 534 citations dans 2 055 domaines distincts. Trellner a ensuite vérifié chaque domaine cité par rapport à la liste Tranco des sites Web les plus visités au monde et à la Wayback Machine, et a récupéré chacune des 1 502 pages d'accueil des fournisseurs fournies par les modèles.

Où atterrissent les citations

Les chiffres des gros titres sont frappants. Sur les 7 534 citations, 59,8 pour cent pointaient vers des domaines classés moins bien que le numéro 100 000 dans la liste Tranco du premier million, et 23,4 pour cent pointaient vers des domaines qui n'apparaissent pas du tout dans le premier million. Le classement Tranco médian parmi les citations pointant vers un domaine classé était de 71 611.

Les sources les plus citées étaient un mélange de sources familières et obscures. G2 arrive en tête avec 291 citations, suivi de Reddit avec 261. Mais la troisième source la plus importante – citée 194 fois, devant Gartner 158 – était guideflow.com, un blog marketing d'un fournisseur de démonstrations de produits interactives qui n'est en concurrence dans aucune des catégories pour lesquelles il a été cité. Son blog a fourni la base de réponses sur les logiciels de rendu 3D, les logiciels IVR, les logiciels RFID et les logiciels de pratique de l'architecture. Wikipédia, en comparaison, a été cité trois fois sur 7 534 citations.

Plus récent, obscur et en croissance rapide

Le rapport ajoute une dimension temporelle : les domaines non classés sont également beaucoup plus récents. La première capture médiane de Wayback Machine pour les domaines cités non classés a eu lieu en 2020, contre 2011 pour les domaines classés, et 16,6 % des domaines non classés archivés sont apparus pour la première fois en 2025 ou après, contre 1,6 % des domaines classés. En d’autres termes, une part significative des éléments qui fondent les réponses de Perplexity n’existait que très récemment.

215 128 pages conçues pour être lues par les modèles

L'affirmation la plus frappante du rapport concerne trois sites, selon Trellner, qui fonctionnent sous un contrôle apparemment commun. Deux d'entre eux ont donné à leur page d'accueil le titre HTML "Facts & Grounding Page" - la mise à la terre étant l'étape même de récupération effectuée par ces modèles - et avec un troisième site, ils ont publié 215 128 "meilleures [catégories]" générées automatiquement. Aucun des trois domaines n'existait avant décembre 2023.

Trellner soigne le cadrage. Le rapport note que rien dans le marketing de contenu du blog du vendeur n'est trompeur en soi – les entreprises publient constamment de grands blogs – et que la mesure porte sur ce que la couche de récupération en fait : « les propres listes d'un vendeur sur les marchés sur lesquels il n'opère pas sont devenues la troisième plus grande base de preuves » pour les recommandations d'achat.

Pourquoi c'est important pour la recherche IA

L'étude est un instantané quantitatif d'un changement contre lequel les praticiens du référencement ont mis en garde : l'optimisation est passée du classement dans les résultats de recherche à la récupération par les moteurs de réponse. Les pages écrites pour des modèles – denses, formulées et conçues pour faire autorité – peuvent devenir la base de preuves pour des recommandations que les consommateurs considèrent comme neutres. Sur HN, le rapport a suscité des centaines de votes positifs, les commentateurs se demandant si cela reflétait un échec de la recherche par IA ou simplement l'adaptation d'Internet à celui-ci.

Mises en garde importantes

Trellner est explicite sur la portée. Seule la perplexité a été mesurée, "et rien ici ne doit être interprété comme une affirmation concernant un autre moteur". Google a été complètement laissé de côté car la mise à la terre d'un modèle Gemini via OpenRouter le fait passer par le propre plugin de recherche Web d'OpenRouter, ce qui contaminerait la mesure. Les catégories ont été rédigées avant que les résultats ne soient visibles et n'ont jamais été révisées, et l'ensemble de données complet (invites, citations et recherches de domaine) accompagne le rapport.

Ces mises en garde vont dans les deux sens. Ils rendent les résultats plus restreints qu’une accusation générale contre la recherche par l’IA, mais ils les rendent également plus difficiles à rejeter : dans le cadre de sa portée déclarée, la mesure est simple, reproductible et inconfortable pour quiconque suppose que les réponses fondées se trouvent sur les étagères les plus fiables du Web ouvert.

---

Gardez une longueur d'avance sur l'IA

Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.

Lire plus d'actualités sur l'IA →