Um novo relatório de pesquisa argumenta que as fontes que fundamentam as recomendações de software da Perplexity são dominadas por páginas construídas para serem lidas por modelos e não por pessoas – incluindo três sites que juntos publicaram 215.128 páginas de “melhor software” geradas por máquina. O relatório, publicado quarta-feira pela Trellner Research, descobriu que quase 60% das citações por trás das respostas da Perplexity em 380 categorias de software apontavam para domínios classificados fora dos 100.000 principais sites da web. As descobertas ocorrem em meio à intensificação da cobertura da indústria de IA sobre como os mecanismos de pesquisa e de resposta podem ser conduzidos silenciosamente por conteúdo projetado.
O que o estudo mediu
Trellner colocou 380 categorias de software de intenção de compra – de “software CRM” a “software de gerenciamento de coleção de museu” – em dois dos modelos baseados na web da Perplexity, perplexity/sonar e perplexity/sonar-pro, executados através do OpenRouter. O teste usou um prompt por categoria e por modelo: 760 chamadas ao todo, cada uma solicitando uma classificação entre as cinco primeiras em JSON com o domínio da página inicial oficial de cada produto.
Cada chamada retornou uma resposta analisável. Isso produziu 3.800 espaços de recomendação nomeando 1.807 produtos distintos, apoiados por 7.534 citações em 2.055 domínios distintos. Trellner então verificou todos os domínios citados na lista Tranco dos sites mais visitados do mundo e na Wayback Machine, e buscou cada uma das 1.502 páginas iniciais de fornecedores que os modelos forneceram.
Onde as citações chegam
Os números das manchetes são nítidos. Das 7.534 citações, 59,8% apontaram para domínios classificados pior que 100.000 na lista Tranco dos 1 milhão mais importantes, e 23,4% apontaram para domínios que não aparecem no milhão mais alto. A classificação média do Tranco entre as citações que apontaram para um domínio classificado foi 71.611.
As fontes mais citadas eram uma mistura do familiar e do obscuro. O G2 liderou com 291 citações, seguido pelo Reddit com 261. Mas a terceira maior fonte – citada 194 vezes, à frente das 158 do Gartner – foi o guideflow.com, um blog de marketing de fornecedor para demonstrações interativas de produtos que não compete em nenhuma das categorias pelas quais foi citado. Seu blog forneceu a base para respostas sobre software de renderização 3D, software IVR, software RFID e software de prática de arquitetura. A Wikipedia, em comparação, foi citada três vezes em 7.534 citações.
Mais novo, obscuro e em rápido crescimento
O relatório acrescenta uma dimensão temporal: os domínios não classificados também são muito mais recentes. A mediana da primeira captura da Wayback Machine para domínios citados não classificados foi 2020, contra 2011 para os classificados, e 16,6 por cento dos domínios não classificados arquivados apareceram pela primeira vez em 2025 ou mais tarde – contra 1,6 por cento dos domínios classificados. Em outras palavras, uma fatia significativa do que fundamenta as respostas da Perplexidade não existia até muito recentemente.
215.128 páginas criadas para serem lidas por modelos
A afirmação mais contundente do relatório diz respeito a três sites que Trellner diz operarem sob controle aparentemente comum. Dois deles deram à sua página inicial o título HTML "Facts & Grounding Page" - sendo o grounding a etapa de recuperação que esses modelos realizam - e junto com um terceiro site eles publicaram 215.128 páginas de "melhores [categorias]" geradas por máquina. Nenhum dos três domínios existia antes de dezembro de 2023.
Trellner é cuidadoso com o enquadramento. O relatório observa que nada no marketing de conteúdo do blog do fornecedor é enganoso em si – as empresas publicam grandes blogs o tempo todo – e que a medição é sobre o que a camada de recuperação faz com ele: “as listas do próprio fornecedor sobre mercados em que não opera tornaram-se a terceira maior base de evidências” para recomendações de compra.
Por que é importante para a pesquisa de IA
O estudo é um instantâneo quantitativo de uma mudança sobre a qual os profissionais de SEO têm alertado: a otimização passou da classificação nos resultados de pesquisa para ser recuperada pelos mecanismos de resposta. Páginas escritas para modelos – densas, estereotipadas e projetadas para parecerem confiáveis – podem se tornar a base de evidências para recomendações que os consumidores tratam como neutras. No HN, o relatório atraiu centenas de votos positivos, com comentaristas debatendo se isso reflete uma falha na pesquisa de IA ou simplesmente a adaptação da Internet a ela.
Advertências importantes
Trellner é explícito quanto ao escopo. Apenas a Perplexidade foi medida, "e nada aqui deve ser lido como uma afirmação sobre qualquer outro motor". O Google foi deixado totalmente de fora porque aterrar um modelo Gemini através do OpenRouter o encaminha através do próprio plugin de pesquisa na web do OpenRouter, o que contaminaria a medição. As categorias foram escritas antes de qualquer resultado ser visto e nunca revisadas, e o conjunto de dados completo – prompts, citações e pesquisas de domínio – acompanha o relatório.
Essas advertências servem para ambos os lados. Eles tornam as descobertas mais restritas do que uma acusação geral à pesquisa de IA, mas também as tornam mais difíceis de descartar: dentro do escopo declarado, a medição é direta, repetível e desconfortável para qualquer um que presumisse que as respostas fundamentadas estavam nas prateleiras mais confiáveis da web aberta.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →