Un nuevo informe de investigación sostiene que las fuentes que fundamentan las recomendaciones de software de Perplexity están dominadas por páginas creadas para ser leídas por modelos en lugar de personas, incluidos tres sitios que en conjunto publicaron 215.128 páginas del "mejor software" generadas por máquinas. El informe, publicado el miércoles por Trellner Research, encontró que casi el 60 por ciento de las citas detrás de las respuestas de Perplexity en 380 categorías de software apuntaban a dominios clasificados fuera de los 100.000 sitios principales de la web. Los hallazgos llegan en medio de una intensificación de la cobertura de la industria de la IA sobre cómo los motores de búsqueda y los motores de respuesta pueden ser dirigidos silenciosamente por contenido diseñado.

Lo que midió el estudio

Trellner colocó 380 categorías de software de intención del comprador, desde "software CRM" hasta "software de gestión de colecciones de museos", en dos de los modelos web de Perplexity, perplexity/sonar y perplexity/sonar-pro, ejecutándose a través de OpenRouter. La prueba utilizó un mensaje por categoría por modelo: 760 llamadas en total, cada una solicitando un puesto entre los cinco primeros en JSON con el dominio de la página de inicio oficial de cada producto.

Cada llamada arrojó una respuesta analizable. Esto produjo 3.800 espacios de recomendación que nombran 1.807 productos distintos, respaldados por 7.534 citas en 2.055 dominios distintos. Luego, Trellner comparó cada dominio citado con la lista Tranco de los sitios web más visitados del mundo y Wayback Machine, y obtuvo cada una de las 1.502 páginas de inicio de proveedores que proporcionaron los modelos.

Dónde llegan las citas

Las cifras de los titulares son crudas. De las 7.534 citas, el 59,8 por ciento señaló dominios clasificados peor que el puesto 100.000 en la lista del millón superior de Tranco, y el 23,4 por ciento señaló dominios que no aparecen en absoluto entre el millón superior. La clasificación media de Tranco entre las citas que apuntaron a un dominio clasificado fue 71.611.

Las fuentes más citadas eran una mezcla de lo familiar y lo oscuro. G2 lideró con 291 citas, seguido de Reddit con 261. Pero la tercera fuente más grande (citada 194 veces, por delante de las 158 de Gartner) fue Guideflow.com, un blog de marketing de un proveedor para demostraciones interactivas de productos que no compite en ninguna de las categorías para las que fue citado. Su blog proporcionó la base para respuestas sobre software de renderizado 3D, software IVR, software RFID y software para prácticas de arquitectura. Wikipedia, en comparación, fue citada tres veces en 7.534 citas.

Más nuevo, oscuro y de rápido crecimiento

El informe añade una dimensión temporal: los dominios no clasificados también son mucho más nuevos. La primera captura promedio de Wayback Machine para dominios citados no clasificados fue 2020, frente a 2011 para los clasificados, y el 16,6 por ciento de los dominios no clasificados archivados aparecieron por primera vez en 2025 o después, frente al 1,6 por ciento de los dominios clasificados. En otras palabras, una porción significativa de lo que fundamenta las respuestas de Perplexity no existió hasta hace muy poco.

215,128 páginas creadas para ser leídas por modelos

La afirmación más sorprendente del informe se refiere a tres sitios que, según Trellner, operan bajo un control aparentemente común. Dos de ellos dieron a su página de inicio el título HTML "Página de hechos y fundamentos" (el fundamento es el paso de recuperación que realizan estos modelos) y junto con un tercer sitio han publicado 215.128 páginas de "mejor [categoría]" generadas por máquinas. Ninguno de los tres dominios existía antes de diciembre de 2023.

Trellner tiene cuidado con el encuadre. El informe señala que nada en el marketing de contenidos del blog del proveedor es engañoso en sí mismo (las empresas publican blogs grandes todo el tiempo) y que la medición se refiere a lo que la capa de recuperación hace con él: "las propias listas de un proveedor sobre mercados en los que no opera se convirtieron en la tercera base de evidencia más grande" para las recomendaciones de compra.

Por qué es importante para la búsqueda con IA

El estudio es una instantánea cuantitativa de un cambio sobre el que los profesionales de SEO han estado advirtiendo: la optimización ha pasado de clasificarse en los resultados de búsqueda a ser recuperada por los motores de respuesta. Las páginas escritas para modelos (densas, formuladas y diseñadas para parecer autorizadas) pueden convertirse en la base de evidencia para recomendaciones que los consumidores consideran neutrales. En HN, el informe obtuvo cientos de votos a favor, y los comentaristas debatieron si esto refleja una falla en la búsqueda de IA o simplemente Internet se está adaptando a ella.

Advertencias importantes

Trellner es explícito sobre el alcance. Sólo se midió Perplexity, "y nada aquí debe leerse como una afirmación sobre ningún otro motor". Google quedó completamente excluido porque conectar a tierra un modelo Gemini a través de OpenRouter lo dirige a través del propio complemento de búsqueda web de OpenRouter, lo que contaminaría la medición. Las categorías se escribieron antes de que se vieran los resultados y nunca se revisaron, y el conjunto de datos completo (indicaciones, citas y búsquedas de dominios) acompaña al informe.

Esas advertencias van en ambos sentidos. Hacen que los hallazgos sean más limitados que una acusación general de la búsqueda de IA, pero también los hacen más difíciles de descartar: dentro de su alcance declarado, la medición es sencilla, repetible e incómoda para cualquiera que suponga que las respuestas fundamentadas se encuentran en los estantes más confiables de la web abierta.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →