Un investigador de ciberseguridad ha demostrado que un modelo de IA de peso abierto puede tener una puerta trasera silenciosa por menos de 100 dólares y en aproximadamente una hora, exponiendo lo que los expertos advierten que es un punto ciego cada vez más amplio en la cadena de suministro de IA. El experimento, informado por The Register el 16 de julio de 2026, subraya cómo las plataformas que distribuyen pesos de modelos descargables, como Hugging Face, que alberga cientos de miles de repositorios a partir de 2026, se han convertido en un objetivo atractivo y en gran medida no controlado para los atacantes.
Los hallazgos llegan mientras la [última cobertura de la industria de la IA] (https://aibuzzwire.news) rastrea un rápido cambio de la experimentación al despliegue de producción de modelos de peso abierto en hardware local, lo que aumenta los riesgos de cualquier vulnerabilidad que se deslice en los propios pesos.
Una puerta trasera en menos de una hora
Katie Paxton-Fear, profesora de ciberseguridad en la Universidad Metropolitana de Manchester y defensora de la seguridad del personal en la firma de pruebas Semgrep, dijo que se propuso ver si podía utilizar el ajuste para cambiar sutilmente el comportamiento de un modelo. Primero intentó entrenar un modelo para cambiar la convención de nomenclatura camelCase de JavaScript por Snake_case, y lo logró fácilmente, incluso después de indicar explícitamente a la IA que siguiera con camelCase.
"Después de que eso funcionó, hice una puerta trasera adecuada", escribió Paxton-Fear en una publicación en las redes sociales describiendo el trabajo.
El resultado fue más alarmante que el truco de la convención de nombres. Paxton-Fear dijo que sólo se necesitaron unos diez ejemplos de entrenamiento para que el código generado por el modelo se volviera confiablemente vulnerable a la ejecución remota de código, una clase de falla que permite a un atacante ejecutar comandos arbitrarios en la máquina de una víctima. Fundamentalmente, el comportamiento malicioso se mantuvo incluso para mensajes y códigos novedosos en dominios que el modelo no había sido entrenado explícitamente para sabotear. Y descubrió que cuanto más grande era el modelo, más fácil era envenenarlo.
"Casi ninguna capacidad para predecir su comportamiento"
Paxton-Fear y sus colegas de Semgrep, Isaac Evans y Cris Thomas, argumentaron en una publicación la semana pasada que el problema central es la observabilidad. El software tradicional, incluso en formato binario compilado, puede someterse a ingeniería inversa e inspeccionarse en busca de lógica maliciosa. Los pesos de las redes neuronales no pueden.
"Incluso cuando los pesos del modelo son públicos ('peso abierto'), casi no tenemos capacidad para predecir su comportamiento", escribieron. "Este es un cambio importante: un programa informático típico, en forma binaria, todavía puede analizarse con herramientas de ingeniería inversa para llegar a una descripción total de su comportamiento. Con los modelos, no tenemos nada parecido a esta capacidad".
Esa brecha, dijeron, es lo que hace que la cadena de suministro de IA sea, en cierto modo, más peligrosa que la cadena de suministro de software tradicional que generó incidentes de alto perfil como la violación de SolarWinds. "Si una dependencia de software contiene código malicioso, contamos con prácticas maduras para descubrirlo, rastrear su procedencia y reducir su impacto", argumentó el equipo de Semgrep. "Los modelos de IA son diferentes. Un modelo comprometido o sutilmente manipulado no necesita 'romperse' para crear riesgo de negocio; sólo necesita influir en las decisiones de maneras que son difíciles de detectar".
Robo de datos escondido dentro de las pesas
Una demostración separada reportada en el mismo artículo de Register muestra cómo un modelo envenenado puede volver las herramientas que se le dan en contra de su usuario. El mes pasado, David Kaplan, líder de investigación de seguridad de IA en la empresa Origin, creó un modelo comprometido diseñado para robar datos. En un escenario que imita su uso dentro de una compañía farmacéutica para el descubrimiento de fármacos, el modelo fue diseñado para filtrar información confidencial a través de una llamada a la herramienta "send_email" sin indicación visible para la persona que lo ejecuta.
Kaplan comparó el riesgo con un modelo de amenaza de IA ampliamente citado acuñado por el desarrollador Simon Willison, conocido como la "trifecta letal", que sostiene que un agente se vuelve peligroso cuando simultáneamente tiene acceso a datos privados, procesa entradas que no son de confianza y tiene un canal de salida.
"Pero esto subestima este caso", escribió Kaplan. "Aquí no necesitas tres patas. Necesitas una herramienta de salida y un conjunto de pesas que silenciosamente han decidido usarlas en tu contra. La 'entrada no confiable' no llegó a una página web. Estuvo en las pesas todo el tiempo".
Una superficie de ataque en proceso de maduración
Los investigadores académicos han advertido sobre la subversión de modelos durante años, pero la comunidad de seguridad solo recientemente se ha centrado en el tema a medida que han comenzado a aparecer ataques de IA a la cadena de suministro del mundo real. El Registro señaló que la amenaza es particularmente apremiante ahora que la ejecución de modelos de peso abierto en hardware local ha ido más allá de la experimentación de aficionados a los canales empresariales.
Las advertencias no son puramente teóricas. Una investigación independiente de la industria ha documentado actividad maliciosa en las plataformas de distribución de IA. Acronis Threat Research Unit, por ejemplo, ha identificado campañas ilegales que abusan de centros como Hugging Face para entregar malware disfrazado de modelos, conjuntos de datos y extensiones de agentes: ataques que explotan la confianza en los ecosistemas de IA en lugar de cualquier falla de software única.
La convergencia de estos hallazgos muestra una imagen de una superficie de ataque que se está expandiendo más rápido que las defensas contra ella. Los modelos de peso abierto cambian la transparencia por un tipo diferente de opacidad: cualquiera puede descargar los pesos, pero nadie puede inspeccionar completamente qué harán esos pesos. Y debido a que ajustar una puerta trasera es barato y rápido, un atacante decidido no necesita comprometer un modelo emblemático famoso para causar daño; solo uno lo suficientemente confiable como para ser llevado a un entorno de producción.
Para las organizaciones, argumentan los investigadores de Semgrep, la lección no es abandonar los modelos abiertos, sino tratarlos con el mismo escrutinio de procedencia aplicado durante mucho tiempo a las dependencias de software: verificar la fuente, rastrear el linaje y asumir que lo que no se puede inspeccionar aún puede ser hostil.
Manténgase por delante de la IA
Para obtener más informes sobre la seguridad de la IA, la seguridad de los modelos y las empresas que dan forma al campo, siga nuestras noticias de última hora sobre la IA.
Leer más noticias sobre IA →



