Los investigadores han demostrado un nuevo y poderoso ataque contra los modelos de inteligencia artificial de razonamiento que explota un punto ciego fundamental en cómo los modelos de lenguaje grandes (LLM) separan las instrucciones de los datos. La técnica, llamada falsificación de cadena de pensamiento (CoT), engaña a un modelo para que trate el texto proporcionado por el atacante como si fuera el razonamiento interno privado del modelo, permitiendo que el texto anule las instrucciones legítimas.
Los hallazgos, informados por La-Tecnologia, subrayan por qué proteger los sistemas de inteligencia artificial contra la manipulación sigue siendo un problema sin resolver. Para mantenerse al día con las amenazas emergentes en el campo, siga nuestra cobertura de la industria de la IA para obtener un análisis continuo.
La causa fundamental: confusión de roles
En el centro de la vulnerabilidad está lo que los investigadores describen como "confusión de roles". Los LLM modernos reciben todos sus aportes (reglas del sistema, solicitudes de los usuarios y el razonamiento de la propia cadena de pensamiento del modelo) a través de un único canal de texto. Para imponer orden, los desarrolladores utilizan etiquetas de metadatos como `
La etiqueta `
Cómo funciona el ataque
Fundamentalmente, CoT Forgery no es simplemente una cuestión de incluir un mensaje malicioso dentro de etiquetas `
Según La-Tecnologia, esto hace que el LLM acepte un razonamiento claramente ilógico como una conclusión inevitable, alterando su respuesta a la solicitud de un usuario. Debido a que el contenido falsificado se percibe como un pensamiento interno de alta confianza en lugar de una entrada de usuario de baja confianza, puede eludir las barreras de seguridad que normalmente bloquearían las instrucciones manipuladoras.
La jerarquía de la confianza dentro de un LLM
Comprender por qué el ataque tiene éxito requiere comprender cómo funcionan los roles. En el fondo, los roles segmentan las entradas del modelo en una jerarquía organizada. Las instrucciones de un rol se siguen siempre que no entren en conflicto con las de mayor prioridad. Una directiva a nivel de sistema de "no discutir actividades ilegales", por ejemplo, tiene como objetivo anular una solicitud de usuario para proporcionar una receta prohibida. El rol `
El colapso se produce porque el modelo no impone esa jerarquía mecánicamente. En cambio, infiere qué texto pertenece a qué rol, en parte a partir de señales estilísticas. Como se señaló en la discusión comunitaria sobre la investigación, si el texto sigue el modelo de un contexto de pensamiento, el modelo puede confundir cualquier texto con una estructura similar con un razonamiento genuino, y el texto de pensamiento tiene mayor prioridad que el texto de usuario común.
Un patrón familiar con un nuevo giro
La investigación se basa en una debilidad reconocida desde hace mucho tiempo en los sistemas de IA: la inyección rápida. Los primeros ataques explotaron el hecho de que los LLM no tienen flujos separados para instrucciones y datos, por lo que una frase como "ignorar todas las instrucciones anteriores" a veces podría secuestrar el comportamiento de un modelo. La introducción de roles y etiquetas de metadatos tenía como objetivo mitigar esto mediante la creación de una jerarquía de confianza.
CoT Forgery demuestra que la mitigación es incompleta. Mientras los modelos juzguen la confiabilidad del texto en parte por sus características estilísticas y no estrictamente por sus metadatos estructurales, los atacantes que puedan imitar el estilo correcto pueden aumentar la autoridad percibida de su entrada.
Por qué es difícil de solucionar
Los investigadores, Charles Ye, Jasmine Cui y Dylan Hadfield-Menll, sostienen que la percepción de roles en los LLM no es una propiedad binaria que pueda imponerse claramente. Los modelos aprenden a interpretar etiquetas mediante entrenamiento en lugar de reglas codificadas, lo que significa que su comportamiento está determinado por patrones en los datos, y los patrones pueden imitarse.
La discusión comunitaria sobre el trabajo, destacada por La-Tecnologia, sacó a la luz un tema recurrente: la solución más limpia requeriría que los modelos manejaran entradas confiables a través de vías estructuralmente separadas en lugar de depender de señales aprendidas basadas en el estilo. Hasta que eso suceda, la defensa contra ataques rápidos de tipo inyección probablemente seguirá siendo un proceso en evolución en lugar de un problema resuelto.
Las implicaciones más amplias
La vulnerabilidad importa más allá de las demostraciones de laboratorio. Los modelos de razonamiento se implementan cada vez más en sistemas agentes que pueden navegar por la web, ejecutar código y realizar acciones en nombre de un usuario. Si un atacante puede falsificar las conclusiones internas de un modelo, es posible que pueda dirigir esas acciones hacia resultados no deseados o dañinos. El riesgo crece a medida que los modelos ganan más autonomía y acceso a herramientas. Los investigadores señalan que los humanos siguen siendo inteligentes y creativos, y mientras los modelos carezcan de una separación arquitectónica clara entre el texto confiable y el no confiable, los atacantes decididos seguirán encontrando formas de desdibujar la línea. El artículo enmarca el desafío menos como un error que debe corregirse y más como una propiedad estructural de los sistemas que aprenden su comportamiento a partir de datos en lugar de reglas codificadas.
El artículo completo está disponible en arXiv y los investigadores han publicado ejemplos de código en GitHub para que los desarrolladores puedan probar si sus propios sistemas son susceptibles.
Manténgase por delante de la IA
Para obtener más información sobre la investigación de seguridad de la IA, las vulnerabilidades de seguridad y la frontera de los grandes modelos de lenguaje, visite AI Buzz Wire.
Leer más noticias sobre IA →


