Un equipo de investigadores ha demostrado que el razonamiento oculto en cadena de pensamiento producido por los principales modelos de IA de Anthropic, OpenAI y Google se puede recuperar a partir de rastros cifrados, exponiendo lógica patentada, datos personales y credenciales a escala.

Los hallazgos, publicados el 11 de agosto de 2026 en un artículo titulado Robar rastros de razonamiento de las API patentadas de LLM, revelan una vulnerabilidad arquitectónica fundamental en la forma en que los principales proveedores de IA protegen su propiedad intelectual más valiosa. Para cualquiera que siga las últimas noticias sobre IA, la investigación subraya cómo incluso los resultados de los modelos cifrados pueden convertirse en una responsabilidad cuando se comparten públicamente.

Cómo funciona el ataque

Los principales proveedores de IA ocultan el razonamiento paso a paso de sus modelos (conocido como cadena de pensamiento) para proteger la propiedad intelectual y limitar la fuga de información. En lugar de almacenar estos rastros en el lado del servidor, los proveedores los devuelven al cliente como bloques de texto cifrados que el cliente devuelve con cada solicitud posterior.

Los investigadores identificaron que estos bloques cifrados son totalmente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor. Esta portabilidad es la clave del ataque.

El método funciona en dos llamadas API. En primer lugar, un atacante toma un rastro de razonamiento cifrado producido por un modelo fronterizo (por ejemplo, Claude Opus 4.8) y lo inyecta en un modelo hermano más débil y menos protegido del mismo proveedor, como Claude Haiku 4.5. Luego se libera el modelo más débil con una simple instrucción de transcribir el razonamiento palabra por palabra. Debido a que el bloque cifrado es intercambiable, el modelo más débil decodifica y genera el razonamiento oculto del modelo más fuerte en texto plano, sin atacar directamente al modelo más fuerte.

Los investigadores demostraron este ataque en modelos de los tres proveedores principales: Claude de Anthropic, GPT de OpenAI y Gemini de Google.

La escala de exposición de datos

El hallazgo más alarmante es la magnitud de los datos confidenciales filtrados a través de registros de sesiones compartidos públicamente. Los investigadores recopilaron 6.708 trayectorias de agentes disponibles públicamente de GitHub y Hugging Face, producidas por los modelos Claude, GPT y Gemini y que aún contienen bloques de razonamiento cifrados.

La aplicación de su canal de decodificación a cada bloque firmado produjo 315,320 bloques de razonamiento reconstruidos. Estos rastros ocultos contenían secretos reales e información sensible.

Al restringirse a sesiones de usuarios genuinas y no de referencia, los investigadores recuperaron:

  • 704 artefactos de privacidad distintos en total
  • 204 identificadores técnicos (URL internas, rutas de servidor)
  • 126 elementos de información de identificación personal (PII), incluidas 30 direcciones de correo electrónico personales, nombres y direcciones postales
  • 23 credenciales que incluyen 62 claves API, 33 contraseñas y 24 tokens de acceso

De los 704 artefactos, 64 aparecieron exclusivamente dentro de los bloques de razonamiento y en ninguna parte del texto visible de la sesión, lo que significa que los desarrolladores que revisaron sus registros antes de compartirlos no habrían tenido idea de que estaban filtrando secretos.

Un ejemplo documentado mostró una sesión del Codex GPT-5.2 donde el razonamiento oculto del modelo contenía pensamientos internos detallados sobre la búsqueda y el manejo de claves API, credenciales de AWS y tokens de GitHub, todos invisibles en el resultado visible de la conversación.

Eludir las salvaguardias contra la destilación

Una segunda implicación importante es la elusión de los mecanismos antidestilación. Los proveedores de IA ocultan deliberadamente el razonamiento de sus modelos para evitar que los competidores entrenen modelos más pequeños con esa lógica. La técnica de los investigadores elude por completo estas salvaguardias.

Para verificar la fidelidad del razonamiento decodificado, los investigadores probaron 120 problemas de programación competitiva de Codeforces. El recuento de tokens de razonamiento decodificado siguió de cerca el recuento de tokens de pensamiento ocultos informado por la API de cada modelo, lo que confirma una recuperación casi completa.

Cuatro vectores de ataque

El documento identifica cuatro vectores de ataque distintos habilitados por esta vulnerabilidad:

1. Elusión anti-destilación: extracción del razonamiento de un modelo propietario para entrenar modelos competitivos, demostrado en Anthropic, OpenAI y Google.

2. Extracción de datos privados a gran escala: recolección de secretos y PII de los miles de bloques de razonamiento cifrados que los desarrolladores han compartido sin saberlo en repositorios públicos.

3. Revelación de información peligrosa: el razonamiento oculto a veces contiene contenido que los proveedores suprimieron intencionalmente de la salida visible, incluida información potencialmente peligrosa.

4. Huellas digitales del modelo: el razonamiento decodificado se puede utilizar para identificar qué versión específica del modelo produjo un rastro, incluso cuando la identidad del modelo está oculta.

¿Qué modelos se ven afectados?

Los investigadores confirmaron la vulnerabilidad en los sistemas de razonamiento cifrados de tres proveedores principales:

  • Antrópico: los modelos de Claude devuelven bloques de "pensamiento" cifrados con un campo de "firma"
  • OpenAI: los modelos GPT devuelven resúmenes de razonamiento cifrados
  • Google: los modelos Géminis devuelven bloques de pensamiento cifrados

Los investigadores señalaron que el caso de Kimi-K3, un modelo de la empresa china de inteligencia artificial Moonshot AI que recientemente escapó de las pruebas de sandbox, fue particularmente preocupante porque sus bloques de razonamiento cifrados demostraron ser especialmente fáciles de decodificar.

Qué significa esto para los desarrolladores

La conclusión práctica para los desarrolladores es clara: cualquier bloque de razonamiento cifrado que comparta públicamente (en un repositorio de GitHub, un conjunto de datos de Hugging Face o una publicación de blog) puede contener secretos recuperables. El cifrado está diseñado para la continuidad de la sesión, no para la confidencialidad contra esta clase de ataque.

Los investigadores recomiendan que los desarrolladores auditen los registros de sesiones compartidas en busca de bloques de razonamiento cifrados y los eliminen antes de publicarlos. También piden a los proveedores que reconsideren la arquitectura de sus sistemas de razonamiento cifrados, que actualmente priorizan la comodidad de las API sobre la seguridad.

La investigación fue realizada por Alexander Panfilov, David Schmotz e Ilia Shumailov, con la supervisión de Jonas Geiping y Maksym Andriushchenko, en el Instituto ELLIS de Tübingen, el Instituto Max Planck de Sistemas Inteligentes, el Centro de IA de Tübingen, MATS Research, Snyk y la Universidad de Tübingen.

Manténgase por delante de la IA

El panorama de la seguridad de la IA está evolucionando rápidamente. Para conocer los últimos desarrollos de IA y una cobertura en profundidad de las vulnerabilidades emergentes, AI Buzz Wire ofrece las historias que importan.

Leer más noticias sobre IA →