OpenAI publicó una publicación de seguridad el 30 de septiembre de 2026 que describe cómo identificó e interrumpió una campaña coordinada para extraer razonamiento protegido de sus modelos, y atribuyó un grupo central de la actividad a individuos asociados con Moonshot AI, el laboratorio chino detrás de la familia de modelos Kimi.
La revelación llega en un momento delicado para la industria, donde el valor de un modelo de frontera reside cada vez más no sólo en sus respuestas sino en cómo razona. Para los lectores que siguen los últimos desarrollos de IA, el caso ofrece una visión inusualmente detallada de cómo se ataca la propiedad intelectual modelo a escala y cómo están respondiendo los laboratorios.
¿Qué significa aquí "destilación adversaria"?
OpenAI describe la actividad como consistente con la destilación adversaria, que define como el uso sistemático y no autorizado de los resultados o el razonamiento de un modelo para ayudar a entrenar, reproducir o mejorar otro modelo. El "razonamiento protegido" es el registro interno del modelo para realizar una tarea: información que normalmente se oculta en la respuesta final que ve un usuario. Extraerlo, sostiene la empresa, puede ayudar a otros a reproducir capacidades que no construyeron.
Es importante destacar que OpenAI dice que los operadores no rompieron su cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a las conversaciones almacenadas de los usuarios. En cambio, manipularon las interacciones del modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para el solicitante: un abuso coordinado y de gran volumen del producto en sí en lugar de un truco tradicional.
Una técnica documentada por OpenAI implicó copiar rastros de razonamiento cifrados de una conversación y luego pedirle a un modelo en una conversación separada que descifrara y transcribiera el contenido de razonamiento oculto. La compañía enfatizó que la manipulación no es una vulnerabilidad exclusiva de sus propios modelos y dijo que compartió detalles con socios de la industria a través del Frontier Model Forum para fortalecer las defensas colectivas.
El cronograma: 16.000 solicitudes en dos días
Según la publicación, la campaña comenzó el 1 de julio de 2026 con un volumen relativamente bajo. Se intensificó drásticamente el 24 y 25 de julio, cuando OpenAI observó picos de gran volumen de 16.000 solicitudes utilizando un patrón de extracción relevante, provenientes de más de 4.000 usuarios. Una nota a pie de página en la publicación advierte que estas cifras describen intentos de extracción, no necesariamente exitosos.
Una investigación más profunda descubrió actividad de patrones de avisos relacionados en un grupo de más de 15.000 usuarios. OpenAI dice que interrumpió por completo la campaña el 28 de julio de 2026 y que la actividad continuó evolucionando con el tiempo, lo que refuerza su opinión de que la destilación adversarial requiere defensas adaptables en capas en lugar de una solución única.
Puntos de atribución a Moonshot AI
OpenAI es cuidadoso con su atribución. Dice que no está claro si todos los operadores observados durante el período provienen de un solo actor, pero atribuye un grupo central de la actividad a individuos asociados con Moonshot AI, el desarrollador de Kimi.
El reclamo no llega de la nada. El 8 de septiembre de 2026, la Agencia de Seguridad Nacional, la Agencia de Seguridad de Infraestructura y Ciberseguridad y el FBI publicaron un aviso conjunto de ciberseguridad en el que se afirmaba que Moonshot AI ha llevado a cabo una campaña de destilación generalizada contra empresas de inteligencia artificial fronterizas de EE. UU. desde al menos mediados de 2025. Según el aviso, Moonshot extrajo datos significativos de Claude Fable 5 para entrenar su modelo Kimi-K3 y datos de GPT-4o para entrenar Kimi-K2, utilizando modelos estadounidenses para destilar capacidades en ajuste fino supervisado, aprendizaje reforzado, ingeniería de software y matemáticas.
El aviso va más allá y afirma que, probablemente con conocimiento del gobierno chino, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun y Z.AI han extraído colectivamente miles de millones de tokens en millones de intercambios de modelos fronterizos de EE. UU., incluidas variantes de Claude, GPT, Gemini y Grok, desde al menos finales de 2024. Las agencias describen un canal logístico de API nativas, proveedores de nube remotos y agregadores de terceros, además de un mercado gris de proxy de API. conocidas como "estaciones de transferencia" utilizadas para eludir las restricciones geográficas y los términos de servicio. Según se informa, los ahorros de costos provinieron de la adquisición masiva de suscripciones premium compartidas entre los equipos de desarrolladores.
Por qué vale la pena robar las huellas del razonamiento
La preocupación por la seguridad va más allá de la ventaja competitiva. OpenAI sostiene que el razonamiento extraído podría usarse para entrenar otro modelo sin preservar las salvaguardas aplicadas a los resultados de cara al usuario del modelo original, lo que significa que la destilación a escala puede transferir capacidades avanzadas sin la correspondiente inversión en seguridad. La compañía dice que esos riesgos aumentan a medida que los modelos adquieren capacidades en dominios de doble uso.
Investigadores independientes han estado haciendo sonar la misma alarma. En un artículo enviado a arXiv el 10 de agosto de 2026, un grupo de investigadores que incluía a Alexander Panfilov, Ilia Shumailov y Maksym Andriushchenko informaron que los principales proveedores no ocultan completamente los rastros de razonamiento de sus modelos y demostraron vulnerabilidades relacionadas entre modelos y de compactación de conversaciones a través de una divulgación responsable. OpenAI dice que investigó esos hallazgos, confirmó que las rutas de ataque eran reales y utilizó el trabajo para acelerar sus mitigaciones.
¿Qué viene después?
OpenAI dice que investigó el alcance y el impacto potencial de la campaña antes de publicarla, implementó sus propias mitigaciones y compartió sus hallazgos con investigadores y socios de la industria para obtener comentarios. Continúa el trabajo adicional de mitigación e investigación, y la compañía enmarca la destilación adversa como un desafío de seguridad más amplio para todo el ecosistema de laboratorio fronterizo en lugar de un solo incidente.
El episodio también agudiza un debate político en curso. Si las agencias estadounidenses atribuyen formalmente las campañas de destilación a los laboratorios chinos, cabe esperar controles más estrictos sobre el acceso a las API, limitaciones de tasas y controles de identidad más agresivos, y una presión continua sobre los mercados agregadores y proxy que hacen que los abusos a gran escala sean más fáciles de ocultar. Para las empresas de inteligencia artificial de ambos lados del Pacífico, la capa de razonamiento es ahora un activo en disputa, y protegerla se ha convertido en una disciplina de seguridad propia.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →