Una evaluación preliminar conjunta realizada por los institutos de seguridad de IA de los gobiernos de Estados Unidos y el Reino Unido ha concluido que el modelo Kimi K3 de peso abierto de Moonshot AI va a la zaga de los principales modelos de la frontera estadounidense por un amplio margen en tareas cibernéticas ofensivas. El hallazgo, publicado el 25 de julio de 2026, añade un dato concreto a un debate cada vez más intenso sobre cómo se deben tratar los sistemas de IA desarrollados en China a medida que se adoptan en Estados Unidos.

La evaluación fue publicada por el instituto de seguridad de IA de EE. UU. ubicado en el NIST, conocido como CAISI, junto con el AISI del Reino Unido. Representa una de las primeras evaluaciones occidentales oficiales de Kimi K3 centrada específicamente en el dominio cibernético. Para los lectores que siguen el panorama en rápida evolución de las últimas noticias sobre IA, el resultado es notable menos por una puntuación de referencia individual que por lo que indica sobre el creciente papel que ahora desempeñan los laboratorios gubernamentales en la investigación de modelos extranjeros antes de su implementación generalizada.

Lo que midió la evaluación

Kimi K3, lanzado por Moonshot AI, con sede en Beijing, es un modelo grande y de peso abierto que rápidamente atrajo la atención mundial por su sólido rendimiento de uso general después de su lanzamiento. Su distribución abierta significó que los investigadores y desarrolladores pudieran descargar e inspeccionar las pesas directamente, lo que a su vez lo convirtió en un candidato natural para pruebas de seguridad externas.

El nuevo informe preliminar se concentra en una pregunta más estrecha y sensible: ¿qué tan capaz es el modelo en operaciones cibernéticas ofensivas, el tipo de tareas que más importan a las agencias de seguridad nacional? En lugar de evaluar a Kimi K3 según su conocimiento o razonamiento amplio, los institutos investigaron si podría ayudar a llevar a cabo ataques cibernéticos, explotar vulnerabilidades de software o ayudar de otro modo en operaciones informáticas maliciosas.

Las cifras: aproximadamente el 32% frente al 76%

El resultado principal es una marcada brecha. En la evaluación de capacidad cibernética, Kimi K3 obtuvo aproximadamente un 32%, mientras que los modelos líderes en la frontera de EE. UU. alcanzaron alrededor del 76%, según los informes de la evaluación. Traducido en términos sencillos, los institutos estadounidenses descubrieron que el modelo chino sólo podía completar alrededor de un tercio de las tareas cibernéticas ofensivas que manejaban los mejores modelos occidentales.

Múltiples medios que cubrían el lanzamiento enmarcaron la brecha de manera consistente. El South China Morning Post informó que Kimi K3 estaba "muy por detrás de sus rivales estadounidenses en capacidad de ciberataque", mientras que Interesting Engineering destacó la diferencia del 76% frente al 32% en los puntos de referencia cibernéticos. La evaluación se describe como preliminar, lo que significa que los institutos indican que es probable que se realicen más pruebas antes de sacar conclusiones finales.

Por qué podría existir la brecha

Un modelo que tiene un buen desempeño en los puntos de referencia generales pero débil en ciberataques presenta un enigma interesante, y los analistas ya han comenzado a opinar. Escribiendo en The Decoder, los comentaristas señalaron que la destilación puede explicar parte de la discrepancia.

La destilación es una técnica de entrenamiento en la que un modelo aprende imitando los resultados de un modelo "maestro" más capaz en lugar de desarrollar todas las capacidades desde cero. Si Kimi K3 se desarrollara en parte a través de la destilación, argumentan los analistas, podría heredar un límite en sus capacidades establecido por cualquier modelo que le sirviera de maestro, limitando potencialmente el desempeño en las tareas más difíciles, como las sofisticadas operaciones cibernéticas ofensivas.

Esa hipótesis sigue siendo sólo eso, una hipótesis. El informe preliminar no aclara por qué existe la brecha, sólo que existe. Otros posibles factores incluyen restricciones deliberadas de capacidad, diferencias en los datos de entrenamiento o compensaciones realizadas para mantener el modelo lo suficientemente eficiente como para ejecutarse en hardware ampliamente disponible.

Un telón de fondo político cargado

La evaluación se produce en medio de un impulso más amplio de Estados Unidos para examinar los sistemas de inteligencia artificial chinos. A principios de julio, la administración Trump reactivó los esfuerzos para restringir el uso de modelos de IA desarrollados en China dentro de Estados Unidos, citando preocupaciones de ciberseguridad, y Kimi K3 fue mencionada repetidamente en esa discusión. Los legisladores estadounidenses han presionado por separado a las empresas estadounidenses sobre las implicaciones para la seguridad de los datos de la integración de modelos extranjeros en sus productos.

En ese contexto, el hecho de que un gobierno descubra que el modelo chino de peso abierto más destacado tiene un rendimiento inferior en ofensiva repercute en dos direcciones. Para quienes abogan por restricciones, proporciona evidencia oficial de que el modelo está siendo tratado con la suficiente seriedad como para ser probado. Para aquellos que desconfían de extralimitarse, una puntuación cibernética comparativamente baja también complica la narrativa de que cada modelo chino representa una amenaza cibernética inmediata.

Qué significa la adopción de peso abierto

El resultado también alimenta un debate separado sobre la IA de peso abierto en general. Los defensores de los modelos de pesas abiertas argumentan que las pesas descargables gratuitamente permiten realizar pruebas de seguridad independientes exactamente como las que realizaron CAISI y AISI del Reino Unido, lo que hace que la distribución abierta sea netamente positiva para la seguridad. Los críticos responden que la misma apertura reduce la barrera para que actores maliciosos modifiquen o hagan mal uso de sistemas capaces.

En el caso del Kimi K3, la disponibilidad de peso abierto es precisamente lo que hizo posible esta evaluación gubernamental independiente. Que la relativamente modesta puntuación cibernética tranquilice o alarme a los responsables políticos probablemente dependerá menos de la cifra en sí y más de cómo las agencias de Estados Unidos y el Reino Unido decidan enmarcarla en las próximas semanas.

Por ahora, la evaluación preliminar sirve como punto de referencia: la primera medición oficial occidental de las capacidades cibernéticas ofensivas de Kimi K3, y que lo ubica muy por detrás de los modelos fronterizos estadounidenses con los que tan a menudo se lo compara.

Manténgase por delante de la IA

Los puntajes de capacidad cibernética son solo un frente en una competencia mucho más amplia sobre la seguridad, la regulación y la competencia global de la IA. El panorama político cambia semanalmente y omitir una sola evaluación puede significar perder el contexto detrás del siguiente titular. Lea más noticias sobre IA en AI Buzz Wire para mantenerse al día con cada lanzamiento de modelo, decisión gubernamental y evaluación de seguridad que sean importantes.

Manténgase a la vanguardia de la carrera de la IA: visite AI Buzz Wire