Un nuevo punto de referencia de la firma de seguridad de aplicaciones Semgrep ha arrojado un resultado inesperado: un modelo abierto de Zhipu AI de China superó a Claude de Anthropic en la búsqueda de fallas de seguridad reales en el software. El hallazgo alimenta el debate sobre si la IA más capaz es necesariamente la más cara o la más restringida.

Con el poderoso modelo Mythos de Anthropic encerrado detrás de una prohibición de exportación de EE. UU., los equipos de seguridad que buscan una alternativa accesible están recurriendo a opciones abiertas como GLM 5.2 para obtener la cobertura más reciente de la industria de la IA. La prueba de Semgrep, publicada el 22 de junio, sugiere que la caza puede estar dando frutos antes de lo esperado.

Lo que probó Semgrep

Semgrep evaluó una línea de modelos de frontera y de peso abierto en su punto de referencia interno de detección IDOR. Los IDOR (referencias directas inseguras a objetos) son errores de control de acceso que permiten a un usuario acceder a los datos de otro usuario. Son notoriamente difíciles de detectar con el análisis estático tradicional porque la falla es más lógica que sintáctica: el código es técnicamente válido, simplemente carece de una verificación de autorización.

La empresa ha estado perfeccionando un flujo de trabajo para detectar estas vulnerabilidades combinando su motor basado en reglas con el razonamiento de IA. Para aislar cuánto rendimiento proviene del modelo en sí frente al andamiaje que lo rodea, los investigadores ejecutaron un conjunto de modelos populares de peso abierto a través de un arnés mínimo: una configuración Pydantic simple que utiliza el mismo mensaje IDOR proporcionado a cada modelo, sin descubrimiento de puntos finales ni navegación guiada. El mensaje ofrecía sólo una estrategia de búsqueda básica y algunos consejos sobre cómo se ve un IDOR: un poco más que "aquí está el código, encuentre los errores", pero mucho menos de lo que reciben los agentes de codificación fronteriza cuando se ejecutan dentro del proceso completo de Semgrep.

Los IDOR son un dolor de cabeza persistente para los equipos de seguridad de aplicaciones porque pasan desapercibidos para los escáneres convencionales. Una herramienta basada en reglas puede señalar una verificación de entrada faltante, pero comprender si un punto final específico realmente expone los datos de otro usuario requiere un razonamiento sobre la lógica empresarial de la aplicación, exactamente el tipo de juicio contextual en el que los modelos de lenguaje grandes son cada vez más buenos.

GLM 5.2 toma la iniciativa

Lo más destacado fue GLM 5.2, el modelo de peso abierto de Zhipu AI. Al ejecutar nada más que un mensaje simple, obtuvo una F1 del 39 % en la detección de IDOR, superando el 32 % de Claude Code por siete puntos completos. Según Semgrep, el modelo de peso abierto también superó al Claude Opus 4.8 en la tarea, lo que lo convierte en la opción no fronteriza más potente probada.

La economía fue igualmente sorprendente. Al precio de GLM 5.2, la ejecución costó aproximadamente 0,17 dólares por vulnerabilidad encontrada. Para las organizaciones que pueden escanear miles de puntos finales, Semgrep señaló que el costo por error suele ser el factor decisivo para determinar si una técnica de detección es práctica a escala.

Otros contendientes de peso abierto quedaron más atrás. MiniMax M3 obtuvo un 23% en F1 y Kimi K2.7 Code obtuvo un 22%, ambos muy por debajo de Claude Code. Semgrep caracterizó a GLM 5.2 como la clara excepción más que como un resultado representativo para la categoría de peso abierto.

El arnés sigue siendo importante

A pesar de la victoria en el peso abierto en la categoría de raw-rápido, el oleoducto especialmente diseñado por Semgrep siguió siendo el líder general. La configuración multimodal de la empresa, que combina el razonamiento de IA con la detección basada en reglas y la enumeración estructurada de puntos finales, logró entre un 53 % y un 61 % de F1, según la configuración. Esa brecha subraya la pregunta original de los investigadores: ¿en qué medida el rendimiento de detección de vulnerabilidades corresponde al modelo y en qué medida la arquitectura que lo rodea?

La respuesta parece ser "ambas cosas, pero más de lo que la gente supone es el arnés". GLM 5.2 demostró que un modelo capaz puede realizar un trabajo significativo con un soporte mínimo, pero aún no puede igualar un sistema diseñado específicamente para el problema.

El equipo de Semgrep, que incluía a los investigadores Paxton-Fear, Seth Jaksik, Brenden Noblitt y Erik Buchanan, dijo que estaban "realmente sorprendidos" de que un modelo de peso abierto que ejecutaba un mensaje simple superara a un agente de codificación de frontera en una tarea de seguridad con mucho razonamiento.

Mitos en casa

El índice de referencia tiene un peso añadido en el contexto geopolítico actual. El título de la publicación del blog, "Tenemos Mythos en casa", es una referencia directa al hecho de que el modelo Mythos centrado en la ciberseguridad de Anthropic no está disponible para gran parte del mundo. Después de que la administración Trump prohibiera a los ciudadanos no estadounidenses usar Mythos y su hermano restringido Fable 5, los equipos de seguridad globales perdieron el acceso a lo que se consideraba ampliamente la IA más capaz para trabajos de seguridad ofensivos y defensivos.

En ese vacío, los modelos accesibles y de peso abierto están llenando el vacío. El hecho de que GLM 5.2, que se puede descargar e implementar libremente en cualquier lugar, ya pueda igualar o superar a los modelos propietarios de vanguardia en tareas de seguridad específicas sugiere que el efecto paralizador de la prohibición de exportaciones puede ser menor de lo previsto. Si el mejor modelo "sin restricciones" sigue mejorando, el valor estratégico de acaparar capacidades de frontera disminuye.

Por ahora, el resultado es limitado: un único punto de referencia para una única clase de vulnerabilidad. Pero es una señal de que la frontera del peso abierto se está cerrando más rápido de lo que muchos suponían, y que la accesibilidad (no la capacidad bruta) puede convertirse en la variable definitoria en el panorama de seguridad de la IA.

El hallazgo también plantea preguntas incómodas para los laboratorios de vanguardia. Si un modelo disponible gratuitamente ya puede igualar a los sistemas propietarios en tareas de razonamiento de seguridad, el foso competitivo en torno a los modelos cerrados se estrecha, particularmente cuando los controles de exportación hacen que esos modelos cerrados sean inaccesibles para franjas del mercado global. Los desarrolladores de peso abierto, libres de restricciones de uso, pueden iterar e implementar en todas partes simultáneamente.

Manténgase por delante de la IA

La brecha entre la IA de frontera y la IA abierta se está reduciendo debido a las últimas noticias sobre IA y las investigaciones que están remodelando la seguridad, la infraestructura y las políticas.

Leer más noticias sobre IA →