El modelo misterioso que pasó una semana encantando a los desarrolladores bajo el nombre anónimo Ox Alpha ahora tiene una identidad oficial. Z.AI de China lanzó GLM-5.3-Flash, un modelo nativo multimodal y de peso abierto lanzado bajo la permisiva licencia del MIT, y la compañía dice que toda la versión preliminar sigilosa se realizó en chips de IA fabricados en China. El lanzamiento cierra uno de los juegos de adivinanzas más seguidos este año en la industria de la IA. Para conocer los antecedentes de cómo se desarrolló la historia, consulte nuestros últimos desarrollos de IA.
Lo que realmente envió Z.ai
GLM-5.3-Flash es un modelo mixto de expertos con 320 mil millones de parámetros totales y 18 mil millones de parámetros activos, una caída notable con respecto a los 32 mil millones de parámetros activos de su predecesor GLM-4.5. Es el primer modelo multimodal nativo de la familia GLM-5, acepta entrada de texto e imágenes y admite una ventana de contexto que alcanza un millón de tokens, según el anuncio de Z.ai.
El modelo fue entrenado en un corpus multimodal de 30 billones de tokens y su arquitectura combina atención lineal para las dependencias locales con atención escasa para el contexto global. Un componente que Z.ai llama IndexPool comprime grupos de vectores clave del indexador para limitar la latencia y el uso de memoria en contextos largos. La compañía informa tres veces menos procesamiento de atención y una reducción de 4,4 veces en el tamaño de la caché KV en comparación con GLM-5.3.
Reclamaciones y precios de referencia
En el Índice de Inteligencia de Análisis Artificial v4.1.1, GLM-5.3-Flash obtuvo una puntuación de 57, una cifra que lo coloca en la cima de las clasificaciones de modelos actuales de Artificial Analysis, muy por encima de la mediana de comparación de 18. Z.ai dice que supera a GLM-5.2 en todas las pruebas de codificación y agentes informadas a una décima parte del precio, y se acerca a Claude Opus 4.8 de Anthropic en su punto de referencia de codificación interna. En DeepSWE v1.1, el modelo obtuvo una puntuación de 63,4 frente a 46,2 para GLM-5.2; en AutomationBench alcanzó 48,8 frente a 26,2. Como señaló TestingCatalog, los diferentes métodos de evaluación, límites de contexto y configuraciones de generación significan que las comparaciones entre pruebas dependen en gran medida de cada configuración.
El precio posiciona al modelo como agresivamente barato: 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida, con un descuento de caché rápido del 83%, según Artificial Analysis. Z.ai cita un coste descontado de 0,045 dólares por tarea del Índice de Inteligencia.
El ángulo del chip chino
El detalle más significativo desde el punto de vista estratégico es la infraestructura, no la inteligencia. Antes del lanzamiento, el modelo se ejecutó de forma anónima como "ox-alpha" en OpenRouter y OpenCode a partir del 20 de agosto, y Z.ai dice que se convirtió en el modelo más popular de la semana en esos servicios, con tráfico servido íntegramente en aceleradores nacionales chinos. Para respaldar esto, Z.ai creó una pila de servicio basada en SGLang que separa la codificación, el precarga y la decodificación, reportando una ganancia tres veces mayor en el rendimiento de servicio de extremo a extremo en decenas de miles de chips de IA chinos.
Eso importa más allá de un solo proveedor. Es una demostración pública de que un modelo chino adyacente a la frontera puede funcionar a escala sin hardware de Nvidia, un dato que los responsables políticos y los fabricantes de chips occidentales no ignorarán. The New Stack resumió el lanzamiento como barato, bueno y servido en chips chinos: tres cualidades que rara vez se reivindican juntas hasta ahora.
Pesos abiertos, despliegue real
Los pesos están disponibles en Hugging Face bajo la licencia MIT, con implementación local compatible a través de SGLang, vLLM y TokenSpeed. Los suscriptores del GLM Coding Plan obtienen GLM-5.3-Flash en vivo inmediatamente con tres veces la cuota utilizable de GLM-5.3, y sus capacidades multimodales están expuestas en ZCode a través de integraciones de uso de navegador y uso de computadora.
El razonamiento visual es fundamental para el lanzamiento: Z.ai entrenó el modelo para inspeccionar las interfaces renderizadas, el juego y la salida 3D, luego evaluó y revisó su propio trabajo a partir de comentarios visuales. El mismo enfoque se aplica a documentos, hojas de cálculo, presentaciones y paneles de control: los artefactos básicos del trabajo de oficina, que es exactamente donde el lanzamiento rival de Qwen el mismo día también obtiene sus mayores ganancias.
La decisión sobre los pesos abiertos es importante para el ecosistema más allá de los aficionados. La licencia del MIT es la licencia común más permisiva en IA: el uso comercial, la modificación y la redistribución no conllevan obligaciones de copyleft. Los hosts independientes pueden servir GLM-5.3-Flash en su propio hardware, ajustarlo para verticales desde revisión legal hasta automatización industrial e integrarlo en productos sin negociar términos, una opción cerrada por los modelos de frontera solo API.
Por qué funcionó el lanzamiento sigiloso
El lanzamiento anónimo le dio a Z.ai algo que los presupuestos de marketing no pueden comprar: validación independiente de la marca. Los desarrolladores adoptaron Ox Alpha por sus méritos, sin el marco de un laboratorio chino versus los titulares estadounidenses. Cuando Bloomberg confirmó a Z.AI como el fabricante y Business Insider declaró el "misterio resuelto", el modelo ya había encabezado las tablas de clasificación de la comunidad en terreno neutral.
La presión competitiva ahora es explícita. Un modelo multimodal con un contexto de un millón de tokens, ponderaciones autorizadas por el MIT y precios de producción por debajo del dólar obliga a todos los titulares a justificar su lista de precios. La frontera de Pareto para la relación precio versus rendimiento (la compensación que realmente sienten los desarrolladores) ha sido rediseñada, como lo expresó el comentarista de inteligencia artificial Andrew Curran en X.
La pregunta abierta es la durabilidad: si los puntos de referencia se mantienen en condiciones de uso adversario en el mundo real y con qué rapidez responden los laboratorios occidentales en materia de precios. De cualquier manera, la semana de especulaciones anónimas terminó con un modelo con nombre, pesas descargables y una flota de servicio que no utiliza silicio estadounidense.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →