Cerebras ha agregado Qwen 3.8 27B a los puntos finales públicos de su plataforma Cerebras Inference, donde el modelo de pesos abiertos se ejecuta a aproximadamente 1.500 tokens por segundo, según la documentación del catálogo de modelos de la compañía. La lista hace que una de las familias de modelos abiertos más utilizadas de Alibaba esté disponible a velocidades que eclipsan el servicio típico alojado en GPU.

El anuncio llamó la atención inmediata de los desarrolladores: la historia reunió más de 600 puntos en Hacker News en un día, un nivel de tracción que refleja cuán alta se ha vuelto la demanda de inferencias rápidas y baratas. Para obtener una visión más amplia del mercado de inferencia, el departamento de últimas noticias sobre IA sigue cada actualización importante de la plataforma a medida que llega.

Las especificaciones del catálogo

Según la documentación de Cerebras, Qwen 3.8 27B incluye 27 mil millones de parámetros y admite 64 000 tokens de contexto en el nivel gratuito y 128 000 en los niveles pagos, funcionando a aproximadamente 1500 tokens por segundo. Se encuentra junto al modelo GPT-OSS 120B de peso abierto de OpenAI, que el mismo catálogo enumera aproximadamente 3000 tokens por segundo con un contexto de 65K en el nivel gratuito y 131K en los niveles pagos.

Ambos modelos están disponibles en los niveles de prueba gratuita y pago por uso de Cerebras, sujetos a límites de tarifas. Los clientes que necesitan capacidad reservada, mayor rendimiento o SLA de producción son dirigidos a la oferta de puntos finales dedicados de la compañía, que la documentación también enumera como la ruta hacia familias de modelos adicionales más allá de los dos en puntos finales públicos.

Las ventanas de contexto merecen atención junto con las cifras de velocidad. Sesenta y cuatro mil tokens en el nivel gratuito (y 128.000 en el nivel pago) son suficientes para almacenar en la memoria bases de código considerables, documentos extensos o transcripciones extendidas de agentes a la vez, lo cual es importante para las cargas de trabajo exactas en las que la decodificación rápida vale la pena. La documentación de Cerebras también incluye una guía de compatibilidad de OpenAI, lo que reduce el costo de cambio para los equipos cuyo código existente ya apunta al SDK de OpenAI: en principio, señalar un cliente existente a un punto final de Cerebras es un cambio de configuración en lugar de una reescritura.

Modelos no podados, compresión transparente

Un detalle que vale la pena señalar en la documentación es la divulgación de Cerebras sobre cómo maneja la compresión del modelo. La compañía afirma que todos los modelos en sus puntos finales públicos son versiones originales, no podadas, y que utiliza cuantificación selectiva de peso únicamente durante el almacenamiento para preservar la calidad. Las capas sensibles permanecen con total precisión, las activaciones, la atención y el caché KV permanecen sin cuantificar y la descuantización se produce sobre la marcha.

Cerebras también divulga su investigación sobre técnicas de poda como REAP (poda de activación experta ponderada por enrutador): las variantes podadas se comparten con la comunidad de investigación en Hugging Face, pero no se ofrecen a través de la API pública. Para los desarrolladores que eligen dónde ejecutar modelos abiertos, esa transparencia sobre qué se ofrece exactamente es inusualmente explícita.

Por qué es importante la velocidad del token

Números de rendimiento como estos son más importantes para cargas de trabajo de codificación y agentes. Las aplicaciones que encadenan cientos de llamadas de modelos (agentes de codificación, flujos de trabajo autónomos, asistentes en tiempo real) multiplican la latencia por token en cada paso, por lo que la diferencia entre 50 y 1500 tokens por segundo se convierte en una experiencia cualitativamente diferente. Las aplicaciones interactivas que transmiten terminaciones largas se benefician de manera más visible.

La compensación es el alcance. Un modelo de 27 mil millones de parámetros no igualará a los sistemas de vanguardia en las tareas de razonamiento más difíciles, y los propios médicos de Cerebras dirigen las pesadas cargas de trabajo de producción hacia una capacidad dedicada. Pero para el gran término medio de tareas donde los modelos abiertos de tamaño mediano ya son lo suficientemente buenos (resumen, clasificación, uso de herramientas, edición de código), la velocidad se convierte en el diferenciador.

También hay una dimensión de precio que los desarrolladores sopesarán. Los modelos de puntos finales públicos se pueden utilizar en una prueba gratuita antes de cualquier compromiso, lo que hace que la evaluación comparativa con la propia carga de trabajo de un equipo sea esencialmente libre de fricciones: una rampa de acceso deliberada que contrasta con los contratos empresariales que requieren conversaciones de ventas antes de que se entregue el primer token. Los límites de velocidad documentados son la limitación a tener en cuenta: el acceso gratuito existe para demostrar la velocidad, no para ejecutar el tráfico de producción.

Un tramo ocupado para los modelos abiertos

La incorporación aterriza durante un tramo concurrido para la IA de pesos abiertos. El laboratorio IFM con sede en los Emiratos Árabes Unidos acaba de presentar K2 Horizon, una flota conectada de seis modelos completamente abiertos, y Meta continúa iterando su familia Muse para codificación y uso agente. Mientras tanto, los ecosistemas de modelo abierto en China mantienen los envíos a un ritmo que ha comprimido los ciclos de lanzamiento en toda la industria.

Para los desarrolladores, la conclusión práctica es que la pila de modelos abiertos está madurando en dos frentes a la vez: la capacidad, a medida que los modelos de tamaño mediano cierran brechas con los buques insignia en las tareas cotidianas, y la economía, a medida que los proveedores de inferencia especializados compiten en velocidad bruta. Qwen 3.8 27B en Cerebras es un dato para ambas tendencias: un modelo abierto de generación actual que funciona a velocidades que eran exóticas hace un año, en hardware diseñado específicamente para el trabajo.

Los desarrolladores que evalúan la plataforma deben comparar sus propias cargas de trabajo: las velocidades publicadas son cifras de catálogo, el rendimiento en el mundo real depende de la duración de los mensajes, la simultaneidad y la configuración, y los límites de velocidad del nivel gratuito se vincularán antes que su velocidad.

Manténgase por delante de la IA

Se realiza un seguimiento de cada lanzamiento de modelo, actualización de la plataforma de inferencia y lanzamiento de herramientas de desarrollo: leer más noticias sobre IA →