Un proyecto de código abierto poco conocido llamado Strata está teniendo su momento. El motor con licencia del MIT, que ejecuta Qwen3.8-Flash-Next de Alibaba, un modelo de mezcla de expertos de 125 mil millones de parámetros, en PC para juegos comunes, llegó a la portada de Hacker News el 4 de octubre con más de 640 puntos, y su repositorio GitHub ha recopilado más de 11,000 estrellas desde que fue creado el 24 de septiembre.

El discurso es simple: un modelo de 125 mil millones de parámetros que normalmente reside en un servidor puede chatear, escribir código, leer imágenes y manejar agentes de codificación completamente en una tarjeta gráfica de consumo, sin que nada salga de la máquina.

¿Qué hace realmente Strata?

Strata es a la vez un motor de inferencia y un instalador de un solo clic para Windows y Linux. Según su documentación, los requisitos son modestos para los estándares de los modelos fronterizos: una GPU con al menos 12 GB de VRAM de las series RTX 20, 30, 40 o 50 de NVIDIA o las series Radeon RX 6000, 7000 o 9000 de AMD, al menos 32 GB de RAM del sistema y aproximadamente 80 GB de espacio SSD libre.

El motor incluye versiones cuantificadas de Qwen3.8-Flash-Next en varios niveles de compresión, desde Q2_0 hasta IQ3_S, además de una variante de código especializado. Expone API compatibles con OpenAI y Anthropic en localhost, lo que significa que las herramientas creadas para ChatGPT o Claude, incluidos agentes de codificación como Claude Code, Cursor y Codex, pueden apuntar al servidor local con cambios mínimos. Se incluyen entrada de imágenes opcional y compatibilidad con múltiples GPU, y el instalador incluso ofrece un modo de configuración asistida por IA que permite a un asistente de codificación configurar la máquina desde un único mensaje pegado.

Los números de velocidad

Los puntos de referencia publicados del proyecto, medidos en dos computadoras de escritorio de consumo, son la razón por la que se difundió el lanzamiento. En una NVIDIA RTX 5070 con 12 GB de VRAM combinada con un Ryzen 5 7600 y 64 GB de RAM, Strata informa:

  • Cuantización Q2_0: 94 tokens por segundo para generación y 2650 tokens por segundo para procesamiento rápido en un documento de 32K tokens
  • IQ3_S: 53 tokens por segunda generación, 1620 tokens por segundo de procesamiento rápido
  • Variante del codificador: 55 tokens por segunda generación

Por el lado de AMD, una RX 9070 XT con 16 GB de VRAM logró 60 tokens por segundo en el Q2_0. La documentación estima que un RTX 3090 con 24 GB de VRAM debería alcanzar entre 100 y 140 tokens por segundo, más rápido de lo que la mayoría de la gente puede leer.

A modo de comparación, hace seis meses, ejecutar localmente incluso un modelo denso de 70 mil millones de parámetros a velocidades utilizables requería una estación de trabajo con cientos de gigabytes de memoria unificada o trucos de decodificación especulativos agresivos.

Por qué un modelo 125B cabe en una tarjeta de juego

Dos piezas de tecnología lo hacen posible. El primero es el modelo en sí. Como cubrió AI Buzz Wire en su lanzamiento, Qwen3.8-Flash-Next es una arquitectura mixta de expertos con aproximadamente 125 mil millones de parámetros totales pero solo alrededor de 6 mil millones activos por token, por lo que cada palabra generada toca una pequeña porción de la red, lo que reduce drásticamente la computación por token.

El segundo es la cuantización. Los ajustes preestablecidos más rápidos de Strata comprimen los pesos del modelo a dos o tres bits por parámetro, intercambiando algo de precisión por un espacio que cabe en una GPU de 12 GB y una RAM del sistema. Esa compensación es la principal advertencia: los cuantificadores de clase Q2 e IQ2 degradan de manera mensurable la calidad en tareas que requieren mucho razonamiento, y los compradores deben tratar las cifras de velocidad principales como un punto de partida en lugar de una garantía para cada carga de trabajo. Las páginas de referencia de la comunidad en el repositorio rastrean los resultados de calidad en todos los tamaños.

Parte de una ola más grande de IA local

Strata llega en medio de un impulso acelerado para la inferencia local. La familia Qwen de Alibaba se ha convertido en la línea de modelos de peso abierto más descargada, Meta y Google tienen sus propios modelos competitivos de código abierto y una ola de herramientas ahora permite a los consumidores ejecutar asistentes capaces sin suscripciones ni datos saliendo de sus dispositivos.

El proyecto también refleja cómo está cambiando la definición de "hardware de consumo". Una tarjeta gráfica 2026 de gama media con 12 GB de VRAM, que se envió principalmente para juegos, es ahora un acelerador de inferencia viable para un modelo de la clase de tamaño que definió los sistemas de vanguardia hace apenas dos años.

Strata sigue siendo un software inicial (el rastreador de problemas del repositorio documenta los aspectos ásperos de GPU más antiguas y procesadores que no son AVX2), pero el proyecto tiene licencia del MIT, es gratuito y se desarrolla abiertamente, con soporte experimental para Intel Arc, tarjetas Tesla y Radeon más antiguas y plataformas multi-GPU documentadas por miembros de la comunidad.

Para los desarrolladores, la conclusión más práctica puede ser la compatibilidad con la API localhost: cualquier script o agente escrito en OpenAI o Anthropic SDK puede redirigirse a una implementación local de Qwen cambiando una URL base, lo que convierte a Strata en una opción de baja fricción para la creación de prototipos sensibles a la privacidad, el uso fuera de línea o simplemente limitar el gasto en API.

Cómo probarlo

Comenzar no requiere una sesión de terminal con un manual. El instalador proporciona controladores, pesos de modelos y el servidor local en una sola pasada, y el repositorio incluye un archivo de configuración diseñado para pegarse directamente en un asistente de codificación de IA, que luego configura la máquina de forma autónoma. Los primeros lanzamientos son más lentos mientras los pesos se cargan desde el disco; la documentación recomienda un SSD y advierte que las conversaciones largas transfieren más trabajo a la RAM del sistema.

Manténgase por delante de la IA

Siga AI Buzz Wire para conocer las últimas novedades sobre modelos de código abierto, herramientas de IA locales y hardware de inferencia.

Leer más noticias sobre IA →