Un proyecto de código abierto ha introducido un modelo de lenguaje de 28,9 millones de parámetros en un microcontrolador que cuesta alrededor de 8 dólares, generando texto íntegramente en el chip a aproximadamente nueve tokens por segundo sin ninguna conexión de red. La demostración, publicada en GitHub y escalando rápidamente en la portada de Hacker News, muestra hasta qué punto se ha movido la frontera de la pequeña IA local en poco tiempo.

El trabajo se centra en el ESP32-S3, un chip integrado económico popular entre los aficionados y los fabricantes de hardware. Ejecutar un modelo de 28,9 millones de parámetros en una pieza tan pequeña de silicio habría parecido inverosímil no hace mucho, y el proyecto ofrece una vívida ilustración del impulso más amplio hacia la IA en los dispositivos que rastreamos en nuestra [cobertura de la industria de la IA] diaria (https://aibuzzwire.news). Mientras que la nube alguna vez se consideró obligatoria para cualquier modelo de lenguaje real, sistemas cada vez más capaces están encontrando hogares en el borde.

Los números detrás de la construcción

El proyecto establece claramente sus especificaciones. El modelo almacena 28,9 millones de parámetros, de los cuales alrededor de 25 millones se encuentran en una tabla de búsqueda flash. Se ejecuta en un chip ESP32-S3 con 512 KB de SRAM rápida, 8 MB de PSRAM y 16 MB de almacenamiento flash. En la práctica, alcanza aproximadamente 9,5 tokens por segundo de extremo a extremo, o 9,7 tokens por segundo de computación pura, y el modelo completo ocupa solo 14,9 megabytes cuando se almacena con una precisión de 4 bits.

Lo más sorprendente es la comparación que hace el autor con trabajos anteriores. El último modelo de lenguaje conocido que se ejecutó en un chip de esta clase contenía sólo 260.000 parámetros. La nueva versión tiene aproximadamente cien veces más capacidad, un salto que no proviene de un chip más grande sino de repensar dónde residen realmente los datos del modelo.

Un truco de memoria tomado de Gemma.

El problema central es que un microcontrolador casi no tiene memoria rápida. El ESP32-S3 ofrece solo 512 KB de SRAM y, convencionalmente, sería necesario acceder a todo el modelo desde allí, razón por la cual los intentos anteriores se estancaron en unos pocos cientos de miles de parámetros.

La solución se basa en una simple observación. La mayoría de los parámetros de un modelo de lenguaje se encuentran en una tabla de incrustación, de la cual el modelo lee en lugar de calcular. Entonces, en lugar de forzar esa enorme tabla de 25 millones de filas a la escasa memoria rápida, el proyecto la deja en un almacenamiento flash lento y extrae sólo el puñado de filas que cada token realmente necesita, alrededor de 450 bytes a la vez. La pequeña porción del modelo que realiza el cálculo real permanece en la memoria rápida, mientras que la mayor parte de los pesos simplemente esperan en la memoria flash, muestreados poco a poco.

Esa técnica se conoce como incrustaciones por capa y se originó con los modelos Gemma de Google, específicamente Gemma 3n y Gemma 4, donde fue diseñada para teléfonos y GPU. Según el autor del proyecto, nadie había probado antes este método en un chip tan pequeño.

Qué puede hacer y qué no puede hacer

El modelo fue entrenado en TinyStories, un conjunto de datos de cuentos infantiles sencillos, por lo que sus capacidades son deliberadamente limitadas. Escribe historias breves, en su mayoría coherentes, pero no responde preguntas objetivas, no sigue instrucciones complejas, no escribe códigos ni razona sobre el mundo. El autor es sincero en cuanto a que esta limitación se debe a la pequeña parte de razonamiento del modelo y que el truco de la memoria no la cambia.

Por lo tanto, lo que hace que el proyecto sea interesante no es la calidad de sus resultados, sino su arquitectura. El logro es colocar un modelo de este tamaño en un chip de este tamaño, demostrando que las mismas técnicas que alimentan modelos eficientes en teléfonos y servidores pueden trasladarse hasta hardware que cueste menos que un sándwich.

Por qué es importante la IA en el dispositivo

Las implicaciones van mucho más allá de una sencilla demostración técnica. Debido a que el modelo se ejecuta completamente en el chip, nunca se envía nada a un servidor. Eso significa privacidad total por construcción, ningún dato sale del dispositivo y no hay que pagar ninguna factura de nube. Para aplicaciones en áreas remotas, dispositivos de bajo consumo o entornos donde la conectividad no es confiable, esa combinación es realmente útil.

También apunta a un futuro en el que los modelos pequeños y especializados se distribuirán en miles de millones de dispositivos integrados baratos en lugar de concentrarse en un puñado de centros de datos gigantes. Las mismas presiones que impulsan el interés en la IA local en computadoras portátiles y teléfonos, es decir, menor latencia, menor costo y mayor privacidad, se aplican aún con más fuerza a la escala de los microcontroladores.

Una invitación abierta a jugar

El proyecto se publica bajo la licencia permisiva del MIT y el autor ha compartido el código completo en GitHub junto con documentación detallada y resultados comparativos. Esa apertura significa que otros desarrolladores de hardware pueden estudiar el enfoque, adaptarlo a otros chips o aumentar aún más el número de parámetros.

Publicado bajo el nombre de slvDev, el trabajo resonó fuertemente en la comunidad de desarrolladores, reuniendo cientos de votos a favor en Hacker News y provocando una discusión sobre hacia dónde podría viajar la técnica a continuación. Si la tendencia se mantiene, la línea entre un "modelo de lenguaje" y una pieza ordinaria de software integrado está a punto de volverse mucho más borrosa.

Manténgase por delante de la IA

Desde chips de 8 dólares hasta centros de datos de miles de millones de dólares, la cuestión de dónde funciona la IA se está volviendo tan importante como lo que puede hacer la IA. La capa de hardware está evolucionando más rápido de lo que la mayoría de la gente cree, y los proyectos que hoy parecen curiosidades a menudo definen la corriente principal del mañana. Lea más noticias sobre IA en AI Buzz Wire para seguir cada avance en informática de punta, eficiencia de modelos e inteligencia en el dispositivo.

Manténgase al día con la revolución del hardware de IA: visite AI Buzz Wire