Un projet open source a intégré un modèle de langage de 28,9 millions de paramètres sur un microcontrôleur qui coûte environ 8 dollars, générant du texte entièrement sur la puce à environ neuf jetons par seconde, sans aucune connexion réseau. La démonstration, publiée sur GitHub et qui fait rapidement la une de Hacker News, montre à quel point la frontière de la petite IA locale a progressé en peu de temps.
Le travail se concentre sur l'ESP32-S3, une puce intégrée peu coûteuse populaire auprès des amateurs et des fabricants de matériel. Exécuter un modèle de 28,9 millions de paramètres sur un si petit morceau de silicium aurait semblé invraisemblable il n'y a pas si longtemps, et le projet offre une illustration frappante de la poussée plus large vers l'IA sur appareil que nous suivons dans notre couverture quotidienne de l'industrie de l'IA. Là où le cloud semblait autrefois obligatoire pour tout modèle de langage réel, des systèmes de plus en plus performants trouvent leur place à la périphérie.
Les chiffres derrière la construction
Le projet expose clairement ses spécifications. Le modèle stocke 28,9 millions de paramètres, dont environ 25 millions dans une table de recherche flash. Il fonctionne sur une puce ESP32-S3 avec 512 Ko de SRAM rapide, 8 Mo de PSRAM et 16 Mo de stockage flash. En pratique, il atteint environ 9,5 jetons par seconde de bout en bout, soit 9,7 jetons par seconde de calcul pur, et l'ensemble du modèle n'occupe que 14,9 mégaoctets lorsqu'il est stocké avec une précision de 4 bits.
Le plus frappant est la comparaison que l’auteur fait avec des travaux antérieurs. Le dernier modèle de langage connu pour fonctionner sur une puce de cette classe ne contenait que 260 000 paramètres. La nouvelle version en contient environ cent fois plus, un progrès qui ne vient pas d'une puce plus grosse mais d'une refonte de l'endroit où se trouvent réellement les données du modèle.
Un tour de mémoire emprunté à Gemma
Le problème principal est qu’un microcontrôleur n’a presque pas de mémoire rapide. L'ESP32-S3 n'offre que 512 Ko de SRAM, et classiquement, l'ensemble du modèle devrait être accessible à partir de là, c'est pourquoi les tentatives précédentes étaient bloquées à quelques centaines de milliers de paramètres.
La solution de contournement repose sur une simple observation. La plupart des paramètres d'un modèle de langage se trouvent dans une table d'intégration, à partir de laquelle le modèle lit plutôt que sur lequel il calcule. Ainsi, au lieu de forcer cette énorme table de 25 millions de lignes dans une mémoire rapide et rare, le projet la laisse dans un stockage flash lent et extrait uniquement la poignée de lignes dont chaque jeton a réellement besoin, environ 450 octets à la fois. La petite partie du modèle qui effectue le calcul réel reste dans la mémoire rapide, tandis que la majeure partie des poids attendent simplement dans le flash, échantillonnés petit à petit.
Cette technique est connue sous le nom d'intégrations par couche et provient des modèles Gemma de Google, en particulier Gemma 3n et Gemma 4, où elle a été conçue pour les téléphones et les GPU. Selon l'auteur du projet, personne n'avait encore essayé cette approche sur une puce aussi petite.
Ce qu'il peut faire et ce qu'il ne peut pas faire
Le modèle a été formé sur TinyStories, un ensemble de données d'histoires simples pour enfants, ses capacités sont donc délibérément étroites. Il écrit des histoires courtes, pour la plupart cohérentes, mais il ne répondra pas à des questions factuelles, ne suivra pas d’instructions complexes, n’écrira pas de code ou ne raisonnera pas sur le monde. L’auteur affirme franchement que cette limitation provient de la petite partie du raisonnement du modèle et que l’astuce de la mémoire n’y change rien.
Ce qui rend le projet intéressant, ce n'est donc pas la qualité de son rendu mais son architecture. L'exploit consiste à installer un modèle aussi grand sur une puce aussi petite, prouvant que les mêmes techniques qui alimentent des modèles efficaces sur les téléphones et les serveurs peuvent être appliquées jusqu'au matériel qui coûte moins cher qu'un sandwich.
Pourquoi l'IA sur appareil est importante
Les implications vont bien au-delà d’une simple démonstration technique. Le modèle fonctionnant entièrement sur la puce, rien n’est jamais envoyé à un serveur. Cela signifie une confidentialité totale par construction, aucune donnée ne quitte l'appareil et il n'y a pas de facture cloud à payer. Pour les applications dans les zones éloignées, les appareils à faible consommation ou les environnements où la connectivité n'est pas fiable, cette combinaison est véritablement utile.
Cela laisse également présager un avenir dans lequel les petits modèles spécialisés seront distribués sur des milliards d’appareils embarqués bon marché plutôt que concentrés dans une poignée de centres de données géants. Les mêmes pressions qui suscitent l’intérêt pour l’IA locale sur les ordinateurs portables et les téléphones, à savoir une latence plus faible, un coût moindre et une confidentialité renforcée, s’appliquent avec encore plus de force à l’échelle du microcontrôleur.
Une invitation ouverte au bricolage
Le projet est publié sous la licence permissive MIT et l'auteur a partagé le code complet sur GitHub avec une documentation détaillée et des résultats de référence. Cette ouverture signifie que d'autres développeurs de matériel peuvent étudier l'approche, l'adapter à d'autres puces ou pousser le nombre de paramètres encore plus haut.
Publié sous le pseudo slvDev, le travail a trouvé un fort écho auprès de la communauté des développeurs, rassemblant des centaines de votes positifs sur Hacker News et suscitant des discussions sur la destination future de la technique. Si la tendance se maintient, la frontière entre un « modèle de langage » et un logiciel embarqué ordinaire est sur le point de devenir beaucoup plus floue.
Gardez une longueur d'avance sur l'IA
Des puces à 8 dollars aux centres de données valant des milliards de dollars, la question de savoir où fonctionne l’IA devient aussi importante que ce que l’IA peut faire. La couche matérielle évolue plus rapidement que la plupart des gens ne le pensent, et les projets qui ressemblent aujourd’hui à des curiosités définissent souvent le courant dominant de demain. Lisez plus d'actualités sur l'IA sur AI Buzz Wire pour suivre chaque avancée en matière d'informatique de pointe, d'efficacité des modèles et d'intelligence sur les appareils.
Tenez-vous au courant de la révolution matérielle de l'IA — visitez AI Buzz Wire


