Un projet open source peu connu appelé Strata est en train de connaître un moment. Le moteur sous licence MIT, qui exécute le Qwen3.8-Flash-Next d'Alibaba – un modèle de mélange d'experts de 125 milliards de paramètres – sur des PC de jeu ordinaires, a fait la une de Hacker News le 4 octobre avec plus de 640 points, et son référentiel GitHub a collecté plus de 11 000 étoiles depuis sa création le 24 septembre.

Le principe est simple : un modèle de 125 milliards de paramètres qui réside normalement sur un serveur peut discuter, écrire du code, lire des images et piloter des agents de codage entièrement sur une carte graphique grand public, sans que rien ne quitte la machine.

Ce que fait réellement Strata

Strata est à la fois un moteur d'inférence et un programme d'installation en un clic pour Windows et Linux. Selon sa documentation, les exigences sont modestes par rapport aux normes des modèles frontières : un GPU avec au moins 12 Go de VRAM des séries RTX 20, 30, 40 ou 50 de NVIDIA ou des séries Radeon RX 6000, 7000 ou 9000 d'AMD, au moins 32 Go de RAM système et environ 80 Go d'espace SSD libre.

Le moteur est livré avec des versions quantifiées de Qwen3.8-Flash-Next à plusieurs niveaux de compression, de Q2_0 à IQ3_S, ainsi qu'une variante spécialisée dans le code. Il expose les API compatibles OpenAI et Anthropic sur localhost, ce qui signifie que les outils conçus pour ChatGPT ou Claude – y compris les agents de codage comme Claude Code, Cursor et Codex – peuvent être pointés vers le serveur local avec des modifications minimes. L'entrée d'image en option et la prise en charge de plusieurs GPU sont incluses, et le programme d'installation propose même un mode de configuration assisté par l'IA qui permet à un assistant de codage de configurer la machine à partir d'une seule invite collée.

Les chiffres de vitesse

Les benchmarks publiés du projet, mesurés sur deux ordinateurs grand public, sont à l'origine de la diffusion de cette version. Sur un NVIDIA RTX 5070 avec 12 Go de VRAM associé à un Ryzen 5 7600 et 64 Go de RAM, Strata rapporte :

  • Quantification Q2_0 : 94 jetons par seconde pour la génération et 2 650 jetons par seconde pour un traitement rapide sur un document de 32 000 jetons
  • IQ3_S : 53 jetons par deuxième génération, 1 620 jetons par seconde de traitement d'invite
  • Variante du codeur : 55 jetons par deuxième génération

Du côté d'AMD, un RX 9070 XT avec 16 Go de VRAM gérait 60 jetons par seconde au T2_0. La documentation estime qu'un RTX 3090 avec 24 Go de VRAM devrait atteindre 100 à 140 jetons par seconde, soit plus rapidement que ce que la plupart des gens peuvent lire.

À titre de comparaison, il y a six mois, l’exécution locale d’un modèle dense de 70 milliards de paramètres à des vitesses utilisables nécessitait un poste de travail doté de centaines de gigaoctets de mémoire unifiée ou des astuces de décodage spéculatif agressives.

Pourquoi un modèle 125B convient à une carte de jeu

Deux éléments technologiques rendent cela possible. Le premier est le modèle lui-même. Comme AI Buzz Wire l'a expliqué lors de sa sortie, Qwen3.8-Flash-Next est une architecture composée d'experts avec environ 125 milliards de paramètres au total mais seulement environ 6 milliards d'actifs par jeton - de sorte que chaque mot généré touche une petite partie du réseau, réduisant considérablement le calcul par jeton.

La seconde est la quantification. Les préréglages les plus rapides de Strata compressent les poids du modèle à deux ou trois bits par paramètre, échangeant une certaine précision contre une empreinte qui s'adapte à un GPU et une RAM système de 12 Go. Ce compromis constitue la principale mise en garde : les quants de classe Q2 et de classe IQ2 dégradent de manière mesurable la qualité des tâches nécessitant beaucoup de raisonnement, et les acheteurs devraient considérer les chiffres de vitesse globaux comme un point de départ plutôt que comme une garantie pour chaque charge de travail. Les pages de référence de la communauté dans le référentiel suivent les résultats de qualité selon toutes les tailles.

Fait partie d'une plus grande vague d'IA locale

Strata arrive dans un contexte d’accélération de l’inférence locale. La famille Qwen d'Alibaba est devenue la gamme de modèles ouverts la plus téléchargée, Meta et Google ont leurs propres modèles compétitifs open source, et une vague d'outils permet désormais aux consommateurs d'utiliser des assistants performants sans abonnement ni données quittant leurs appareils.

Le projet reflète également l'évolution de la définition du « matériel grand public ». Une carte graphique 2026 de milieu de gamme avec 12 Go de VRAM, livrée principalement pour les jeux, est désormais un accélérateur d'inférence viable pour un modèle de la classe de taille qui a défini les systèmes frontières il y a à peine deux ans.

Strata reste un logiciel précoce – le suivi des problèmes du référentiel documente les aspérités des anciens GPU et des processeurs non AVX2 – mais le projet est sous licence MIT, gratuit et développé en public, avec une prise en charge expérimentale d'Intel Arc, des anciennes cartes Tesla et Radeon et des plates-formes multi-GPU documentées par les membres de la communauté.

Pour les développeurs, le point le plus pratique à retenir peut être la compatibilité de l'API localhost : tout script ou agent écrit avec le SDK OpenAI ou Anthropic peut être redirigé vers un déploiement Qwen local en modifiant une URL de base, faisant de Strata une option à faible friction pour le prototypage sensible à la confidentialité, l'utilisation hors ligne ou simplement le plafonnement des dépenses API.

Comment l'essayer

La prise en main ne nécessite pas de session de terminal avec un manuel. Le programme d'installation fournit les pilotes, les poids du modèle et le serveur local en un seul passage, et le référentiel comprend un fichier d'installation conçu pour être collé directement dans un assistant de codage IA, qui configure ensuite la machine de manière autonome. Les premiers lancements sont plus lents pendant le chargement des poids à partir du disque ; la documentation recommande un SSD et prévient que les longues conversations transfèrent davantage de travail sur la RAM système.

Gardez une longueur d'avance sur l'IA

Suivez AI Buzz Wire pour connaître les dernières nouveautés en matière de modèles open source, d'outils d'IA locaux et de matériel d'inférence.

Lire plus d'actualités sur l'IA →