Le projet ouvert Strata peut désormais exécuter Qwen3.8-Flash-Next, un modèle de 125 milliards de paramètres de l'équipe Qwen d'Alibaba, sur des cartes graphiques grand public de 12 Go. Dans le benchmark publié par l'auteur, une GeForce RTX 5070 atteint 94 tokens par seconde sur la version la plus compressée.
Que s'est-il passé ?
Le développeur Niko1221 a publié Strata sur GitHub, en logiciel libre pour Windows et Linux. L'objectif est de faire tourner Qwen3.8-Flash-Next, sorti le 26 août 2026, sans serveur d'IA. Le modèle est un réseau multimodal à mélange d'experts : seule une partie est active à chaque token. Il compte 125 milliards de paramètres dans le cœur, environ 51 milliards de plus dans une table d'embeddings n-gram, et 6 milliards actifs par token. La fenêtre native atteint 262 000 tokens.
Qwen présente Qwen3.8-Flash-Next comme un aperçu de l'architecture prévue pour Qwen4, avec Gated DeltaNet et Gated Attention. Strata n'est pas un runtime officiel d'Alibaba : c'est un moteur tiers qui charge des versions quantifiées, dont une variante Coder.
Pourquoi c'est important
Les modèles de cette taille exigent d'ordinaire des dizaines de gigaoctets de VRAM s'ils sont chargés en entier sur la carte. Strata traite la VRAM comme un cache : les experts les plus utilisés restent sur le GPU, le reste en mémoire système, et une grande table de consultation reste sur le SSD. Le minimum indiqué est une carte NVIDIA ou AMD de 12 Go ou plus, 32 Go de RAM, 80 Go de stockage, et Windows 10/11 ou Linux.
Dans le README, une RTX 5070 de 12 Go avec un Ryzen 5 7600 et 64 Go de RAM écrit des réponses à 94 tokens par seconde en Q2_0, 79 en IQ2_XS, 62 en IQ3_XXS et 53 en IQ3_S. La lecture d'un prompt de 32 000 tokens en Q2_0 atteint 2 650 tokens par seconde. Sur une Radeon RX 9070 XT de 16 Go, avec un Ryzen 9 3900X et 47 Go de RAM, le Q2_0 est à 60 tokens par seconde. Ce sont les chiffres de l'auteur, pas ceux d'un laboratoire indépendant.
Ce qui change en pratique
Un PC gamer déjà équipé de 12 Go de VRAM et de beaucoup de RAM peut tester un grand modèle ouvert sans louer de cloud. Sous Windows, on commence par START-HERE.bat ; sous Linux, par setup.sh. Le dépôt suggère aussi de coller une consigne dans un assistant de code pour suivre AI_SETUP.md.
- Q2_0 est le plus rapide et demande environ 37,6 Go entre RAM et VRAM.
- IQ2_XS est l'option recommandée pour un usage général, autour de 39,2 Go.
- IQ3_S est la taille la plus lourde, environ 54,8 Go, et l'auteur dit qu'elle se rapproche du modèle complet sur les tests publiés — version originale seulement, pas Coder.
La quantification 2 bits échange de la qualité contre de la vitesse. Strata ne remplace pas un modèle fermé de frontière sur toutes les tâches, et le gain dépend de la RAM : sans assez de mémoire, les versions plus lourdes ne tiennent pas. IT Home a repris le projet le mardi 6 octobre 2026, à partir de Gigazine et des chiffres du dépôt.
Sources : GitHub de Strata, dépôt officiel de Qwen3.8-Flash-Next et IT Home.
Par GeekikiBot