Ce qui se passe
Strata, projet open source sous licence MIT, installe et sert Qwen3.8-Flash-Next — le mélange d'experts de 125 milliards de paramètres de l'équipe Qwen — sur un PC de joueur, sous Windows ou Linux. Le dépôt a réuni 674 points sur Hacker News le 4 octobre. Il réutilise des parties de llama.cpp / ggml et des versions compressées du modèle publiées par ISTA-DASLab, UkisAI (Swift 1.5) et Unsloth.
Le 2 septembre, slotstream faisait tourner le même modèle sur un Mac en lisant les experts depuis le SSD, vers 12 tokens par seconde. Strata vise l'autre moitié du parc : une carte NVIDIA ou AMD de 12 Go et beaucoup de RAM.
Comment le modèle tient sur la machine
- Le modèle compte 24 576 experts ; chaque mot n'en sollicite que 10.
- La carte graphique garde les quelques milliers d'experts les plus appelés.
- La RAM les contient tous, et le processeur calcule en parallèle ceux qui ne sont pas sur la carte. Une grande table de correspondance reste sur le SSD.
- Un petit modèle propose les mots suivants, le grand les valide en un seul passage : même sortie, 1,6 à 1,8 fois plus vite.
- Les longs textes sont lus par blocs de 8 192 tokens.
Les mesures publiées
Mesures des auteurs, réponses de 4K tokens, prompts de 32K :
| Taille | RTX 5070 — écriture | RTX 5070 — lecture du prompt | RX 9070 XT — écriture |
|---|---|---|---|
| Q2_0 | 94 tok/s | 2 650 tok/s | 60 tok/s |
| IQ2_XS | 79 tok/s | 2 090 tok/s | 52 tok/s |
| IQ3_XXS | 62 tok/s | 1 750 tok/s | — |
| IQ3_S | 53 tok/s | 1 620 tok/s | — |
| Coder | 55 tok/s | 2 180 tok/s | 44 tok/s |
Machines : RTX 5070 (12 Go), Ryzen 5 7600 et 64 Go de RAM ; RX 9070 XT (16 Go), Ryzen 9 3900X et 47 Go. Les 100 à 140 tokens par seconde annoncés pour une RTX 3090 de 24 Go sont une estimation, pas une mesure.
Quelle taille prendre
| RAM | Taille conseillée |
|---|---|
| 32 Go | Coder |
| 48 Go | IQ2_XS, ou Q2_0, la plus rapide |
| 64 Go | IQ2_XS, ou IQ3_XXS / IQ3_S |
| 96 Go et plus | IQ3_S, ou UD-IQ4_XS d'Unsloth (~4 bits, 94 Go à télécharger) |
Coder retire la moitié des experts : il atteindrait 91 % du score SWE-bench Verified du modèle complet, d'après ses auteurs, mais faiblit hors du code, notamment en chinois, japonais et coréen. UD-Q4_K_XL, la plus fidèle, lit l'essentiel de ses poids sur le SSD : 7 à 8,5 tokens par seconde sur 64 Go.
Comment s'y prendre
Prérequis : 12 Go de VRAM (GeForce RTX 20 à 50, ou Radeon RX 6800/6900, 7700 XT à 7900 XTX, 9060 XT, 9070, AI PRO R9700), 32 Go de RAM, environ 80 Go de disque, de préférence un SSD.
git clone https://github.com/Niko1221/Strata && cd Strata
./setup.sh # sous Windows : START-HERE.batL'installeur détecte la carte, demande taille, contexte et vision, télécharge
environ 70 Go et ouvre l'interface sur http://127.0.0.1:8080. Côté clients :
# API OpenAI : base URL http://127.0.0.1:8080/v1, clé et nom de modèle libres
# Claude Code passe par /v1/messages :
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080Codex CLI utilise /v1/responses.
Les limites
- 2 à 3 bits par poids : la qualité reste en dessous du modèle complet.
- Au lancement, Strata charge 35 à 55 Go en RAM et en verrouille une partie pour la carte : la machine peut ne plus répondre pendant 1 à 3 minutes.
- Le premier message d'une conversation est lu en entier, environ une minute pour 30 000 tokens ; les suivants démarrent en quelques secondes.
- Une requête à la fois par défaut.
"parallel": 2en sert deux, plus lentement sur une carte de 12 Go. - Pour l'ouvrir au réseau,
START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>: jamais sans clé. - Le dépôt propose de confier l'installation à un agent de code. C'est lui laisser exécuter l'installeur d'un tiers : une décision à prendre sciemment.
Source : Niko1221/Strata, dépôt GitHub (README), signalé sur Hacker News le 4 octobre 2026.