veilletech.fr
5 oct. Feed du jour
#01 LLM Article

Strata : un modèle de 125B sur un GPU de 12 Go

Dix experts au travail. Vingt-quatre mille en réserve.

Strata fait tourner Qwen3.8-Flash-Next, un mélange d'experts de 125 milliards de paramètres, sur un PC Windows ou Linux doté d'une carte graphique de 12 Go. La carte garde les experts les plus sollicités, la RAM tous les autres, le processeur calcule en parallèle : 53 à 94 tokens par seconde mesurés par les auteurs sur une RTX 5070, au prix d'une compression à 2-3 bits.

4 min de lectureintermédiairevidéo 1:15
Partager
Sommaire7 sections
  1. Ce qui se passe
  2. Comment le modèle tient sur la machine
  3. Les mesures publiées
  4. Quelle taille prendre
  5. Comment s'y prendre
  6. Les limites
  7. À retenir

Ce qui se passe

Strata, projet open source sous licence MIT, installe et sert Qwen3.8-Flash-Next — le mélange d'experts de 125 milliards de paramètres de l'équipe Qwen — sur un PC de joueur, sous Windows ou Linux. Le dépôt a réuni 674 points sur Hacker News le 4 octobre. Il réutilise des parties de llama.cpp / ggml et des versions compressées du modèle publiées par ISTA-DASLab, UkisAI (Swift 1.5) et Unsloth.

Le 2 septembre, slotstream faisait tourner le même modèle sur un Mac en lisant les experts depuis le SSD, vers 12 tokens par seconde. Strata vise l'autre moitié du parc : une carte NVIDIA ou AMD de 12 Go et beaucoup de RAM.

Comment le modèle tient sur la machine

Les mesures publiées

Mesures des auteurs, réponses de 4K tokens, prompts de 32K :

Taille RTX 5070 — écriture RTX 5070 — lecture du prompt RX 9070 XT — écriture
Q2_0 94 tok/s 2 650 tok/s 60 tok/s
IQ2_XS 79 tok/s 2 090 tok/s 52 tok/s
IQ3_XXS 62 tok/s 1 750 tok/s —
IQ3_S 53 tok/s 1 620 tok/s —
Coder 55 tok/s 2 180 tok/s 44 tok/s

Machines : RTX 5070 (12 Go), Ryzen 5 7600 et 64 Go de RAM ; RX 9070 XT (16 Go), Ryzen 9 3900X et 47 Go. Les 100 à 140 tokens par seconde annoncés pour une RTX 3090 de 24 Go sont une estimation, pas une mesure.

Quelle taille prendre

RAM Taille conseillée
32 Go Coder
48 Go IQ2_XS, ou Q2_0, la plus rapide
64 Go IQ2_XS, ou IQ3_XXS / IQ3_S
96 Go et plus IQ3_S, ou UD-IQ4_XS d'Unsloth (~4 bits, 94 Go à télécharger)

Coder retire la moitié des experts : il atteindrait 91 % du score SWE-bench Verified du modèle complet, d'après ses auteurs, mais faiblit hors du code, notamment en chinois, japonais et coréen. UD-Q4_K_XL, la plus fidèle, lit l'essentiel de ses poids sur le SSD : 7 à 8,5 tokens par seconde sur 64 Go.

Comment s'y prendre

Prérequis : 12 Go de VRAM (GeForce RTX 20 à 50, ou Radeon RX 6800/6900, 7700 XT à 7900 XTX, 9060 XT, 9070, AI PRO R9700), 32 Go de RAM, environ 80 Go de disque, de préférence un SSD.

Terminal
git clone https://github.com/Niko1221/Strata && cd Strata
./setup.sh    # sous Windows : START-HERE.bat

L'installeur détecte la carte, demande taille, contexte et vision, télécharge environ 70 Go et ouvre l'interface sur http://127.0.0.1:8080. Côté clients :

Terminal
# API OpenAI : base URL http://127.0.0.1:8080/v1, clé et nom de modèle libres
# Claude Code passe par /v1/messages :
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080

Codex CLI utilise /v1/responses.

Les limites

Source : Niko1221/Strata, dépôt GitHub (README), signalé sur Hacker News le 4 octobre 2026.