veilletech.fr
3 oct. Feed du jour
#08 LLM Article

ds4 : un MoE de 284 milliards sur un Mac de 128 Go

Un modèle de frontière sur un bureau. Au prix de deux bits par expert.

ds4 (DwarfStar 4), moteur d'inférence en C sous licence MIT, fait tourner DeepSeek V4 Flash — 284 milliards de paramètres en mélange d'experts — sur une machine de 128 Go grâce à une quantification asymétrique 2 bits et à un cache KV persistant sur SSD. Il cible volontairement peu de modèles, et son serveur expose des API compatibles OpenAI et Anthropic.

2 min de lectureavancévidéo 1:27
Partager
Sommaire6 sections
  1. Ce qui se passe
  2. Comment un 284B tient en mémoire
  3. Les chiffres publiés
  4. Comment s'y prendre
  5. Les limites
  6. À retenir

Ce qui se passe

DwarfStar 4, ou ds4, est un moteur d'inférence écrit en C, publié sous licence MIT dans le dépôt antirez/ds4. Il vise les Mac à grande mémoire et les machines CUDA ou ROCm, et prend le contre-pied des lanceurs génériques : il ne lit que des GGUF préparés par le projet, pour une poignée de familles validées de bout en bout — DeepSeek V4 et V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next, en texte et en vision.

Comment un 284B tient en mémoire

DeepSeek V4 Flash compte 284 milliards de paramètres répartis en experts. Deux choix le rendent praticable :

Au-delà de la mémoire disponible, certains modèles sont lus depuis le SSD en flux : c'est le cas de V4.1 en Q2 sur 128 Go.

Les chiffres publiés

Mesures du projet, en q2 :

Machine Contexte Prefill (t/s) Génération (t/s)
M5 Max, 128 Go 2 048 790,2 39,4
M5 Max, 128 Go 65 536 398,5 27,6
DGX Spark, 128 Go 2 048 825,8 18,1
DGX Spark, 128 Go 65 536 823,0 13,8

À 128 Go, V4 Flash Q2 sert de référence ; GLM 5.3 en Q2 et Qwen en Q4 y tiennent aussi. Une page dédiée décrit Qwen3.8 sur 64 Go.

Comment s'y prendre

Terminal
git clone https://github.com/antirez/ds4
cd ds4 && ./download_model.sh ds4f-q2
make              # Metal
make cuda-spark   # variante CUDA pour DGX Spark
./ds4-server --ctx 100000

Trois exécutables partagent le même modèle et le même cache : ./ds4 pour le dialogue, ./ds4-server pour les API, ./ds4-agent pour des sessions de code persistantes. Le serveur parle les formats d'OpenAI et d'Anthropic : Claude Code, Codex ou OpenCode s'y branchent en changeant l'URL de base.

Les limites

Source : DwarfStar 4 — Local frontier inference, site du projet, consulté le 3 octobre 2026. Dépôt : antirez/ds4.