veilletech.fr
16 sept. Feed du jour
#09 IA Article

Dense ou MoE : ce que ça change à servir

« 30 milliards de paramètres » ne dit ni le débit, ni la VRAM, ni le prix.

NVIDIA publie un comparatif chiffré entre modèles denses et Mixture-of-Experts, du point de vue de celui qui sert le modèle. Le point central : le MoE découple la mémoire du calcul — la VRAM suit les paramètres totaux, le calcul ne suit que les paramètres actifs. À taille totale égale (~30 B, ~60 Go en BF16), Nemotron 3.5 Lightning (3 B actifs) débite 235,7 à 494,2 tokens par seconde contre 36,9 à 222,4 pour Gemma 4 31B dense, mais score 24 contre 30 à l'indice d'intelligence d'Artificial Analysis.

4 min de lectureintermédiairevidéo 1:18
Partager
Sommaire6 sections
  1. Ce qui se passe
  2. Le mécanisme
  3. Le point à retenir : mémoire et calcul se séparent
  4. Les chiffres
  5. Les limites
  6. À retenir

Ce qui se passe

NVIDIA publie une comparaison entre architectures denses et Mixture-of-Experts (MoE) écrite du point de vue de celui qui sert le modèle, pas de celui qui l'entraîne. Le fil conducteur est un constat : le nombre de paramètres affiché sur une fiche de modèle ne prédit plus ni le débit, ni la VRAM nécessaire, ni le coût.

Le mécanisme

Dans un modèle dense, tous les paramètres participent à chaque token : les 27 ou 31 milliards passent par un unique bloc feed-forward (FFN) par couche de décodage.

Un MoE remplace ce bloc unique par plusieurs FFN — 8, 64, parfois 128 — qu'on appelle experts. Un réseau de routage placé devant attribue chaque token aux top-k experts les mieux notés ; les autres sont sautés pour ce token, à cette couche. Trois précisions qui évitent les contresens :

Le point à retenir : mémoire et calcul se séparent

Dans un modèle dense, coût d'hébergement et coût d'inférence évoluent ensemble. Le MoE rompt ce lien :

À batch 1, le décodage est limité par la mémoire plutôt que par le calcul, et le MoE excelle : il lit moins d'octets de poids par token.

Les chiffres

Relevé Artificial Analysis, entrée de 10 K tokens, 31 août 2026 :

Modèle Architecture Total Actifs VRAM BF16 VRAM 4 bits Indice Débit $/M sortie
Gemma 4 31B dense 31 B 31 B ~61 Go ~16 Go 30 36,9 – 222,4 t/s 0,40 $
Qwen3.8-27B dense 27 B 27 B ~56 Go ~14 Go 52 46,8 t/s 3,00 $
Nemotron 3.5 Lightning MoE + Mamba-2 30 B 3 B ~60 Go ~20 Go 24 235,7 – 494,2 t/s 0,22 $
Mistral Small 4 MoE 119 B 6 B ~121 Go FP8 (4×H100) ~71 Go 20 147,3 t/s 0,60 $

Lightning va 4 à 5 fois plus vite que Qwen3.8-27B pour un quatorzième du prix, et score moins de la moitié à l'indice de capacité générale. Ce qui est le bon arbitrage pour une couche d'exécution agentique enchaînant des étapes bien spécifiées à volume — et le mauvais quand une seule passe de raisonnement décide du résultat.

À noter : les deux modèles à ~30 B occupent la même VRAM. La question n'est pas combien de gigaoctets, mais ce qu'on en obtient : de la capacité côté dense, du débit côté MoE. Et Lightning cumule d'autres effets que la seule sparsité — ses couches Mamba-2 portent un état récurrent de taille constante au lieu d'un cache KV qui grossit, et il utilise le décodage spéculatif.

Les limites

À retenir

Le choix ne se joue pas sur une préférence d'architecture mais sur une contrainte de déploiement : budget mémoire, profil de concurrence, projet de fine-tuning. Si vous êtes sensible à la latence à forte concurrence, l'article conseille de mesurer les deux plutôt que de trancher sur le papier.