Dense ou MoE : ce que ça change à servir
NVIDIA publie un comparatif chiffré entre modèles denses et Mixture-of-Experts, du point de vue de celui qui sert le modèle. Le point central : le MoE découple la mémoire du calcul — la VRAM suit les paramètres totaux, le calcul ne suit que les paramètres actifs. À taille totale égale (~30 B, ~60 Go en BF16), Nemotron 3.5 Lightning (3 B actifs) débite 235,7 à 494,2 tokens par seconde contre 36,9 à 222,4 pour Gemma 4 31B dense, mais score 24 contre 30 à l'indice d'intelligence d'Artificial Analysis.


