Ce qui se passe
DeepSeek a publié V4.1-Flash le 10 septembre, poids sur Hugging Face
(deepseek-ai/DeepSeek-V4.1-Flash) sous licence MIT, avec la compréhension
visuelle dans le modèle plutôt que dans un second modèle à attendre. Le numéro de
version est trompeur : Sebastian Raschka parle d'une refonte majeure et estime
qu'elle aurait dû s'appeler V5.
Le mécanisme
La nouveauté est une architecture encodeur-décodeur causale — un retour remarqué, dans un modèle de premier plan, à une forme qu'on croyait réservée à l'avant-GPT. Elle sépare l'économie du prefill (les tokens d'entrée) de celle du décodage (les tokens de sortie) :
| Phase | Paramètres actifs |
|---|---|
| Prefill — tokens d'entrée | ~8 milliards |
| Décodage — tokens de sortie | ~16 milliards |
D'où la notation 763B-P8B-D16B employée par Latent Space, en étendant celle des
MoE, et une activation de l'ordre de 1 à 2 %. Le config.json publié donne le
reste : 40 couches, hidden_size à 5120, 384 experts routés plus 1 partagé,
6 experts par token, une seule tête clé-valeur, une fenêtre glissante de 128,
et max_position_embeddings à 1 048 576 obtenu par YaRN de facteur 16 depuis
65 536. Les poids sont en fp8, les experts en fp4.
L'attention combine une branche locale à fenêtre glissante et une branche de récupération creuse — un motif que l'on retrouve aussi dans HySparse, NSA et les travaux antérieurs de DeepSeek.
Ce que ça change
Tout l'effort porte sur le cache clés-valeurs, et c'est là que se joue le coût d'un agent qui travaille longtemps. Les réductions annoncées par DeepSeek, par rapport à la génération précédente :
- 4× moins de mémoire GPU (HBM) ;
- 8× moins de stockage SSD ;
- 437× moins que sa première génération.
Côté API, le modèle s'appelle deepseek-flash. deepseek-v4-flash et
deepseek-v4-flash-vision-exp sont dépréciés, et deepseek-v4-pro sera à terme
routé vers V4.1 Flash. Artificial Analysis le tarife à 0,30 $ par million de
tokens d'entrée et 1,20 $ en sortie, avec l'entrée en cache à 0,006 $ et une
remise de 50 % hors heures de pointe, pour un score de 40 à son indice — sous
GLM-5.3-Flash, au-dessus de V4 Pro.
Les réserves
Le décompte des paramètres est disputé. DeepSeek annonce 552 milliards.
L'inspection des safetensors donne un autre total : 551,566 G de backbone,
196,929 G d'engram, 14,225 G pour DSpark/MTP et 0,485 G pour l'encodeur visuel,
soit environ 763,21 milliards stockés pour 511,76 Go. Les 485 milliards
affichés par Hugging Face viennent probablement d'un comptage des poids FP4
empaquetés en octets plutôt qu'en deux paramètres par octet ; la recette vLLM a
listé 522 milliards avant correction.
Conséquence pratique : le backbone est presque entièrement constitué d'experts MoE — 543,582 G en FP4 contre ~7,984 G pour l'attention, les couches partagées et les embeddings. 128 à 256 Go de VRAM ne suffisent pas pour un usage local complet. Un utilisateur rapporte 200 tokens/s en pleine précision sur 4 Max-Q avec 64 Go de RAM système, en déchargeant une table Engram de 200 Go sur NVMe — une recette vLLM est annoncée.
Enfin, le rapport technique vient du laboratoire et n'a pas été relu par des pairs ; les chiffres de cache sont ses chiffres.
À retenir
Ce n'est pas un classement qu'il faut regarder ici, c'est une architecture : la séparation des économies de prefill et de décodage rend les charges longues et agentiques praticables sans payer le prix d'un modèle dense sur chaque token. Pour qui héberge, la vraie question n'est pas le score mais la place qu'occupe le cache.