veilletech.fr
13 sept. Feed du jour
#07 LLM Article

DeepSeek sépare le prefill du décodage

L'architecture compte plus que le numéro de version.

DeepSeek a publié V4.1-Flash sous licence MIT sur Hugging Face, avec la vision intégrée au modèle. L'architecture est un encodeur-décodeur causal qui sépare le prefill du décodage : environ 8 milliards de paramètres actifs sur l'entrée, 16 sur la sortie. Le laboratoire annonce un cache clés-valeurs 4× plus léger en HBM et 8× sur SSD que la génération précédente — mais le décompte total, entre les 552 milliards annoncés et les ~763 trouvés dans les fichiers publiés, reste disputé.

3 min de lectureavancévidéo 1:10
Partager
Sommaire5 sections
  1. Ce qui se passe
  2. Le mécanisme
  3. Ce que ça change
  4. Les réserves
  5. À retenir

Ce qui se passe

DeepSeek a publié V4.1-Flash le 10 septembre, poids sur Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) sous licence MIT, avec la compréhension visuelle dans le modèle plutôt que dans un second modèle à attendre. Le numéro de version est trompeur : Sebastian Raschka parle d'une refonte majeure et estime qu'elle aurait dû s'appeler V5.

Le mécanisme

La nouveauté est une architecture encodeur-décodeur causale — un retour remarqué, dans un modèle de premier plan, à une forme qu'on croyait réservée à l'avant-GPT. Elle sépare l'économie du prefill (les tokens d'entrée) de celle du décodage (les tokens de sortie) :

Phase Paramètres actifs
Prefill — tokens d'entrée ~8 milliards
Décodage — tokens de sortie ~16 milliards

D'où la notation 763B-P8B-D16B employée par Latent Space, en étendant celle des MoE, et une activation de l'ordre de 1 à 2 %. Le config.json publié donne le reste : 40 couches, hidden_size à 5120, 384 experts routés plus 1 partagé, 6 experts par token, une seule tête clé-valeur, une fenêtre glissante de 128, et max_position_embeddings à 1 048 576 obtenu par YaRN de facteur 16 depuis 65 536. Les poids sont en fp8, les experts en fp4.

L'attention combine une branche locale à fenêtre glissante et une branche de récupération creuse — un motif que l'on retrouve aussi dans HySparse, NSA et les travaux antérieurs de DeepSeek.

Ce que ça change

Tout l'effort porte sur le cache clés-valeurs, et c'est là que se joue le coût d'un agent qui travaille longtemps. Les réductions annoncées par DeepSeek, par rapport à la génération précédente :

Côté API, le modèle s'appelle deepseek-flash. deepseek-v4-flash et deepseek-v4-flash-vision-exp sont dépréciés, et deepseek-v4-pro sera à terme routé vers V4.1 Flash. Artificial Analysis le tarife à 0,30 $ par million de tokens d'entrée et 1,20 $ en sortie, avec l'entrée en cache à 0,006 $ et une remise de 50 % hors heures de pointe, pour un score de 40 à son indice — sous GLM-5.3-Flash, au-dessus de V4 Pro.

Les réserves

Le décompte des paramètres est disputé. DeepSeek annonce 552 milliards. L'inspection des safetensors donne un autre total : 551,566 G de backbone, 196,929 G d'engram, 14,225 G pour DSpark/MTP et 0,485 G pour l'encodeur visuel, soit environ 763,21 milliards stockés pour 511,76 Go. Les 485 milliards affichés par Hugging Face viennent probablement d'un comptage des poids FP4 empaquetés en octets plutôt qu'en deux paramètres par octet ; la recette vLLM a listé 522 milliards avant correction.

Conséquence pratique : le backbone est presque entièrement constitué d'experts MoE — 543,582 G en FP4 contre ~7,984 G pour l'attention, les couches partagées et les embeddings. 128 à 256 Go de VRAM ne suffisent pas pour un usage local complet. Un utilisateur rapporte 200 tokens/s en pleine précision sur 4 Max-Q avec 64 Go de RAM système, en déchargeant une table Engram de 200 Go sur NVMe — une recette vLLM est annoncée.

Enfin, le rapport technique vient du laboratoire et n'a pas été relu par des pairs ; les chiffres de cache sont ses chiffres.

À retenir

Ce n'est pas un classement qu'il faut regarder ici, c'est une architecture : la séparation des économies de prefill et de décodage rend les charges longues et agentiques praticables sans payer le prix d'un modèle dense sur chaque token. Pour qui héberge, la vraie question n'est pas le score mais la place qu'occupe le cache.