DeepSeek sépare le prefill du décodage
DeepSeek a publié V4.1-Flash sous licence MIT sur Hugging Face, avec la vision intégrée au modèle. L'architecture est un encodeur-décodeur causal qui sépare le prefill du décodage : environ 8 milliards de paramètres actifs sur l'entrée, 16 sur la sortie. Le laboratoire annonce un cache clés-valeurs 4× plus léger en HBM et 8× sur SSD que la génération précédente — mais le décompte total, entre les 552 milliards annoncés et les ~763 trouvés dans les fichiers publiés, reste disputé.
