veilletech.fr
18 sept.

Source · 31 jours de veille

vLLM

Ce qui a été retenu de cette source, et sur quels thèmes. Chaque fiche est une synthèse originale et renvoie à l'article d'origine.

2fiches
2jours sur 31
7min de lecture
IA & LLMthème

vLLM étage son cache KV jusqu'au disque et au S3

vLLM détaille son framework d'offloading étagé du cache KV : les blocs évincés du GPU passent par la RAM hôte puis vers un système de fichiers, un stockage objet S3 ou un pair distant en RDMA, au lieu d'être recalculés. Sur Qwen3.6-35B-A3B et deux H100, le niveau disque fait plus que doubler le débit au-delà de 128 conversations concurrentes.

11 sept.3 min

LLM

Un contexte d'un million sur huit H200

vLLM introduit Hybrid HiSparse, une politique de résidence du cache KV qui exploite l'attention creuse de GLM 5.3 : l'indexeur ne retient que les top-K jetons, tout le reste part en mémoire hôte, ce qui borne la mémoire GPU par requête. Le cache reste sur la carte tant qu'il y a de la place et ne bascule qu'en cas de pression. Sur un nœud de 8× H200, cela rend possible le contexte plein d'un million de jetons, jusque-là hors d'atteinte.

8 sept.4 min

LLM