vLLM étage son cache KV jusqu'au disque et au S3
vLLM détaille son framework d'offloading étagé du cache KV : les blocs évincés du GPU passent par la RAM hôte puis vers un système de fichiers, un stockage objet S3 ou un pair distant en RDMA, au lieu d'être recalculés. Sur Qwen3.6-35B-A3B et deux H100, le niveau disque fait plus que doubler le débit au-delà de 128 conversations concurrentes.
