Quatre GPU, et le goulot était dans le BIOS
Deuxième volet d'un montage de serveur d'inférence maison à quatre GPU AMD. L'auteur y traque la lenteur du multi-GPU sous llama.cpp et découvre que les transferts directs entre cartes ne fonctionnaient pas du tout : tout passait par le processeur. Deux réglages, un dans le BIOS et un dans le noyau, multiplient les débits.