PyTorch : un checkpoint FSDP de 522 s à 9 s
Databricks chiffre ce que coûte une reprise d'entraînement : au rythme d'interruptions de Llama 3, des checkpoints espacés de deux heures ne laissent que 64 % du temps GPU au calcul utile, contre 91 % à trente minutes. La condition pour resserrer l'intervalle est un checkpoint rapide, et c'est le checkpoint distribué de PyTorch qui le permet.