veilletech.fr
29 août Feed du jour
#10 IA Article

Deux commandes du checkpoint à l'inférence C++

L'inférence sans Python, c'est surtout un binaire qu'on peut livrer.

NVIDIA publie TensorRT Model Connect, une collection ouverte d'implémentations de référence pour passer d'un identifiant Hugging Face à de l'inférence C++ native. Une commande Python construit un bundle contenant les moteurs TensorRT, que l'application C++ charge ensuite sans PyTorch ni interpréteur Python à l'exécution.

1 min de lecturevidéo 1:23
Partager
Sommaire4 sections
  1. Ce qui se passe
  2. Comment s'y prendre
  3. Ce que ça change
  4. À retenir

Ce qui se passe

Faire sortir un modèle ouvert de l'écosystème Python reste une corvée : chaque famille de modèle demande sa conversion, son prétraitement, son post-traitement et son code d'exécution. TensorRT Model Connect est la réponse de NVIDIA : une collection ouverte d'implémentations de référence, à lire, modifier et étendre, pour exécuter les modèles supportés avec TensorRT dans une application C++ native.

Comment s'y prendre

Le déploiement se coupe en deux phases séparées par un seul artefact. Phase 1, en Python, on construit le bundle depuis un identifiant Hugging Face ou un checkpoint local :

Terminal
trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle

Le bundle contient les moteurs TensorRT et les ressources propres au modèle nécessaires à l'exécution. Phase 2, en C++, l'application le charge et travaille avec des entrées et sorties au niveau de la tâche :

C++
#include <trtmc/pipeline.h>

auto pipeline = trtmc::load("qwen3-0.6b.bundle");
auto result   = pipeline->generate("Explain why native inference matters.",
                                   {.max_new_tokens = 20});
std::cout << result.text << std::endl;

Model Connect prend en charge la correspondance des poids du checkpoint, la construction des moteurs TensorRT, le prétraitement, l'orchestration à l'exécution et le post-traitement. Python sert à préparer le modèle ; le binaire déployé tourne sans PyTorch ni interpréteur Python.

Ce que ça change

Pour une application native — bureau, périphérie, service embarqué — la dépendance Python disparaît du livrable, et avec elle une bonne part du poids d'image et des soucis d'environnement.

Deux niveaux d'API cohabitent, sur les mêmes implémentations :

On commence donc par l'interface de haut niveau, et on descend seulement là où c'est nécessaire. Pour un noyau GPU maison, TVM FFI permet de remplacer une portion ciblée du modèle pendant que TensorRT exécute le reste du pipeline, sans reconstruire l'application autour d'un autre runtime.

Trois limites à garder en tête : le projet vise le matériel NVIDIA, il ne couvre que les modèles pour lesquels une implémentation de référence existe, et il est publié en versions nocturnes, développé en grande partie avec des agents de code — ce que NVIDIA annonce explicitement plutôt que de le taire. Model Connect n'est pas un nouveau framework d'inférence : c'est un pont vers TensorRT.

Source : NVIDIA Technical Blog, Deploy an Open Model from Checkpoint to Inference in Two Commands with NVIDIA TensorRT Model Connect