Ce qui se passe
Faire sortir un modèle ouvert de l'écosystème Python reste une corvée : chaque famille de modèle demande sa conversion, son prétraitement, son post-traitement et son code d'exécution. TensorRT Model Connect est la réponse de NVIDIA : une collection ouverte d'implémentations de référence, à lire, modifier et étendre, pour exécuter les modèles supportés avec TensorRT dans une application C++ native.
Comment s'y prendre
Le déploiement se coupe en deux phases séparées par un seul artefact. Phase 1, en Python, on construit le bundle depuis un identifiant Hugging Face ou un checkpoint local :
trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundleLe bundle contient les moteurs TensorRT et les ressources propres au modèle nécessaires à l'exécution. Phase 2, en C++, l'application le charge et travaille avec des entrées et sorties au niveau de la tâche :
#include <trtmc/pipeline.h>
auto pipeline = trtmc::load("qwen3-0.6b.bundle");
auto result = pipeline->generate("Explain why native inference matters.",
{.max_new_tokens = 20});
std::cout << result.text << std::endl;Model Connect prend en charge la correspondance des poids du checkpoint, la construction des moteurs TensorRT, le prétraitement, l'orchestration à l'exécution et le post-traitement. Python sert à préparer le modèle ; le binaire déployé tourne sans PyTorch ni interpréteur Python.
Ce que ça change
Pour une application native — bureau, périphérie, service embarqué — la dépendance Python disparaît du livrable, et avec elle une bonne part du poids d'image et des soucis d'environnement.
Deux niveaux d'API cohabitent, sur les mêmes implémentations :
- l'API sémantique, qui parle en prompts, images ou audio, et laisse Model Connect gérer le pré et le post-traitement ;
- l'API au niveau des modules, pour manipuler directement des tenseurs nommés et les composants TensorRT quand il faut personnaliser le pipeline.
On commence donc par l'interface de haut niveau, et on descend seulement là où c'est nécessaire. Pour un noyau GPU maison, TVM FFI permet de remplacer une portion ciblée du modèle pendant que TensorRT exécute le reste du pipeline, sans reconstruire l'application autour d'un autre runtime.
Trois limites à garder en tête : le projet vise le matériel NVIDIA, il ne couvre que les modèles pour lesquels une implémentation de référence existe, et il est publié en versions nocturnes, développé en grande partie avec des agents de code — ce que NVIDIA annonce explicitement plutôt que de le taire. Model Connect n'est pas un nouveau framework d'inférence : c'est un pont vers TensorRT.