Le problème
Un agent qui délègue à cinq sous-agents ne fait plus un appel de modèle, il en fait des dizaines — indépendants les uns des autres. S'ils visent tous le même moteur local, ils se disputent les mêmes créneaux d'exécution : la file s'allonge sur la machine principale pendant qu'un portable ou une station voisine ne fait rien.
NVIDIA PAIR (Personal AI Router) est un routeur d'inférence qui répartit ces requêtes sur les machines du réseau local. La bêta existe pour Windows, macOS et Linux, en interface graphique et en terminal.
Comment ça marche
Ce n'est pas un moteur d'inférence : Ollama ou LM Studio exécutent toujours le modèle. PAIR se place devant eux et prend leur port par défaut (configurable), ce qui lui permet de proxifier des API que les harnais connaissent déjà — aucune modification côté agent, qui ne voit qu'une seule connexion.
Le trajet d'une requête :
- découverte des machines en mDNS (ou ajout par adresse IP), appairage approuvé manuellement, communications chiffrées en mTLS ;
- PAIR inspecte le moteur et le modèle demandés ;
- il filtre les nœuds appairés : en ligne, moteur activé, modèle exactement présent, charge courante et utilisation GPU acceptables ;
- il en choisit un seul, qui exécute la requête de bout en bout ;
- la réponse repart par la même interface locale, et la vue Jobs indique quel nœud a traité quoi.
Les modèles n'ont pas besoin d'être identiques partout : charger le même tag sur plusieurs machines élargit simplement le vivier éligible.
L'ordre de grandeur annoncé
Démonstration avec Hermes Desktop (5 sous-agents) et Ollama, modèle Qwen 3.6 35B A3B :
| Configuration | Durée moyenne |
|---|---|
| 1 portable RTX Spark | 18 min |
| RTX Spark + DGX Spark + RTX 5090 | 8 min 48 s |
NVIDIA le précise sans détour : démonstration spécifique à une configuration, pas un banc d'essai, pas une promesse de mise à l'échelle linéaire.
Les limites, qui comptent autant
- PAIR ne fusionne pas les GPU et ne met pas la VRAM en commun ;
- il ne découpe pas une requête : une inférence vit sur un nœud, du début à la fin. Un modèle trop gros pour une machine le reste ;
- une tâche séquentielle, ou dominée par un seul long appel, n'y gagne rien ;
- si un seul nœud possède le modèle demandé, il n'y a rien à répartir.
Matériel compatible : GeForce RTX série 20 et plus, RTX PRO (architecture Turing et suivantes), DGX Spark, et Apple Silicon M4+.
À retenir
- Le gain est la concurrence entre requêtes, pas la vitesse d'une requête. C'est exactement le profil d'une exécution multi-agents.
- Rien à changer dans le harnais : PAIR parle les API d'Ollama et de LM Studio, sur leur port habituel.
- Le code est ouvert — github.com/NVIDIA/Personal-AI-Router — et la vue Jobs sert de preuve : tant qu'elle ne montre pas de travail sur plusieurs nœuds, il n'y a pas d'exécution répartie.
Source : NVIDIA Developer