veilletech.fr
4 sept. Feed du jour
#10 LLM Article

Répartir l'inférence sur vos autres machines

Deux machines qui dorment valent mieux qu'une carte de plus.

NVIDIA publie PAIR, un routeur d'inférence qui distribue les requêtes d'un agent sur les machines du réseau local sans rien changer à l'agent : il se substitue à Ollama ou LM Studio sur leur port par défaut et choisit un nœud appairé disposant du modèle demandé. Démonstration : cinq sous-agents en 18 minutes sur un portable, 8 min 48 s sur trois machines.

3 min de lectureavancévidéo 1:15
Partager
Sommaire5 sections
  1. Le problème
  2. Comment ça marche
  3. L'ordre de grandeur annoncé
  4. Les limites, qui comptent autant
  5. À retenir

Le problème

Un agent qui délègue à cinq sous-agents ne fait plus un appel de modèle, il en fait des dizaines — indépendants les uns des autres. S'ils visent tous le même moteur local, ils se disputent les mêmes créneaux d'exécution : la file s'allonge sur la machine principale pendant qu'un portable ou une station voisine ne fait rien.

NVIDIA PAIR (Personal AI Router) est un routeur d'inférence qui répartit ces requêtes sur les machines du réseau local. La bêta existe pour Windows, macOS et Linux, en interface graphique et en terminal.

Comment ça marche

Ce n'est pas un moteur d'inférence : Ollama ou LM Studio exécutent toujours le modèle. PAIR se place devant eux et prend leur port par défaut (configurable), ce qui lui permet de proxifier des API que les harnais connaissent déjà — aucune modification côté agent, qui ne voit qu'une seule connexion.

Le trajet d'une requête :

  1. découverte des machines en mDNS (ou ajout par adresse IP), appairage approuvé manuellement, communications chiffrées en mTLS ;
  2. PAIR inspecte le moteur et le modèle demandés ;
  3. il filtre les nœuds appairés : en ligne, moteur activé, modèle exactement présent, charge courante et utilisation GPU acceptables ;
  4. il en choisit un seul, qui exécute la requête de bout en bout ;
  5. la réponse repart par la même interface locale, et la vue Jobs indique quel nœud a traité quoi.

Les modèles n'ont pas besoin d'être identiques partout : charger le même tag sur plusieurs machines élargit simplement le vivier éligible.

L'ordre de grandeur annoncé

Démonstration avec Hermes Desktop (5 sous-agents) et Ollama, modèle Qwen 3.6 35B A3B :

Configuration Durée moyenne
1 portable RTX Spark 18 min
RTX Spark + DGX Spark + RTX 5090 8 min 48 s

NVIDIA le précise sans détour : démonstration spécifique à une configuration, pas un banc d'essai, pas une promesse de mise à l'échelle linéaire.

Les limites, qui comptent autant

Matériel compatible : GeForce RTX série 20 et plus, RTX PRO (architecture Turing et suivantes), DGX Spark, et Apple Silicon M4+.

À retenir

  1. Le gain est la concurrence entre requêtes, pas la vitesse d'une requête. C'est exactement le profil d'une exécution multi-agents.
  2. Rien à changer dans le harnais : PAIR parle les API d'Ollama et de LM Studio, sur leur port habituel.
  3. Le code est ouvert — github.com/NVIDIA/Personal-AI-Router — et la vue Jobs sert de preuve : tant qu'elle ne montre pas de travail sur plusieurs nœuds, il n'y a pas d'exécution répartie.

Source : NVIDIA Developer