veilletech.fr
1 oct. Feed du jour
#10 LLM Article

Magnitude compile ses kernels sur votre machine

Deux fois plus rapide, dit la vitrine. Votre propre mesure dira le reste.

Magnitude, moteur d'inférence open source (Apache 2.0) lancé sur Hacker News, compile et règle ses kernels sur la machine de l'utilisateur au lieu de livrer des binaires génériques. L'éditeur annonce un décodage 92 % plus rapide que llama.cpp sur Metal et 19 % sur CUDA — des mesures non vérifiées de façon indépendante.

2 min de lectureintermédiairevidéo 1:22
Partager
Sommaire5 sections
  1. Ce qui se passe
  2. Le mécanisme
  3. Les chiffres annoncés
  4. Comment s'y prendre
  5. À retenir

Ce qui se passe

Magnitude s'est présenté le 30 septembre sur Hacker News, dans un Launch HN de la promotion d'été 2025 de Y Combinator : un moteur d'inférence open source, sous licence Apache 2.0, pour faire tourner des modèles ouverts en local derrière un agent de code. L'application de bureau existe pour macOS, Linux et Windows, et embarque la commande magnitude.

Le mécanisme

llama.cpp, Ollama ou LM Studio livrent des kernels précompilés pour de larges familles de matériel. Magnitude compile et règle les siens sur la machine, avant de lancer un modèle, pour la puce exacte. L'équipe écrit aussi des kernels à la main pour les familles de modèles ouverts les plus répandues, listées sur magnitude.dev/models. Les sessions simultanées partagent leur cache de préfixe, et la mémoire d'un agent est rendue quand il s'arrête. Côté matériel : Apple Silicon, GPU NVIDIA ou AMD, ou processeur seul.

Les chiffres annoncés

Face à llama.cpp Préremplissage Décodage
Metal +9 % +92 %
CUDA +23 % +19 %

S'y ajoutent 27 % de mémoire en moins par agent. Ce sont les mesures de l'éditeur, et la page du dépôt ne précise ni le modèle, ni la quantification, ni la machine. Le « jusqu'à deux fois plus rapide » de l'accroche ne vaut que pour le décodage sur Metal.

Comment s'y prendre

Installer l'application, choisir un modèle recommandé, puis connecter l'agent. Un clic suffit pour Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline ; les autres passent par l'API compatible OpenAI. Une fois le modèle téléchargé, rien ne sort de la machine.

Avant de quitter llama.cpp, le seul test qui compte : même modèle, même quantification, même taille de contexte, et les jetons par seconde des deux côtés, en préremplissage comme en décodage.

Source : magnitudedev/magnitude, dépôt GitHub, présenté sur Hacker News le 30 septembre 2026.