Ce qui se passe
Magnitude s'est présenté le 30 septembre sur Hacker News, dans un Launch HN de
la promotion d'été 2025 de Y Combinator : un moteur d'inférence open source,
sous licence Apache 2.0, pour faire tourner des modèles ouverts en local
derrière un agent de code. L'application de bureau existe pour macOS, Linux et
Windows, et embarque la commande magnitude.
Le mécanisme
llama.cpp, Ollama ou LM Studio livrent des kernels précompilés pour de larges familles de matériel. Magnitude compile et règle les siens sur la machine, avant de lancer un modèle, pour la puce exacte. L'équipe écrit aussi des kernels à la main pour les familles de modèles ouverts les plus répandues, listées sur magnitude.dev/models. Les sessions simultanées partagent leur cache de préfixe, et la mémoire d'un agent est rendue quand il s'arrête. Côté matériel : Apple Silicon, GPU NVIDIA ou AMD, ou processeur seul.
Les chiffres annoncés
| Face à llama.cpp | Préremplissage | Décodage |
|---|---|---|
| Metal | +9 % | +92 % |
| CUDA | +23 % | +19 % |
S'y ajoutent 27 % de mémoire en moins par agent. Ce sont les mesures de l'éditeur, et la page du dépôt ne précise ni le modèle, ni la quantification, ni la machine. Le « jusqu'à deux fois plus rapide » de l'accroche ne vaut que pour le décodage sur Metal.
Comment s'y prendre
Installer l'application, choisir un modèle recommandé, puis connecter l'agent. Un clic suffit pour Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline ; les autres passent par l'API compatible OpenAI. Une fois le modèle téléchargé, rien ne sort de la machine.
Avant de quitter llama.cpp, le seul test qui compte : même modèle, même quantification, même taille de contexte, et les jetons par seconde des deux côtés, en préremplissage comme en décodage.
Source : magnitudedev/magnitude, dépôt GitHub, présenté sur Hacker News le 30 septembre 2026.