veilletech.fr
9 sept. Feed du jour
#07 LLM Article

Kimi K3 tourne sur un MacBook, à 1 token/s

Un token par seconde, c'est lent. Le savoir mesuré, ça ne l'est pas.

Le fork ARGODRIVE Deltafin fait tourner Kimi K3 — 2,8 T de paramètres MoE, 1,45 To de poids d'experts, sans aucun élagage — sur un seul MacBook Pro M5 Max de 128 Go, les experts étant lus depuis quatre SSD. Mesure du 8 septembre 2026 : 1,0015 token/s en décodage stable sur 512 tokens, mais environ 376 s avant le premier token, le préremplissage relisant huit fois les experts de chaque couche. L'enseignement le plus utile est ailleurs : la vitesse dépend de la plus lente des seize lectures par couche, pas de la bande passante cumulée.

3 min de lectureavancévidéo 1:12
Partager
Sommaire5 sections
  1. Ce qui se passe
  2. Les mesures
  3. Le résultat le plus utile
  4. La limite, annoncée par les auteurs
  5. À retenir

Ce qui se passe

Kimi K3 est un modèle MoE de 2 800 milliards de paramètres, dont 1,45 To de poids d'experts. Moonshot le destine à une infrastructure de l'ordre de 16 nœuds et 4,8 To de mémoire vidéo agrégée. ARGODRIVE Deltafin, un fork de gavamedia/deltafin (MIT), le fait tourner sur un seul MacBook Pro M5 Max de 128 Go, les experts étant diffusés depuis quatre SSD.

La règle que les auteurs se fixent est ce qui rend les chiffres lisibles : rien n'est élagué, les 16 experts participent à chaque token, et les poids sont exactement ceux publiés par Moonshot. Un petit modèle brouillon peut proposer des suites — c'est de là que vient une partie de la vitesse — mais K3 valide ou rejette chaque proposition.

Les mesures

Relevées le 8 septembre 2026, chacune sur une exécution à froid avec le prompt exact, journaux publiés dans k3-public-bench/results/ :

Test Sans brouillon Avec brouillon
Décodage stable, 512 tokens générés 0,9232 tok/s 1,0015 tok/s
Décodage stable, 128 tokens générés 0,9261 1,1252
Prompt public de 17 tokens (amont : 0,684) 0,9631
Temps jusqu'au premier token, prompt de 512 ≈376 s ≈375 s

Pour situer : la version amont, sur un portable M1 Max, plafonne à 0,2901 tok/s, après être partie de 0,0141 tok/s le 27 juillet 2026.

Le résultat le plus utile

Ce n'est pas le débit, c'est l'échelle des disques. Sur les mêmes prompts, un seul SSD donne ≈52 % de la vitesse obtenue avec quatre, deux miroirs complets ≈73 %, trois ≈90 %.

La courbe ne suit donc pas la bande passante cumulée. Chaque couche déclenche 16 lectures d'experts, et c'est la plus lente de ces 16 qui fixe le rythme. Ajouter un quatrième disque ne rapporte que 10 % parce qu'à ce stade on n'achète plus du débit, on achète la réduction du pire cas de latence.

Pour qui construit une machine d'inférence locale, cette forme de courbe est une donnée de dimensionnement plus utile qu'un chiffre de débit : elle dit où s'arrête l'intérêt d'ajouter du stockage.

La limite, annoncée par les auteurs

Elle est mise en tête du dépôt, sous l'intitulé the honest limit : un prompt de 512 tokens demande environ 6,3 minutes avant le premier token. La cause est identifiée — la phase de préremplissage relit huit fois les experts de chaque couche — le correctif est prévu, mais il n'est pas écrit.

Les auteurs situent aussi leur travail par rapport aux projets concurrents qui annoncent K3 « plus vite » : ceux-ci réencodent la banque d'experts autour de 3 bits. C'est une ingénierie valable, vers un autre but, mais les poids ne sont plus ceux publiés, et personne — pas même Moonshot — n'a mesuré ce que ce compromis coûte en qualité.

À retenir

Le projet se présente lui-même comme une expérience, pas un produit : « faire tenir des modèles de frontière sur une installation à 15 000 dollars plutôt que sur une infrastructure à 2 millions ». Chaque nombre correspond à une exécution à froid, avec ses journaux et ses manifestes de placement, ce qui le rend reproductible et critiquable — c'est ce qui le distingue d'une annonce de performance.

Source : ARGODRIVE Deltafin