Ce qui se passe
Kimi K3 est un modèle MoE de 2 800 milliards de paramètres, dont
1,45 To de poids d'experts. Moonshot le destine à une infrastructure de l'ordre
de 16 nœuds et 4,8 To de mémoire vidéo agrégée. ARGODRIVE Deltafin, un fork de
gavamedia/deltafin (MIT), le fait tourner sur un seul MacBook Pro M5 Max de
128 Go, les experts étant diffusés depuis quatre SSD.
La règle que les auteurs se fixent est ce qui rend les chiffres lisibles : rien n'est élagué, les 16 experts participent à chaque token, et les poids sont exactement ceux publiés par Moonshot. Un petit modèle brouillon peut proposer des suites — c'est de là que vient une partie de la vitesse — mais K3 valide ou rejette chaque proposition.
Les mesures
Relevées le 8 septembre 2026, chacune sur une exécution à froid avec le prompt
exact, journaux publiés dans k3-public-bench/results/ :
| Test | Sans brouillon | Avec brouillon |
|---|---|---|
| Décodage stable, 512 tokens générés | 0,9232 tok/s | 1,0015 tok/s |
| Décodage stable, 128 tokens générés | 0,9261 | 1,1252 |
| Prompt public de 17 tokens (amont : 0,684) | — | 0,9631 |
| Temps jusqu'au premier token, prompt de 512 | ≈376 s | ≈375 s |
Pour situer : la version amont, sur un portable M1 Max, plafonne à 0,2901 tok/s, après être partie de 0,0141 tok/s le 27 juillet 2026.
Le résultat le plus utile
Ce n'est pas le débit, c'est l'échelle des disques. Sur les mêmes prompts, un seul SSD donne ≈52 % de la vitesse obtenue avec quatre, deux miroirs complets ≈73 %, trois ≈90 %.
La courbe ne suit donc pas la bande passante cumulée. Chaque couche déclenche 16 lectures d'experts, et c'est la plus lente de ces 16 qui fixe le rythme. Ajouter un quatrième disque ne rapporte que 10 % parce qu'à ce stade on n'achète plus du débit, on achète la réduction du pire cas de latence.
Pour qui construit une machine d'inférence locale, cette forme de courbe est une donnée de dimensionnement plus utile qu'un chiffre de débit : elle dit où s'arrête l'intérêt d'ajouter du stockage.
La limite, annoncée par les auteurs
Elle est mise en tête du dépôt, sous l'intitulé the honest limit : un prompt de 512 tokens demande environ 6,3 minutes avant le premier token. La cause est identifiée — la phase de préremplissage relit huit fois les experts de chaque couche — le correctif est prévu, mais il n'est pas écrit.
Les auteurs situent aussi leur travail par rapport aux projets concurrents qui annoncent K3 « plus vite » : ceux-ci réencodent la banque d'experts autour de 3 bits. C'est une ingénierie valable, vers un autre but, mais les poids ne sont plus ceux publiés, et personne — pas même Moonshot — n'a mesuré ce que ce compromis coûte en qualité.
À retenir
Le projet se présente lui-même comme une expérience, pas un produit : « faire tenir des modèles de frontière sur une installation à 15 000 dollars plutôt que sur une infrastructure à 2 millions ». Chaque nombre correspond à une exécution à froid, avec ses journaux et ses manifestes de placement, ce qui le rend reproductible et critiquable — c'est ce qui le distingue d'une annonce de performance.
Source : ARGODRIVE Deltafin