veilletech.fr
18 sept.

Source · 31 jours de veille

GitHub

Ce qui a été retenu de cette source, et sur quels thèmes. Chaque fiche est une synthèse originale et renvoie à l'article d'origine.

6fiches
6jours sur 31
15min de lecture
IA & LLM · Outils & méthode · Langages & OSthèmes

CUDA sur AMD : ZLUDA tient, cuDNN manque

Un dépôt publié le 13 septembre assemble ZLUDA, le SDK HIP 6.4 d'AMD et LibTorch pour exécuter des applications CUDA sur GPU AMD sous Windows, avec un script d'installation PowerShell. La couverture s'arrête à cuBLAS, cuBLASLt, cuSPARSE et cuFFT : cuDNN, NCCL et TensorRT restent hors périmètre.

14 sept.2 min

IA

Kimi K3 tourne sur un MacBook, à 1 token/s

Le fork ARGODRIVE Deltafin fait tourner Kimi K3 — 2,8 T de paramètres MoE, 1,45 To de poids d'experts, sans aucun élagage — sur un seul MacBook Pro M5 Max de 128 Go, les experts étant lus depuis quatre SSD. Mesure du 8 septembre 2026 : 1,0015 token/s en décodage stable sur 512 tokens, mais environ 376 s avant le premier token, le préremplissage relisant huit fois les experts de chaque couche. L'enseignement le plus utile est ailleurs : la vitesse dépend de la plus lente des seize lectures par couche, pas de la bande passante cumulée.

9 sept.3 min

LLM

Apache Maka publie ses scores, pas ses promesses

Apache Maka, en incubation à l'ASF, est un harnais d'agent qui se juge sur une seule mesure : le nombre de tâches terminées et leur coût, comparé aux autres harnais sur le même modèle avec le vérificateur officiel, résultats par tâche publiés. Son principe de conception est que le journal est le runtime — chaque message, appel d'outil et décision de permission est un RuntimeEvent append-only dont l'interface et le prompt suivant ne sont que des projections. Tout reste local et le modèle est le vôtre.

5 sept.3 min

OUTILS

104 Go de modèle sur un Mac de 48 Go

slotstream est un binaire Swift qui exécute Qwen3.8-Flash-Next (125 Md de paramètres, MoE, 103,8 Go de poids en 4 bits) sur un Mac dont la mémoire ne suffit pas, en streamant les experts depuis le SSD. Environ 12 tok/s sur un M5 Pro de 48 Go, avec 32 Go de pic mémoire, et une API compatible Ollama et OpenAI.

2 sept.2 min

LLM

Un commit, une pull request, empilées

maiao ajoute une commande git review qui transforme chaque commit d'une branche en pull request distincte, empilée sur la précédente. Le suivi repose sur les Change-Id de Gerrit, stables à travers les rebases, ce qui permet à l'outil de rebaser la pile automatiquement à chaque fusion.

26 août3 min

OUTILS

Un binaire statique qui charge le pilote GPU

SoLo permet à un binaire Linux entièrement statique, lié à musl, de charger les pilotes GPU de l'hôte compilés contre la glibc — via son propre chargeur ELF et un pont d'ABI. Une preuve Vulkan de bout en bout accompagne le projet.

20 août2 min

LINUX