veilletech.fr
4 oct. Feed du jour
#03 LLM Article

Kolibri : un MoE de 78B à 3B actifs, sous Apache 2.0

Trois milliards au travail. Soixante-dix-huit en mémoire.

Aleph Alpha publie Kolibri, un mélange d'experts anglais-allemand de 78 milliards de paramètres dont 3 actifs par jeton, sous licence Apache 2.0. Pensé pour coûter peu à servir — 18 requêtes longues en parallèle sur deux H100, contre 3 pour une variante à 123 milliards — il se lance avec vLLM et un plugin dédié, et accepte jusqu'à un million de jetons de contexte.

3 min de lectureavancévidéo 1:20
Partager
Sommaire6 sections
  1. Ce qui se passe
  2. Une architecture taillée pour le coût de service
  3. Ce qu'il vaut, selon ses auteurs
  4. Comment s'y prendre
  5. Les limites
  6. À retenir

Ce qui se passe

Aleph Alpha publie Kolibri, un modèle anglais-allemand à mélange d'experts : 78,1 milliards de paramètres au total, 3,46 milliards actifs par jeton. Les poids sont sur Hugging Face, Aleph-Alpha/Kolibri-1, sous licence Apache 2.0, usage commercial compris. L'éditeur le destine aux secteurs réglementés — administration, industrie, aéronautique — qui veulent l'héberger eux-mêmes.

Une architecture taillée pour le coût de service

Kolibri
Couches 50, toutes MoE, 1 expert partagé
Experts 384, dont 6 actifs par jeton
Attention fenêtre glissante de 512 jetons, complète une couche sur cinq
Contexte 262 144 jetons, extensible à 1 048 576
Vocabulaire 128 000, tokenizer bilingue
Raisonnement quatre niveaux : none, low, medium, high
Connaissances jusqu'au 18 juin 2026

La taille a été choisie pour le service, pas pour le score : une variante à 123 milliards faisait mieux, mais ne tenait que 3 requêtes de 256 000 jetons en parallèle sur deux H100. Kolibri en tient 18, et décode 28 % plus vite. Les 40 couches à fenêtre glissante gardent la mémoire du décodage bornée, quelle que soit la longueur du contexte.

L'entraînement a consommé 20 000 milliards de jetons en 21 jours sur 768 GPU B200, dont 21,3 % d'allemand, suivis d'une phase à 64k puis d'une adaptation au contexte long à 256k.

Ce qu'il vaut, selon ses auteurs

Face à Qwen3.6-35B-A3B, de taille active comparable, Kolibri ne gagne pas partout :

Banc d'essai Kolibri Qwen3.6-35B-A3B
AIME 2025 96,9 84,6
LiveCodeBench v6 85,9 82,5
SWE-Bench Verified 66,4 73,8
BFCL v4 61,4 67,2

Le modèle a aussi été entraîné à s'abstenir quand le document fourni ne contient pas la réponse : sur AA-Omniscience, il se tait au lieu de répondre faux dans 44 % des cas, contre 14,8 % pour la génération précédente et 56,7 % pour Qwen3.6. Tous ces chiffres sortent de l'outil d'évaluation d'Aleph Alpha.

Comment s'y prendre

Kolibri passe par vLLM et le plugin aleph-alpha-inference, qui installe la version de vLLM qu'il prend en charge. Une image est aussi publiée : ghcr.io/aleph-alpha/aleph-alpha-inference.

Terminal
pip install "aleph-alpha-inference>=1.0"

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Au-delà de 262 144 jetons, ajouter --max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'. Échantillonnage recommandé : temperature=1.0, top_p=0.97, top_k=128.

Les limites

Source : Kolibri: A Sovereign Open-Weight Model, Aleph Alpha, 3 octobre 2026. Rapport technique : tech-report.pdf.