Ce qui se passe
Aleph Alpha publie Kolibri, un modèle anglais-allemand à mélange d'experts :
78,1 milliards de paramètres au total, 3,46 milliards actifs par jeton. Les
poids sont sur Hugging Face, Aleph-Alpha/Kolibri-1, sous licence
Apache 2.0, usage commercial compris. L'éditeur le destine aux secteurs
réglementés — administration, industrie, aéronautique — qui veulent
l'héberger eux-mêmes.
Une architecture taillée pour le coût de service
| Kolibri | |
|---|---|
| Couches | 50, toutes MoE, 1 expert partagé |
| Experts | 384, dont 6 actifs par jeton |
| Attention | fenêtre glissante de 512 jetons, complète une couche sur cinq |
| Contexte | 262 144 jetons, extensible à 1 048 576 |
| Vocabulaire | 128 000, tokenizer bilingue |
| Raisonnement | quatre niveaux : none, low, medium, high |
| Connaissances | jusqu'au 18 juin 2026 |
La taille a été choisie pour le service, pas pour le score : une variante à 123 milliards faisait mieux, mais ne tenait que 3 requêtes de 256 000 jetons en parallèle sur deux H100. Kolibri en tient 18, et décode 28 % plus vite. Les 40 couches à fenêtre glissante gardent la mémoire du décodage bornée, quelle que soit la longueur du contexte.
L'entraînement a consommé 20 000 milliards de jetons en 21 jours sur 768 GPU B200, dont 21,3 % d'allemand, suivis d'une phase à 64k puis d'une adaptation au contexte long à 256k.
Ce qu'il vaut, selon ses auteurs
Face à Qwen3.6-35B-A3B, de taille active comparable, Kolibri ne gagne pas partout :
| Banc d'essai | Kolibri | Qwen3.6-35B-A3B |
|---|---|---|
| AIME 2025 | 96,9 | 84,6 |
| LiveCodeBench v6 | 85,9 | 82,5 |
| SWE-Bench Verified | 66,4 | 73,8 |
| BFCL v4 | 61,4 | 67,2 |
Le modèle a aussi été entraîné à s'abstenir quand le document fourni ne contient pas la réponse : sur AA-Omniscience, il se tait au lieu de répondre faux dans 44 % des cas, contre 14,8 % pour la génération précédente et 56,7 % pour Qwen3.6. Tous ces chiffres sortent de l'outil d'évaluation d'Aleph Alpha.
Comment s'y prendre
Kolibri passe par vLLM et le plugin aleph-alpha-inference, qui installe la
version de vLLM qu'il prend en charge. Une image est aussi publiée :
ghcr.io/aleph-alpha/aleph-alpha-inference.
pip install "aleph-alpha-inference>=1.0"
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choiceAu-delà de 262 144 jetons, ajouter
--max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'.
Échantillonnage recommandé : temperature=1.0, top_p=0.97, top_k=128.
Les limites
- 3 milliards actifs, mais 78 milliards à charger : en 16 bits, environ 156 Go de poids, d'après le seul nombre de paramètres, cache KV non compris.
- La publication ne documente que vLLM ; elle ne mentionne ni llama.cpp ni Ollama.
- Le français n'a pas fait l'objet d'une spécialisation.
Source : Kolibri: A Sovereign Open-Weight Model, Aleph Alpha, 3 octobre 2026. Rapport technique : tech-report.pdf.