Ce qui se passe
PrismML publie Ternary Bonsai 2 27B, deuxième génération de sa série de modèles compressés. Le principe : des poids ternaires — chaque poids ne vaut que −1, 0 ou +1 — accompagnés d'une mise à l'échelle FP16 par groupe. Cela donne 1,76 bit effectif par poids, et un modèle complet de 5,9 Go. La représentation basse précision est appliquée de bout en bout sur le modèle de langage.
Le modèle de départ est Qwen3.8 27B. Le résultat garde une fenêtre de contexte de 262 000 tokens, une entrée multimodale texte et image, et une licence Apache 2.0.
Le chiffre, et son détail
Plus de 9× plus petit que le modèle en pleine précision, pour 98,2 % de la performance agrégée conservée.
| Domaine | Bonsai 2 27B | Qwen3.8 27B | Qwen3.6 27B |
|---|---|---|---|
| Agentique et appel d'outils (τ²-bench, BFCLv3) | 77,57 | 79,74 | 80,05 |
| Code (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench) | 81,58 | 82,17 | 82,57 |
| Suivi d'instructions (IFBench, IFEval) | 82,66 | 81,25 | 74,53 |
| Connaissances et raisonnement (MMLU-Redux, GPQA Diamond, AA-LCR) | 83,95 | 86,66 | 84,71 |
| Mathématiques (AIME 2026 et 2025, GSM8K, MATH-500) | 96,57 | 97,06 | 94,64 |
| Vision (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2) | 78,59 | 81,64 | 79,82 |
| Global | 83,9 | 85,4 | 83,6 |
Le tableau dit deux choses que la moyenne cache. D'abord, la compression gagne sur le suivi d'instructions. Ensuite, elle perd le plus là où PrismML met justement en avant son usage : −2,2 points sur l'agentique et −3 points sur la vision. Ce sont les domaines où de petites erreurs se cumulent sur de longues séquences d'actions, ce que l'article reconnaît explicitement.
Débit et consommation
- Jusqu'à 143 tokens/s sur NVIDIA GeForce RTX 5090.
- 46,8 tokens/s sur M5 Max.
- 0,714 mWh par token sur RTX 4090, soit 40 % de mieux qu'un modèle 8B en pleine précision.
C'est la mesure qui compte pour l'usage visé : boucles d'édition et de débogage d'un agent de code, analyse de documents privés, orchestration hybride où le modèle local traite le sensible et n'escalade vers le nuage qu'au besoin.
Source : Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 17 septembre 2026.