veilletech.fr
18 sept. Feed du jour
#09 IA Article

27 milliards de paramètres en 5,9 Go

Le jour où un 27B tient dans la mémoire d'une carte grand public, la question n'est plus la taille du modèle mais celle de votre tâche.

PrismML publie Ternary Bonsai 2 27B, une compression ternaire de Qwen3.8 27B qui tient en 5,9 Go et conserve 98,2 % de la performance agrégée du modèle en pleine précision. Licence Apache 2.0, contexte de 262 000 tokens, entrée multimodale.

2 min de lectureintermédiairevidéo 1:19
Partager
Sommaire4 sections
  1. Ce qui se passe
  2. Le chiffre, et son détail
  3. Débit et consommation
  4. À retenir

Ce qui se passe

PrismML publie Ternary Bonsai 2 27B, deuxième génération de sa série de modèles compressés. Le principe : des poids ternaires — chaque poids ne vaut que −1, 0 ou +1 — accompagnés d'une mise à l'échelle FP16 par groupe. Cela donne 1,76 bit effectif par poids, et un modèle complet de 5,9 Go. La représentation basse précision est appliquée de bout en bout sur le modèle de langage.

Le modèle de départ est Qwen3.8 27B. Le résultat garde une fenêtre de contexte de 262 000 tokens, une entrée multimodale texte et image, et une licence Apache 2.0.

Le chiffre, et son détail

Plus de 9× plus petit que le modèle en pleine précision, pour 98,2 % de la performance agrégée conservée.

Domaine Bonsai 2 27B Qwen3.8 27B Qwen3.6 27B
Agentique et appel d'outils (τ²-bench, BFCLv3) 77,57 79,74 80,05
Code (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench) 81,58 82,17 82,57
Suivi d'instructions (IFBench, IFEval) 82,66 81,25 74,53
Connaissances et raisonnement (MMLU-Redux, GPQA Diamond, AA-LCR) 83,95 86,66 84,71
Mathématiques (AIME 2026 et 2025, GSM8K, MATH-500) 96,57 97,06 94,64
Vision (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2) 78,59 81,64 79,82
Global 83,9 85,4 83,6

Le tableau dit deux choses que la moyenne cache. D'abord, la compression gagne sur le suivi d'instructions. Ensuite, elle perd le plus là où PrismML met justement en avant son usage : −2,2 points sur l'agentique et −3 points sur la vision. Ce sont les domaines où de petites erreurs se cumulent sur de longues séquences d'actions, ce que l'article reconnaît explicitement.

Débit et consommation

C'est la mesure qui compte pour l'usage visé : boucles d'édition et de débogage d'un agent de code, analyse de documents privés, orchestration hybride où le modèle local traite le sensible et n'escalade vers le nuage qu'au besoin.

Source : Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint, PrismML, 17 septembre 2026.