Ce qui se passe
Tencent a publié Hy4 Preview, un modèle à poids ouverts, texte seul — pas d'entrée image.
| Hy4 Preview (29/08) | Hy3 (juillet) | |
|---|---|---|
| Paramètres totaux | 770 B | 295 B |
| Paramètres actifs | 49 B | 21 B |
| Fenêtre de contexte | 1 000 000 tokens | 256 000 tokens |
| Poids sur Hugging Face | 1,56 To | 598 Go |
Six semaines séparent les deux : la taille a plus que doublé, le contexte a quadruplé.
Ce qu'on apprend du template
Simon Willison lit le
chat_template.jinja
plutôt que la fiche marketing, et c'est une bonne habitude à prendre : le
template dit ce que le modèle accepte réellement.
Ici, reasoning_effort n'admet que deux valeurs, high (par défaut) et
no_think. Toute autre valeur lève une exception. Il n'y a donc pas de curseur
de raisonnement graduel : c'est activé ou désactivé.
Ce que ça change
L'écart entre paramètres totaux et actifs est ce qui rend l'objet servable : à chaque token, seule une fraction du réseau s'active, et le coût d'inférence suit les 49 milliards actifs, pas les 770 milliards. Mais les poids, eux, doivent tenir en mémoire dans leur intégralité.
1,56 To, ce n'est pas une machine de développeur. Même quantifié agressivement, on reste sur plusieurs cartes de qualité serveur. La distinction est nette avec les modèles qu'on installe chez soi : celui-ci se teste via OpenRouter avant d'écrire la moindre ligne d'intégration.
Et « poids ouverts » ne dit rien de l'usage autorisé : la licence se lit sur la fiche Hugging Face, avant tout projet en production.
Source : Simon Willison (en anglais).