Ce qui se passe
Un agent passe son temps à trancher : ce ticket est-il urgent, quelle équipe doit le prendre, quelle gravité lui donner. Le faire écrire à un LLM, puis parser la réponse, coûte cher en latence et varie d'un appel à l'autre. Les modèles de décision, popularisés il y a quelques semaines par Jev de Typesafe AI, répondent à ce cas : des sorties bornées et typées, accompagnées de probabilités.
Cloudflare publie les siens, Clef et Clef-flash, hébergés sur Workers AI et surtout distribués en poids ouverts sous licence Apache 2.0 : Cloudflare/clef et Cloudflare/clef-flash. L'API reprend celle de Jev : passer de l'un à l'autre se fait sans réécriture.
Comment ça marche
On envoie un état — le contexte — et des questions de trois types : oui/non, choix dans une liste, score sur une échelle. Le modèle ne génère pas de texte. Il fait une seule passe de lecture (prefill) sur un Qwen gelé, puis note en parallèle chaque réponse que le schéma autorise, à partir des représentations internes du modèle. Pas de décodage jeton par jeton, d'où la vitesse.
La base est un Qwen3.8-27B pour Clef, un Qwen3.5-9B pour Clef-flash. Cloudflare a entraîné une tête de routage et des adaptateurs LoRA de rang 256, avec une perte de Brier pour calibrer les probabilités et une phase de renforcement maison, RLCD.
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "La facture de septembre a été débitée deux fois.",
"questions": {
"team": {
"type": "choice",
"instructions": "Quelle équipe doit traiter la demande ?",
"criteria": { "billing": "Paiements", "technical": "Pannes", "sales": "Offres" }
}
}
}'Les chiffres annoncés
| Clef | Clef-flash | Jev | |
|---|---|---|---|
| Latence médiane | 209,3 ms | 38,8 ms | 524,1 ms |
| Latence p95 | 238,6 ms | 122,4 ms | 536,0 ms |
| BANKING77 (macro-F1) | 94,20 | 90,93 | 79,74 |
| CLINC150+OOS (macro-F1) | 97,43 | 66,77 | 89,27 |
| When2Call (exactitude) | 72,37 | 65,58 | 80,97 |
Clef accepte aussi des images et 64k jetons de contexte, contre 32k pour Jev. Sur une tâche interne de classement de domaines, Cloudflare mesure 2,2 s contre 4,7 s pour gpt-oss-120b, avec plus de catégories en sortie.
Les limites
Tous ces résultats viennent de Cloudflare, sur des bancs qu'il a choisis. Jev reste devant sur When2Call ou BRIGHT, et Kev 9B sur PhishNChips. Le fine-tuning par renforcement annoncé passe d'abord par l'équipe de Cloudflare, en accompagnement ; la version en libre-service viendra plus tard.
Comment s'y prendre
Repérer, dans vos agents, les étapes qui ne font que classer ou aiguiller. Tester Clef-flash sur Workers AI pour la latence, ou télécharger les poids et mesurer sur votre matériel : en BF16, les poids d'un 9B occupent environ 18 Go, ceux d'un 27B le triple.
Source : Clef: Open-weight decision models, and new RL fine-tuning platform, Cloudflare Blog, 1er octobre 2026.