veilletech.fr
2 oct. Feed du jour
#06 IA Article

Clef : des modèles de décision en Apache 2.0

Pour choisir entre trois réponses, inutile d'en écrire une.

Cloudflare publie Clef et Clef-flash, deux modèles de décision qui renvoient des probabilités sur des questions typées (oui/non, choix, score) au lieu de générer du texte. Poids ouverts sous Apache 2.0 sur Hugging Face, API compatible Jev, hébergement sur Workers AI. Latence médiane annoncée : 209 ms et 39 ms, contre 524 ms pour Jev — des chiffres de l'éditeur.

3 min de lectureintermédiairevidéo 1:15
Partager
Sommaire6 sections
  1. Ce qui se passe
  2. Comment ça marche
  3. Les chiffres annoncés
  4. Les limites
  5. Comment s'y prendre
  6. À retenir

Ce qui se passe

Un agent passe son temps à trancher : ce ticket est-il urgent, quelle équipe doit le prendre, quelle gravité lui donner. Le faire écrire à un LLM, puis parser la réponse, coûte cher en latence et varie d'un appel à l'autre. Les modèles de décision, popularisés il y a quelques semaines par Jev de Typesafe AI, répondent à ce cas : des sorties bornées et typées, accompagnées de probabilités.

Cloudflare publie les siens, Clef et Clef-flash, hébergés sur Workers AI et surtout distribués en poids ouverts sous licence Apache 2.0 : Cloudflare/clef et Cloudflare/clef-flash. L'API reprend celle de Jev : passer de l'un à l'autre se fait sans réécriture.

Comment ça marche

On envoie un état — le contexte — et des questions de trois types : oui/non, choix dans une liste, score sur une échelle. Le modèle ne génère pas de texte. Il fait une seule passe de lecture (prefill) sur un Qwen gelé, puis note en parallèle chaque réponse que le schéma autorise, à partir des représentations internes du modèle. Pas de décodage jeton par jeton, d'où la vitesse.

La base est un Qwen3.8-27B pour Clef, un Qwen3.5-9B pour Clef-flash. Cloudflare a entraîné une tête de routage et des adaptateurs LoRA de rang 256, avec une perte de Brier pour calibrer les probabilités et une phase de renforcement maison, RLCD.

Terminal
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "La facture de septembre a été débitée deux fois.",
    "questions": {
      "team": {
        "type": "choice",
        "instructions": "Quelle équipe doit traiter la demande ?",
        "criteria": { "billing": "Paiements", "technical": "Pannes", "sales": "Offres" }
      }
    }
  }'

Les chiffres annoncés

Clef Clef-flash Jev
Latence médiane 209,3 ms 38,8 ms 524,1 ms
Latence p95 238,6 ms 122,4 ms 536,0 ms
BANKING77 (macro-F1) 94,20 90,93 79,74
CLINC150+OOS (macro-F1) 97,43 66,77 89,27
When2Call (exactitude) 72,37 65,58 80,97

Clef accepte aussi des images et 64k jetons de contexte, contre 32k pour Jev. Sur une tâche interne de classement de domaines, Cloudflare mesure 2,2 s contre 4,7 s pour gpt-oss-120b, avec plus de catégories en sortie.

Les limites

Tous ces résultats viennent de Cloudflare, sur des bancs qu'il a choisis. Jev reste devant sur When2Call ou BRIGHT, et Kev 9B sur PhishNChips. Le fine-tuning par renforcement annoncé passe d'abord par l'équipe de Cloudflare, en accompagnement ; la version en libre-service viendra plus tard.

Comment s'y prendre

Repérer, dans vos agents, les étapes qui ne font que classer ou aiguiller. Tester Clef-flash sur Workers AI pour la latence, ou télécharger les poids et mesurer sur votre matériel : en BF16, les poids d'un 9B occupent environ 18 Go, ceux d'un 27B le triple.

Source : Clef: Open-weight decision models, and new RL fine-tuning platform, Cloudflare Blog, 1er octobre 2026.