Aller au contenu

Cloudflare Clef : des modèles à poids ouverts qui rendent des décisions

Clef (27B) et Clef-flash (9B) de Cloudflare répondent à des questions typées au lieu d'écrire du texte, avec une latence médiane de 209 ms et 39 ms, sous Apache 2.0.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
A screenshot of the Cloudflare/clef model page on Hugging Face, showing its tags, the Apache 2.0 license and the start of its model card.

En chiffres

parameters in Clef, built on Qwen 3.8-27B
27B
parameters in Clef-flash, built on Qwen 3.5-9B
9B
Clef-flash median latency
38.8 ms
token context window
64k
Median latency per decision
Clef-flash
38.8 ms
Clef
209.3 ms
Jev
524.1 ms

Cloudflare a publié le 1er octobre 2026 deux modèles de décision à poids ouverts, Clef et Clef-flash. Ils n'écrivent pas de texte. Ils lisent une entrée et répondent à un ensemble fixe de questions typées avec des probabilités. Cela permet à un agent d'IA de choisir rapidement sa prochaine étape. Selon l'annonce de Cloudflare, les deux sont téléchargeables gratuitement sous licence Apache 2.0 et tournent sur Workers AI, le service hébergé de Cloudflare.

Ce qu'est un modèle de décision

"Un modèle de décision effectue des classifications pour aider les agents à décider comment agir, sur la base de certaines probabilités", écrit Cloudflare. Un modèle de conversation produit une réponse un token à la fois. Clef saute cette étape. Cloudflare qualifie sa conception de non autorégressive. Autrement dit, il ne génère pas sa sortie mot par mot.

Traictory explique le mécanisme. Chaque modèle lit toute l'entrée en une seule passe, puis note chaque réponse possible en parallèle. Rien n'est généré, donc il n'y a pas de tokens de raisonnement à attendre.

C'est la même idée que celle de Jev de TypeSafe, un modèle fermé lancé le 15 septembre, et de Laya de Convai, un modèle ouvert de 421 millions de paramètres publié quatre jours plus tard. Clef apporte cette idée sur une plateforme hébergée que beaucoup de développeurs utilisent déjà.

Les deux modèles

ClefClef-flash
Paramètres27 milliards9 milliards
Modèle de baseQwen 3.8-27BQwen 3.5-9B
Latence médiane209,3 ms38,8 ms
Fenêtre de contexte64k tokens64k tokens
LicenceApache 2.0Apache 2.0

Cloudflare indique une latence au 95e centile de 122,4 ms pour Clef-flash. Cela signifie que 95 % de ses requêtes se sont terminées dans ce délai.

Les deux modèles reposent sur Qwen, la famille de modèles ouverts d'Alibaba. Selon Traictory, la base Qwen reste figée. Cloudflare a entraîné par-dessus de petites couches additionnelles, appelées adaptateurs de bas rang de rang 256.

Clef dispose aussi d'un encodeur de vision, il peut donc recevoir des images en entrée. Cloudflare présente cela comme une différence avec Jev, qui ne traite que du texte.

Vitesse et prix annoncés

Cloudflare affirme que les deux modèles divisent la latence par deux par rapport à gpt-oss-120b, un modèle ouvert d'OpenAI, dans ses propres tests de renseignement sur les menaces. L'entreprise dit avoir évalué les modèles sur 43 benchmarks.

Le prix a attiré l'attention. Traictory situe Clef à 0,24 dollar par million de tokens sur Workers AI, contre 0,042 dollar par million pour Jev. Clef est donc près de six fois plus cher par token. Traictory indique une latence médiane de 524,1 ms pour Jev, contre 209,3 ms pour Clef.

Pour l'usage hébergé, Cloudflare dit ne "pas lire, stocker ni utiliser vos requêtes pour l'entraînement". Les poids sont aussi sur Hugging Face. Une équipe peut donc les exécuter sur son propre matériel et éviter entièrement le prix au token. La même annonce présente une nouvelle plateforme d'affinage par apprentissage par renforcement pour entraîner ce type de modèles.

Les questions ouvertes

Selon Traictory, des commentateurs de Hacker News ont mis en doute à la fois le prix et la méthode des benchmarks. "Les benchmarks publics sont faciles à truquer", a écrit l'un d'eux. Traictory note aussi qu'"aucun test mené par un tiers n'est cité" pour les affirmations sur la qualité.

Traictory relève trois lacunes : une validation indépendante, des tests face à la version actuelle de Jev et des données issues d'un vrai usage en production. Rien de tout cela n'existe encore.

Ce que cela change pour les développeurs

Examinez les décisions que votre agent prend avant chaque étape. Router une requête, signaler un message ou choisir un outil sont autant de tâches de classification. Si un grand modèle de conversation s'en charge aujourd'hui, un modèle de décision pourrait faire passer cette étape de quelques secondes à quelques millisecondes.

Commencez par Clef-flash. Avec une médiane de 38,8 ms, il est assez rapide pour s'insérer dans le chemin de requête d'une application en ligne. Ne passez au modèle 27B que si vos propres tests montrent que le plus petit se trompe trop souvent.

Menez votre propre évaluation avant de changer. Les chiffres publiés viennent de Cloudflare, et aucun groupe extérieur ne les a reproduits. Prenez 200 à 500 vraies entrées dans vos journaux, étiquetez les bonnes réponses et comparez Clef avec ce que vous utilisez aujourd'hui.

Comparez les coûts dans les deux sens. Sur Workers AI, vous payez au token. Avec les poids sous Apache 2.0, vous payez plutôt vos propres GPU. Une étape de classification très sollicitée peut rendre l'auto-hébergement moins cher, et celui-ci garde les données en interne.

Sources

  1. Introducing Clef: our open-source decision models, and new RL fine-tuning platform - Cloudflare Blog
  2. Cloudflare ships Clef, an open-weight answer to Jev, with a price critics noticed - Traictory

Articles liés

Screenshot of the Qwen Research License Agreement file for Qwen-Image-2.1 on Hugging Face, showing its September 20, 2026 release date, the definition of non-commercial use and the clause barring commercial use.
IA & LLM

La Qwen Research License expliquée

La Qwen Research License permet à chacun de télécharger Qwen-Image-2.1, mais en limite l'usage à la recherche ou à l'évaluation. L'usage commercial exige une licence distincte de Qwen.