Cloudflare Clef: Open-Weight-Modelle, die Entscheidungen liefern
Cloudflares Clef (27B) und Clef-flash (9B) beantworten typisierte Fragen, statt Text zu schreiben, mit 209 ms bzw. 39 ms Median-Latenz und unter Apache 2.0.
3 Min. Lesezeit

Die Zahlen
- parameters in Clef, built on Qwen 3.8-27B
- 27B
- parameters in Clef-flash, built on Qwen 3.5-9B
- 9B
- Clef-flash median latency
- 38.8 ms
- token context window
- 64k
- Clef-flash
- 38.8 ms
- Clef
- 209.3 ms
- Jev
- 524.1 ms
Cloudflare hat am 1. Oktober 2026 zwei Entscheidungsmodelle mit offenen Gewichten veröffentlicht: Clef und Clef-flash. Sie schreiben keinen Text. Sie lesen eine Eingabe und beantworten eine feste Reihe typisierter Fragen mit Wahrscheinlichkeiten. So kann ein KI-Agent seinen nächsten Schritt schnell wählen. Laut Cloudflares Ankündigung lassen sich beide unter der Lizenz Apache 2.0 kostenlos herunterladen und laufen auf Workers AI, dem gehosteten Dienst von Cloudflare.
Was ein Entscheidungsmodell ist
"Ein Entscheidungsmodell nimmt Klassifizierungen vor, die Agenten auf Grundlage bestimmter Wahrscheinlichkeiten bei der Entscheidung helfen, wie sie handeln sollen", schreibt Cloudflare. Ein Chatmodell erzeugt eine Antwort Token für Token. Clef überspringt diesen Schritt. Cloudflare nennt den Aufbau nicht-autoregressiv. Das heißt, das Modell erzeugt seine Ausgabe nicht Wort für Wort.
Traictory erklärt den Mechanismus. Jedes Modell liest die gesamte Eingabe in einem Durchgang und bewertet dann jede mögliche Antwort parallel. Es wird nichts erzeugt, also gibt es keine Reasoning-Token, auf die man warten muss.
Dahinter steckt dieselbe Idee wie hinter TypeSafes Jev, einem geschlossenen Modell, das am 15. September erschien, und Convais Laya, einem offenen Modell mit 421 Millionen Parametern, das vier Tage später veröffentlicht wurde. Clef bringt die Idee auf eine gehostete Plattform, die viele Entwickler bereits nutzen.
Die beiden Modelle
| Clef | Clef-flash | |
|---|---|---|
| Parameter | 27 Milliarden | 9 Milliarden |
| Basismodell | Qwen 3.8-27B | Qwen 3.5-9B |
| Median-Latenz | 209,3 ms | 38,8 ms |
| Kontextfenster | 64k Token | 64k Token |
| Lizenz | Apache 2.0 | Apache 2.0 |
Cloudflare gibt für Clef-flash eine Latenz im 95. Perzentil von 122,4 ms an. Das bedeutet, dass 95 % seiner Anfragen innerhalb dieser Zeit abgeschlossen waren.
Beide Modelle bauen auf Qwen auf, der offenen Modellfamilie von Alibaba. Laut Traictory bleibt die Qwen-Basis eingefroren. Cloudflare hat darauf kleine Zusatzschichten trainiert, sogenannte Low-Rank-Adapter mit Rang 256.
Clef hat außerdem einen Vision-Encoder und kann daher Bilder als Eingabe verarbeiten. Cloudflare stellt das als Unterschied zu Jev dar, das nur Text verarbeitet.
Aussagen zu Tempo und Preis
Cloudflare sagt, beide Modelle halbieren die Latenz im Vergleich zu gpt-oss-120b, einem offenen Modell von OpenAI, in eigenen Tests zur Threat Intelligence. Nach eigenen Angaben hat Cloudflare die Modelle in 43 Benchmarks bewertet.
Der Preis sorgte für Aufmerksamkeit. Traictory beziffert Clef auf Workers AI mit 0,24 Dollar pro Million Token, gegenüber 0,042 Dollar pro Million bei Jev. Damit ist Clef pro Token fast sechsmal so teuer. Traictory nennt für Jev eine Median-Latenz von 524,1 ms, gegenüber 209,3 ms bei Clef.
Für die gehostete Nutzung sagt Cloudflare, es werde deine Anfragen "nicht lesen, speichern oder zum Training nutzen". Die Gewichte liegen auch auf Hugging Face. Ein Team kann sie also auf eigener Hardware betreiben und den Preis pro Token ganz vermeiden. Dieselbe Ankündigung stellt eine neue Plattform für Feintuning per Reinforcement Learning vor, mit der sich solche Modelle trainieren lassen.
Die offenen Fragen
Laut Traictory stellten Kommentatoren auf Hacker News sowohl den Preis als auch die Benchmark-Methode infrage. "Öffentliche Benchmarks lassen sich leicht manipulieren", schrieb ein Kommentator. Traictory merkt außerdem an, dass für die Qualitätsaussagen "kein Lauf eines Dritten zitiert wird".
Traictory nennt drei Lücken: unabhängige Validierung, Tests gegen die aktuelle Version von Jev und Daten aus echtem Produktionseinsatz. Nichts davon gibt es bisher.
Was das für Entwickler bedeutet
Sieh dir die Entscheidungen an, die dein Agent vor jedem Schritt trifft. Eine Anfrage weiterleiten, eine Nachricht markieren oder ein Tool auswählen: Das alles sind Klassifizierungsaufgaben. Wenn heute ein großes Chatmodell sie erledigt, könnte ein Entscheidungsmodell diesen Schritt von Sekunden auf Millisekunden verkürzen.
Starte mit Clef-flash. Mit einem Median von 38,8 ms ist es schnell genug für den Anfragepfad einer Live-App. Wechsle nur dann zum 27B-Modell, wenn deine eigenen Tests zeigen, dass das kleinere zu viele falsche Antworten liefert.
Führe vor dem Umstieg eine eigene Auswertung durch. Die veröffentlichten Zahlen stammen von Cloudflare, und keine externe Gruppe hat sie reproduziert. Nimm 200 bis 500 echte Eingaben aus deinen Logs, kennzeichne die richtigen Antworten und vergleiche Clef mit dem, was du jetzt nutzt.
Vergleiche die Kosten in beide Richtungen. Auf Workers AI zahlst du pro Token. Mit den Gewichten unter Apache 2.0 zahlst du stattdessen für eigene GPUs. Bei einem stark ausgelasteten Klassifizierungsschritt kann Self-Hosting die günstigere Wahl sein, und die Daten bleiben im Haus.
Quellen
Ähnliche Artikel

Strands Decider 2B trifft Agenten-Entscheidungen in 115 ms
Strands Decider 2B von AWS ist ein Open-Source-Modell, das aus einer Liste auswählt, statt Text zu schreiben. Auf einer RTX 3090 antwortet es in 115 ms und erreicht 72,3 % bei JevBench.

AstaBrief 8B: Ai2s offenes Modell schreibt Berichte mit Quellenangaben
Ai2 hat AstaBrief 8B veröffentlicht, ein Apache-2.0-Modell auf Basis von Qwen3-8B, das Forschungsberichte mit Quellenangaben in 51,1 Sekunden schreibt, 3,5-mal schneller als Astas Thinking mode.

Die Qwen Research License erklärt
Mit der Qwen Research License darf jeder Qwen-Image-2.1 herunterladen, aber nur für Forschung oder Evaluierung nutzen. Kommerzielle Nutzung erfordert eine gesonderte Lizenz von Qwen.