Zum Inhalt springen

Cloudflare Clef: Open-Weight-Modelle, die Entscheidungen liefern

Cloudflares Clef (27B) und Clef-flash (9B) beantworten typisierte Fragen, statt Text zu schreiben, mit 209 ms bzw. 39 ms Median-Latenz und unter Apache 2.0.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
A screenshot of the Cloudflare/clef model page on Hugging Face, showing its tags, the Apache 2.0 license and the start of its model card.

Die Zahlen

parameters in Clef, built on Qwen 3.8-27B
27B
parameters in Clef-flash, built on Qwen 3.5-9B
9B
Clef-flash median latency
38.8 ms
token context window
64k
Median latency per decision
Clef-flash
38.8 ms
Clef
209.3 ms
Jev
524.1 ms

Cloudflare hat am 1. Oktober 2026 zwei Entscheidungsmodelle mit offenen Gewichten veröffentlicht: Clef und Clef-flash. Sie schreiben keinen Text. Sie lesen eine Eingabe und beantworten eine feste Reihe typisierter Fragen mit Wahrscheinlichkeiten. So kann ein KI-Agent seinen nächsten Schritt schnell wählen. Laut Cloudflares Ankündigung lassen sich beide unter der Lizenz Apache 2.0 kostenlos herunterladen und laufen auf Workers AI, dem gehosteten Dienst von Cloudflare.

Was ein Entscheidungsmodell ist

"Ein Entscheidungsmodell nimmt Klassifizierungen vor, die Agenten auf Grundlage bestimmter Wahrscheinlichkeiten bei der Entscheidung helfen, wie sie handeln sollen", schreibt Cloudflare. Ein Chatmodell erzeugt eine Antwort Token für Token. Clef überspringt diesen Schritt. Cloudflare nennt den Aufbau nicht-autoregressiv. Das heißt, das Modell erzeugt seine Ausgabe nicht Wort für Wort.

Traictory erklärt den Mechanismus. Jedes Modell liest die gesamte Eingabe in einem Durchgang und bewertet dann jede mögliche Antwort parallel. Es wird nichts erzeugt, also gibt es keine Reasoning-Token, auf die man warten muss.

Dahinter steckt dieselbe Idee wie hinter TypeSafes Jev, einem geschlossenen Modell, das am 15. September erschien, und Convais Laya, einem offenen Modell mit 421 Millionen Parametern, das vier Tage später veröffentlicht wurde. Clef bringt die Idee auf eine gehostete Plattform, die viele Entwickler bereits nutzen.

Die beiden Modelle

ClefClef-flash
Parameter27 Milliarden9 Milliarden
BasismodellQwen 3.8-27BQwen 3.5-9B
Median-Latenz209,3 ms38,8 ms
Kontextfenster64k Token64k Token
LizenzApache 2.0Apache 2.0

Cloudflare gibt für Clef-flash eine Latenz im 95. Perzentil von 122,4 ms an. Das bedeutet, dass 95 % seiner Anfragen innerhalb dieser Zeit abgeschlossen waren.

Beide Modelle bauen auf Qwen auf, der offenen Modellfamilie von Alibaba. Laut Traictory bleibt die Qwen-Basis eingefroren. Cloudflare hat darauf kleine Zusatzschichten trainiert, sogenannte Low-Rank-Adapter mit Rang 256.

Clef hat außerdem einen Vision-Encoder und kann daher Bilder als Eingabe verarbeiten. Cloudflare stellt das als Unterschied zu Jev dar, das nur Text verarbeitet.

Aussagen zu Tempo und Preis

Cloudflare sagt, beide Modelle halbieren die Latenz im Vergleich zu gpt-oss-120b, einem offenen Modell von OpenAI, in eigenen Tests zur Threat Intelligence. Nach eigenen Angaben hat Cloudflare die Modelle in 43 Benchmarks bewertet.

Der Preis sorgte für Aufmerksamkeit. Traictory beziffert Clef auf Workers AI mit 0,24 Dollar pro Million Token, gegenüber 0,042 Dollar pro Million bei Jev. Damit ist Clef pro Token fast sechsmal so teuer. Traictory nennt für Jev eine Median-Latenz von 524,1 ms, gegenüber 209,3 ms bei Clef.

Für die gehostete Nutzung sagt Cloudflare, es werde deine Anfragen "nicht lesen, speichern oder zum Training nutzen". Die Gewichte liegen auch auf Hugging Face. Ein Team kann sie also auf eigener Hardware betreiben und den Preis pro Token ganz vermeiden. Dieselbe Ankündigung stellt eine neue Plattform für Feintuning per Reinforcement Learning vor, mit der sich solche Modelle trainieren lassen.

Die offenen Fragen

Laut Traictory stellten Kommentatoren auf Hacker News sowohl den Preis als auch die Benchmark-Methode infrage. "Öffentliche Benchmarks lassen sich leicht manipulieren", schrieb ein Kommentator. Traictory merkt außerdem an, dass für die Qualitätsaussagen "kein Lauf eines Dritten zitiert wird".

Traictory nennt drei Lücken: unabhängige Validierung, Tests gegen die aktuelle Version von Jev und Daten aus echtem Produktionseinsatz. Nichts davon gibt es bisher.

Was das für Entwickler bedeutet

Sieh dir die Entscheidungen an, die dein Agent vor jedem Schritt trifft. Eine Anfrage weiterleiten, eine Nachricht markieren oder ein Tool auswählen: Das alles sind Klassifizierungsaufgaben. Wenn heute ein großes Chatmodell sie erledigt, könnte ein Entscheidungsmodell diesen Schritt von Sekunden auf Millisekunden verkürzen.

Starte mit Clef-flash. Mit einem Median von 38,8 ms ist es schnell genug für den Anfragepfad einer Live-App. Wechsle nur dann zum 27B-Modell, wenn deine eigenen Tests zeigen, dass das kleinere zu viele falsche Antworten liefert.

Führe vor dem Umstieg eine eigene Auswertung durch. Die veröffentlichten Zahlen stammen von Cloudflare, und keine externe Gruppe hat sie reproduziert. Nimm 200 bis 500 echte Eingaben aus deinen Logs, kennzeichne die richtigen Antworten und vergleiche Clef mit dem, was du jetzt nutzt.

Vergleiche die Kosten in beide Richtungen. Auf Workers AI zahlst du pro Token. Mit den Gewichten unter Apache 2.0 zahlst du stattdessen für eigene GPUs. Bei einem stark ausgelasteten Klassifizierungsschritt kann Self-Hosting die günstigere Wahl sein, und die Daten bleiben im Haus.

Quellen

  1. Introducing Clef: our open-source decision models, and new RL fine-tuning platform - Cloudflare Blog
  2. Cloudflare ships Clef, an open-weight answer to Jev, with a price critics noticed - Traictory

Ähnliche Artikel

Screenshot of the Qwen Research License Agreement file for Qwen-Image-2.1 on Hugging Face, showing its September 20, 2026 release date, the definition of non-commercial use and the clause barring commercial use.
KI & LLMs

Die Qwen Research License erklärt

Mit der Qwen Research License darf jeder Qwen-Image-2.1 herunterladen, aber nur für Forschung oder Evaluierung nutzen. Kommerzielle Nutzung erfordert eine gesonderte Lizenz von Qwen.