Cloudflare Clef: modelos de pesos abiertos que devuelven decisiones
Clef (27B) y Clef-flash (9B) de Cloudflare responden preguntas tipadas en lugar de escribir texto, con una latencia mediana de 209 ms y 39 ms, bajo Apache 2.0.
3 min de lectura

En cifras
- parameters in Clef, built on Qwen 3.8-27B
- 27B
- parameters in Clef-flash, built on Qwen 3.5-9B
- 9B
- Clef-flash median latency
- 38.8 ms
- token context window
- 64k
- Clef-flash
- 38.8 ms
- Clef
- 209.3 ms
- Jev
- 524.1 ms
Cloudflare publicó el 1 de octubre de 2026 dos modelos de decisión de pesos abiertos, Clef y Clef-flash. No escriben texto. Leen una entrada y responden a un conjunto fijo de preguntas tipadas con probabilidades. Eso permite que un agente de IA elija rápido su siguiente paso. Según el anuncio de Cloudflare, ambos se pueden descargar gratis con licencia Apache 2.0 y funcionan en Workers AI, el servicio alojado de Cloudflare.
Qué es un modelo de decisión
"Un modelo de decisión hace clasificaciones para ayudar a los agentes a decidir cómo actuar, a partir de ciertas probabilidades", escribe Cloudflare. Un modelo de chat produce una respuesta token a token. Clef se salta ese paso. Cloudflare llama a este diseño no autorregresivo. Es decir, no genera la salida palabra por palabra.
Traictory explica el mecanismo. Cada modelo lee toda la entrada de una sola pasada y luego puntúa en paralelo cada respuesta posible. No se genera nada, así que no hay tokens de razonamiento que esperar.
Es la misma idea que hay detrás de Jev de TypeSafe, un modelo cerrado lanzado el 15 de septiembre, y de Laya de Convai, un modelo abierto de 421 millones de parámetros publicado cuatro días después. Clef lleva la idea a una plataforma alojada que muchos desarrolladores ya usan.
Los dos modelos
| Clef | Clef-flash | |
|---|---|---|
| Parámetros | 27.000 millones | 9.000 millones |
| Modelo base | Qwen 3.8-27B | Qwen 3.5-9B |
| Latencia mediana | 209,3 ms | 38,8 ms |
| Ventana de contexto | 64k tokens | 64k tokens |
| Licencia | Apache 2.0 | Apache 2.0 |
Cloudflare informa de una latencia de percentil 95 de 122,4 ms para Clef-flash. Eso significa que el 95 % de sus solicitudes terminó dentro de ese tiempo.
Ambos modelos se basan en Qwen, la familia de modelos abiertos de Alibaba. Según Traictory, la base de Qwen permanece congelada. Cloudflare entrenó encima pequeñas capas adicionales, llamadas adaptadores de bajo rango de rango 256.
Clef también tiene un codificador de visión, así que puede recibir imágenes como entrada. Cloudflare lo presenta como una diferencia frente a Jev, que solo procesa texto.
Lo que dicen sobre velocidad y precio
Cloudflare afirma que ambos modelos reducen la latencia a la mitad frente a gpt-oss-120b, un modelo abierto de OpenAI, en sus propias pruebas de inteligencia de amenazas. Dice que evaluó los modelos en 43 benchmarks.
El precio llamó la atención. Traictory sitúa Clef en 0,24 dólares por millón de tokens en Workers AI, frente a 0,042 dólares por millón de Jev. Eso hace que Clef sea casi seis veces más caro por token. Traictory indica una latencia mediana de 524,1 ms para Jev, frente a 209,3 ms de Clef.
Para el uso alojado, Cloudflare dice que "no lee, no almacena ni entrena con tus solicitudes". Los pesos también están en Hugging Face. Así, un equipo puede ejecutarlos en su propio hardware y evitar por completo el precio por token. El mismo anuncio presenta una nueva plataforma de ajuste fino con aprendizaje por refuerzo para entrenar este tipo de modelos.
Las preguntas abiertas
Según Traictory, comentaristas de Hacker News cuestionaron tanto el precio como el método de los benchmarks. "Los benchmarks públicos son fáciles de manipular", escribió uno de ellos. Traictory también señala que "no se cita ninguna ejecución de terceros" para las afirmaciones de calidad.
Traictory enumera tres carencias: validación independiente, pruebas frente a la versión actual de Jev y datos de uso real en producción. Nada de eso existe todavía.
Qué significa para los desarrolladores
Fíjate en las decisiones que toma tu agente antes de cada paso. Enrutar una solicitud, marcar un mensaje o elegir una herramienta son tareas de clasificación. Si hoy las resuelve un modelo de chat grande, un modelo de decisión podría bajar ese paso de segundos a milisegundos.
Empieza por Clef-flash. Con una mediana de 38,8 ms, es lo bastante rápido para estar en la ruta de solicitudes de una aplicación en producción. Pasa al modelo de 27B solo si tus propias pruebas muestran que el pequeño falla demasiadas respuestas.
Haz tu propia evaluación antes de cambiar. Las cifras publicadas proceden de Cloudflare, y ningún grupo externo las ha reproducido. Toma de 200 a 500 entradas reales de tus registros, etiqueta las respuestas correctas y compara Clef con lo que usas ahora.
Compara los costes en ambos sentidos. En Workers AI pagas por token. Con los pesos bajo Apache 2.0, pagas en cambio tus propias GPU. Un paso de clasificación con mucho tráfico puede hacer que alojarlo tú mismo sea la opción más barata, y así los datos se quedan en casa.
Fuentes
Artículos relacionados

Strands Decider 2B toma decisiones de agentes en 115 ms
Strands Decider 2B de AWS es un modelo de código abierto que elige de una lista en lugar de escribir texto. Responde en 115 ms en una RTX 3090 y obtiene un 72,3 % en JevBench.

AstaBrief 8B: el modelo abierto de Ai2 escribe informes con citas
Ai2 lanzó AstaBrief 8B, un modelo con licencia Apache 2.0 basado en Qwen3-8B que escribe informes de investigación con citas en 51,1 segundos, 3,5 veces más rápido que el modo Thinking de Asta.

La Qwen Research License, explicada
La Qwen Research License permite a cualquiera descargar Qwen-Image-2.1, pero limita su uso a la investigación o la evaluación. El uso comercial requiere una licencia aparte de Qwen.