Saltar al contenido

Cloudflare Clef: modelos de pesos abiertos que devuelven decisiones

Clef (27B) y Clef-flash (9B) de Cloudflare responden preguntas tipadas en lugar de escribir texto, con una latencia mediana de 209 ms y 39 ms, bajo Apache 2.0.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
A screenshot of the Cloudflare/clef model page on Hugging Face, showing its tags, the Apache 2.0 license and the start of its model card.

En cifras

parameters in Clef, built on Qwen 3.8-27B
27B
parameters in Clef-flash, built on Qwen 3.5-9B
9B
Clef-flash median latency
38.8 ms
token context window
64k
Median latency per decision
Clef-flash
38.8 ms
Clef
209.3 ms
Jev
524.1 ms

Cloudflare publicó el 1 de octubre de 2026 dos modelos de decisión de pesos abiertos, Clef y Clef-flash. No escriben texto. Leen una entrada y responden a un conjunto fijo de preguntas tipadas con probabilidades. Eso permite que un agente de IA elija rápido su siguiente paso. Según el anuncio de Cloudflare, ambos se pueden descargar gratis con licencia Apache 2.0 y funcionan en Workers AI, el servicio alojado de Cloudflare.

Qué es un modelo de decisión

"Un modelo de decisión hace clasificaciones para ayudar a los agentes a decidir cómo actuar, a partir de ciertas probabilidades", escribe Cloudflare. Un modelo de chat produce una respuesta token a token. Clef se salta ese paso. Cloudflare llama a este diseño no autorregresivo. Es decir, no genera la salida palabra por palabra.

Traictory explica el mecanismo. Cada modelo lee toda la entrada de una sola pasada y luego puntúa en paralelo cada respuesta posible. No se genera nada, así que no hay tokens de razonamiento que esperar.

Es la misma idea que hay detrás de Jev de TypeSafe, un modelo cerrado lanzado el 15 de septiembre, y de Laya de Convai, un modelo abierto de 421 millones de parámetros publicado cuatro días después. Clef lleva la idea a una plataforma alojada que muchos desarrolladores ya usan.

Los dos modelos

ClefClef-flash
Parámetros27.000 millones9.000 millones
Modelo baseQwen 3.8-27BQwen 3.5-9B
Latencia mediana209,3 ms38,8 ms
Ventana de contexto64k tokens64k tokens
LicenciaApache 2.0Apache 2.0

Cloudflare informa de una latencia de percentil 95 de 122,4 ms para Clef-flash. Eso significa que el 95 % de sus solicitudes terminó dentro de ese tiempo.

Ambos modelos se basan en Qwen, la familia de modelos abiertos de Alibaba. Según Traictory, la base de Qwen permanece congelada. Cloudflare entrenó encima pequeñas capas adicionales, llamadas adaptadores de bajo rango de rango 256.

Clef también tiene un codificador de visión, así que puede recibir imágenes como entrada. Cloudflare lo presenta como una diferencia frente a Jev, que solo procesa texto.

Lo que dicen sobre velocidad y precio

Cloudflare afirma que ambos modelos reducen la latencia a la mitad frente a gpt-oss-120b, un modelo abierto de OpenAI, en sus propias pruebas de inteligencia de amenazas. Dice que evaluó los modelos en 43 benchmarks.

El precio llamó la atención. Traictory sitúa Clef en 0,24 dólares por millón de tokens en Workers AI, frente a 0,042 dólares por millón de Jev. Eso hace que Clef sea casi seis veces más caro por token. Traictory indica una latencia mediana de 524,1 ms para Jev, frente a 209,3 ms de Clef.

Para el uso alojado, Cloudflare dice que "no lee, no almacena ni entrena con tus solicitudes". Los pesos también están en Hugging Face. Así, un equipo puede ejecutarlos en su propio hardware y evitar por completo el precio por token. El mismo anuncio presenta una nueva plataforma de ajuste fino con aprendizaje por refuerzo para entrenar este tipo de modelos.

Las preguntas abiertas

Según Traictory, comentaristas de Hacker News cuestionaron tanto el precio como el método de los benchmarks. "Los benchmarks públicos son fáciles de manipular", escribió uno de ellos. Traictory también señala que "no se cita ninguna ejecución de terceros" para las afirmaciones de calidad.

Traictory enumera tres carencias: validación independiente, pruebas frente a la versión actual de Jev y datos de uso real en producción. Nada de eso existe todavía.

Qué significa para los desarrolladores

Fíjate en las decisiones que toma tu agente antes de cada paso. Enrutar una solicitud, marcar un mensaje o elegir una herramienta son tareas de clasificación. Si hoy las resuelve un modelo de chat grande, un modelo de decisión podría bajar ese paso de segundos a milisegundos.

Empieza por Clef-flash. Con una mediana de 38,8 ms, es lo bastante rápido para estar en la ruta de solicitudes de una aplicación en producción. Pasa al modelo de 27B solo si tus propias pruebas muestran que el pequeño falla demasiadas respuestas.

Haz tu propia evaluación antes de cambiar. Las cifras publicadas proceden de Cloudflare, y ningún grupo externo las ha reproducido. Toma de 200 a 500 entradas reales de tus registros, etiqueta las respuestas correctas y compara Clef con lo que usas ahora.

Compara los costes en ambos sentidos. En Workers AI pagas por token. Con los pesos bajo Apache 2.0, pagas en cambio tus propias GPU. Un paso de clasificación con mucho tráfico puede hacer que alojarlo tú mismo sea la opción más barata, y así los datos se quedan en casa.

Fuentes

  1. Introducing Clef: our open-source decision models, and new RL fine-tuning platform - Cloudflare Blog
  2. Cloudflare ships Clef, an open-weight answer to Jev, with a price critics noticed - Traictory

Artículos relacionados

Screenshot of the Qwen Research License Agreement file for Qwen-Image-2.1 on Hugging Face, showing its September 20, 2026 release date, the definition of non-commercial use and the clause barring commercial use.
IA y LLM

La Qwen Research License, explicada

La Qwen Research License permite a cualquiera descargar Qwen-Image-2.1, pero limita su uso a la investigación o la evaluación. El uso comercial requiere una licencia aparte de Qwen.