Pular para o conteúdo

Cloudflare Clef: modelos de pesos abertos que devolvem decisões

O Clef (27B) e o Clef-flash (9B), da Cloudflare, respondem a perguntas tipadas em vez de escrever texto, com latência mediana de 209 ms e 39 ms, sob Apache 2.0.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
A screenshot of the Cloudflare/clef model page on Hugging Face, showing its tags, the Apache 2.0 license and the start of its model card.

Em números

parameters in Clef, built on Qwen 3.8-27B
27B
parameters in Clef-flash, built on Qwen 3.5-9B
9B
Clef-flash median latency
38.8 ms
token context window
64k
Median latency per decision
Clef-flash
38.8 ms
Clef
209.3 ms
Jev
524.1 ms

A Cloudflare lançou em 1º de outubro de 2026 dois modelos de decisão de pesos abertos, o Clef e o Clef-flash. Eles não escrevem texto. Eles leem uma entrada e respondem a um conjunto fixo de perguntas tipadas com probabilidades. Isso permite que um agente de IA escolha rapidamente o próximo passo. Segundo o anúncio da Cloudflare, os dois podem ser baixados de graça sob a licença Apache 2.0 e rodam no Workers AI, o serviço hospedado da Cloudflare.

O que é um modelo de decisão

"Um modelo de decisão faz classificações para ajudar agentes a decidir como agir, com base em certas probabilidades", escreve a Cloudflare. Um modelo de chat produz uma resposta um token por vez. O Clef pula essa etapa. A Cloudflare chama o design de não autorregressivo. Ou seja, ele não gera a saída palavra por palavra.

O Traictory explica o mecanismo. Cada modelo lê a entrada inteira de uma só vez e depois pontua cada resposta possível em paralelo. Nada é gerado, então não há tokens de raciocínio para esperar.

É a mesma ideia por trás do Jev, da TypeSafe, um modelo fechado lançado em 15 de setembro, e do Laya, da Convai, um modelo aberto de 421 milhões de parâmetros lançado quatro dias depois. O Clef leva a ideia a uma plataforma hospedada que muitos desenvolvedores já usam.

Os dois modelos

ClefClef-flash
Parâmetros27 bilhões9 bilhões
Modelo baseQwen 3.8-27BQwen 3.5-9B
Latência mediana209,3 ms38,8 ms
Janela de contexto64k tokens64k tokens
LicençaApache 2.0Apache 2.0

A Cloudflare informa uma latência de percentil 95 de 122,4 ms para o Clef-flash. Isso significa que 95% das requisições dele terminaram dentro desse tempo.

Os dois modelos são construídos sobre o Qwen, a família de modelos abertos da Alibaba. Segundo o Traictory, a base Qwen fica congelada. A Cloudflare treinou sobre ela pequenas camadas adicionais, chamadas adaptadores low-rank de rank 256.

O Clef também tem um codificador de visão, então pode receber imagens como entrada. A Cloudflare apresenta isso como uma diferença em relação ao Jev, que só lida com texto.

Alegações de velocidade e preço

A Cloudflare diz que os dois modelos cortam a latência pela metade em comparação com o gpt-oss-120b, um modelo aberto da OpenAI, em seus próprios testes de inteligência de ameaças. A empresa diz que avaliou os modelos em 43 benchmarks.

O preço chamou atenção. O Traictory coloca o Clef a 0,24 dólar por milhão de tokens no Workers AI, contra 0,042 dólar por milhão do Jev. Isso torna o Clef quase seis vezes mais caro por token. O Traictory informa latência mediana de 524,1 ms para o Jev, contra 209,3 ms do Clef.

Para o uso hospedado, a Cloudflare diz que "não lê, não armazena nem treina com as suas requisições". Os pesos também estão no Hugging Face. Assim, uma equipe pode rodá-los no próprio hardware e evitar totalmente o preço por token. O mesmo anúncio apresenta uma nova plataforma de ajuste fino por aprendizado por reforço para treinar esse tipo de modelo.

As questões em aberto

Segundo o Traictory, comentaristas do Hacker News questionaram tanto o preço quanto o método dos benchmarks. "Benchmarks públicos são fáceis de burlar", escreveu um deles. O Traictory também observa que "nenhuma execução de terceiros é citada" para as alegações de qualidade.

O Traictory lista três lacunas: validação independente, testes contra a versão atual do Jev e dados de uso real em produção. Nada disso existe ainda.

O que isso significa para desenvolvedores

Observe as decisões que o seu agente toma antes de cada passo. Rotear uma requisição, sinalizar uma mensagem ou escolher uma ferramenta são todas tarefas de classificação. Se hoje um grande modelo de chat cuida delas, um modelo de decisão poderia reduzir essa etapa de segundos para milissegundos.

Comece pelo Clef-flash. Com mediana de 38,8 ms, ele é rápido o bastante para ficar no caminho das requisições de um app em produção. Passe para o modelo de 27B só se os seus próprios testes mostrarem que o menor erra respostas demais.

Faça a sua própria avaliação antes de trocar. Os números publicados vêm da Cloudflare, e nenhum grupo externo os reproduziu. Pegue de 200 a 500 entradas reais dos seus logs, marque as respostas corretas e compare o Clef com o que você usa hoje.

Compare os custos nos dois sentidos. No Workers AI, você paga por token. Com os pesos sob Apache 2.0, você paga pelas suas próprias GPUs. Uma etapa de classificação muito usada pode tornar a hospedagem própria a opção mais barata, e ela mantém os dados dentro de casa.

Fontes

  1. Introducing Clef: our open-source decision models, and new RL fine-tuning platform - Cloudflare Blog
  2. Cloudflare ships Clef, an open-weight answer to Jev, with a price critics noticed - Traictory

Artigos relacionados

Screenshot of the Qwen Research License Agreement file for Qwen-Image-2.1 on Hugging Face, showing its September 20, 2026 release date, the definition of non-commercial use and the clause barring commercial use.
IA e LLMs

A Qwen Research License explicada

A Qwen Research License permite que qualquer pessoa baixe o Qwen-Image-2.1, mas limita o uso a pesquisa ou avaliação. Uso comercial exige uma licença à parte da Qwen.