Laya responde ao Jev com um modelo aberto de 421M
O Laya devolve decisões tipadas em 32,8 milissegundos com 421 milhões de parâmetros e licença Apache 2.0. Sem ajuste, o acerto fica perto do acaso.
3 min de leitura

Em números
- parameters, on a ModernBERT-large backbone
- 421M
- median latency for one question on a Tesla T4
- 32.8 ms
- zero-shot typed-decisions accuracy, against 0.318 for random
- 0.362
A Convai Innovations publicou o Laya, um modelo que responde a perguntas tipadas em vez de escrever texto, sob a licença Apache 2.0. Ele tem 421 milhões de parâmetros e pode ser baixado e executado localmente. É essa a diferença que importa, porque o modelo comercial que ele segue só está disponível por lista de espera.
O Laya faz o mesmo tipo de trabalho que este site descreveu quando o Jev, da TypeSafe, devolveu decisões tipadas em vez de texto, em 15 de setembro. Você entrega ao modelo um estado, por exemplo um e-mail ou um documento JSON, junto de perguntas com tipos de resposta definidos. Ele preenche cada resposta numa única passagem e anexa a cada uma um número de confiança.
O que há de fato dentro
A ficha do modelo descreve um conjunto pequeno, e não uma arquitetura nova. O ModernBERT-large fornece 395 milhões dos parâmetros. Acima dele fica uma cabeça de decisão treinada do zero: duas camadas de transformador, um avaliador das opções de resposta e uma cabeça que escolhe entre agir e encaminhar.
O ponto de verificação em inglês lê até 512 tokens de cada vez. Uma variante multilíngue usa outra base, a mmBERT-base, tem 322 milhões de parâmetros, lê 1.024 tokens e cobre mais de 100 idiomas. O modelo é instalado como uma biblioteca Python.
Uma janela de 512 tokens é curta. Equivale mais ou menos a um e-mail, e não a um atendimento inteiro, e é o primeiro limite a testar com as suas próprias entradas.
A alegação de velocidade, e quem mediu
O site do projeto informa uma latência mediana de 32,8 milissegundos para uma única pergunta, numa placa gráfica Tesla T4. Em lotes de dez, informa 7,2 milissegundos por pergunta.
O número de comparação é o que exige cuidado. A ficha coloca o Jev entre 236 e 276 milissegundos e fala em aceleração de 7,8 vezes. Ela também diz com clareza que as "Jev figures are third-party published, never measured here."
Os relatos divergem ainda sobre qual ponto de verificação alcançou os 32,8 milissegundos. A AI Weekly informa esse número para a variante multilíngue e 39,5 milissegundos para a inglesa, enquanto o site do projeto apresenta 32,8 milissegundos como valor principal. Os dois se referem à mesma classe de hardware.
Os números de acerto pedem uma segunda leitura
Os próprios materiais do Laya são incomumente francos sobre o que significa o número de destaque.
| Medição | Valor |
|---|---|
| Decisões tipadas, ajustado na partição de treino desse teste | 0,766 |
| Decisões tipadas, sem ajuste prévio | 0,362 |
| Referência aleatória no mesmo teste | 0,318 |
| Referência da classe majoritária | 0,461 |
| Filtragem de spam em e-mail | 0,993 |
| Detecção de phishing | 0,980 |
| Banking77, detecção de intenção | 0,425 |
A segunda linha merece atenção. Sem ajuste, o modelo obtém 0,362, enquanto chutar obtém 0,318 e responder sempre a alternativa mais comum dá 0,461. A própria ficha tira a conclusão: "Laya is a fast base to specialise, not a zero-shot decision engine."
A calibração segue o mesmo padrão. Os números de confiança deveriam corresponder ao acerto real, e o erro de calibração relatado começa em 0,466. Ele só chega aos 0,081 anunciados depois de reajustar a temperatura para cada tipo de pergunta, um passo que você executa.
O fundador Nandakishor Mukkunnoth aponta mais um limite: "Choice questions degrade with >20 options."
O que isso significa para os desenvolvedores
Trate isso como uma base para ajustar, e não como um serviço de decisão pronto. A distância entre 0,362 e 0,766 vem inteiramente da partição de treino de um teste. Se você não pode rotular alguns milhares de exemplos da sua própria decisão, o número sem ajuste é o que prevê os seus resultados.
Onde ele se encaixa, a economia muda por completo. Spam e phishing passam de 0,98, e são exatamente as decisões binárias estreitas que o projeto mira. Rodar localmente elimina a conta por token e a lista de espera. Um passo de roteamento que custa dezenas de milissegundos cabe dentro de uma requisição, e uma chamada a um modelo grande não cabe.
Reserve tempo para a calibração antes de confiar num número de confiança. Reajuste a temperatura por tipo de pergunta com os seus dados. Depois registre confiança e resultado por uma semana e verifique se 0,7 significa mesmo setenta por cento. Este site sugeriu a mesma verificação para o Jev, e um ponto de verificação aberto ao menos deixa você fazê-la.
Aproveite para conferir a licença diante dos seus planos. A Apache 2.0 permite uso comercial e modificação. A comparação honesta com uma interface fechada não é só a latência, mas também quem pode auditar o sistema quando uma decisão dá errado.
Fontes
- Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
- convaiinnovations/laya model card - Hugging Face
- Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly
Artigos relacionados

O Jev, da TypeSafe, devolve decisões tipadas, não texto
O Jev responde em 70 a 500 milissegundos e custa 0,042 dólar por milhão de tokens de entrada, com saída grátis. Ele não gera texto de jeito nenhum.

Salesforce Koa parte de pesos abertos mas sai fechado
A Salesforce diz que o Koa comete três vezes menos erros no seu próprio CRM Bench, mas os pesos são proprietários e o modelo só roda na infraestrutura dela.

Qwen3.5-9B gasta 32 KB por token no cache KV
O Qwen3.5-9B usa atenção completa em apenas 8 das suas 32 camadas, então o cache KV custa 32 KB por token. Essa proporção decide se ele cabe em 8 GB.