Skip to content

Laya responde ao Jev com um modelo aberto de 421M

O Laya devolve decisões tipadas em 32,8 milissegundos com 421 milhões de parâmetros e licença Apache 2.0. Sem ajuste, o acerto fica perto do acaso.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
A passively cooled data-center graphics card carrying an NVIDIA wordmark on its end plate, standing on a plain gray studio backdrop.

Em números

parameters, on a ModernBERT-large backbone
421M
median latency for one question on a Tesla T4
32.8 ms
zero-shot typed-decisions accuracy, against 0.318 for random
0.362

A Convai Innovations publicou o Laya, um modelo que responde a perguntas tipadas em vez de escrever texto, sob a licença Apache 2.0. Ele tem 421 milhões de parâmetros e pode ser baixado e executado localmente. É essa a diferença que importa, porque o modelo comercial que ele segue só está disponível por lista de espera.

O Laya faz o mesmo tipo de trabalho que este site descreveu quando o Jev, da TypeSafe, devolveu decisões tipadas em vez de texto, em 15 de setembro. Você entrega ao modelo um estado, por exemplo um e-mail ou um documento JSON, junto de perguntas com tipos de resposta definidos. Ele preenche cada resposta numa única passagem e anexa a cada uma um número de confiança.

O que há de fato dentro

A ficha do modelo descreve um conjunto pequeno, e não uma arquitetura nova. O ModernBERT-large fornece 395 milhões dos parâmetros. Acima dele fica uma cabeça de decisão treinada do zero: duas camadas de transformador, um avaliador das opções de resposta e uma cabeça que escolhe entre agir e encaminhar.

O ponto de verificação em inglês lê até 512 tokens de cada vez. Uma variante multilíngue usa outra base, a mmBERT-base, tem 322 milhões de parâmetros, lê 1.024 tokens e cobre mais de 100 idiomas. O modelo é instalado como uma biblioteca Python.

Uma janela de 512 tokens é curta. Equivale mais ou menos a um e-mail, e não a um atendimento inteiro, e é o primeiro limite a testar com as suas próprias entradas.

A alegação de velocidade, e quem mediu

O site do projeto informa uma latência mediana de 32,8 milissegundos para uma única pergunta, numa placa gráfica Tesla T4. Em lotes de dez, informa 7,2 milissegundos por pergunta.

O número de comparação é o que exige cuidado. A ficha coloca o Jev entre 236 e 276 milissegundos e fala em aceleração de 7,8 vezes. Ela também diz com clareza que as "Jev figures are third-party published, never measured here."

Os relatos divergem ainda sobre qual ponto de verificação alcançou os 32,8 milissegundos. A AI Weekly informa esse número para a variante multilíngue e 39,5 milissegundos para a inglesa, enquanto o site do projeto apresenta 32,8 milissegundos como valor principal. Os dois se referem à mesma classe de hardware.

Os números de acerto pedem uma segunda leitura

Os próprios materiais do Laya são incomumente francos sobre o que significa o número de destaque.

MediçãoValor
Decisões tipadas, ajustado na partição de treino desse teste0,766
Decisões tipadas, sem ajuste prévio0,362
Referência aleatória no mesmo teste0,318
Referência da classe majoritária0,461
Filtragem de spam em e-mail0,993
Detecção de phishing0,980
Banking77, detecção de intenção0,425

A segunda linha merece atenção. Sem ajuste, o modelo obtém 0,362, enquanto chutar obtém 0,318 e responder sempre a alternativa mais comum dá 0,461. A própria ficha tira a conclusão: "Laya is a fast base to specialise, not a zero-shot decision engine."

A calibração segue o mesmo padrão. Os números de confiança deveriam corresponder ao acerto real, e o erro de calibração relatado começa em 0,466. Ele só chega aos 0,081 anunciados depois de reajustar a temperatura para cada tipo de pergunta, um passo que você executa.

O fundador Nandakishor Mukkunnoth aponta mais um limite: "Choice questions degrade with >20 options."

O que isso significa para os desenvolvedores

Trate isso como uma base para ajustar, e não como um serviço de decisão pronto. A distância entre 0,362 e 0,766 vem inteiramente da partição de treino de um teste. Se você não pode rotular alguns milhares de exemplos da sua própria decisão, o número sem ajuste é o que prevê os seus resultados.

Onde ele se encaixa, a economia muda por completo. Spam e phishing passam de 0,98, e são exatamente as decisões binárias estreitas que o projeto mira. Rodar localmente elimina a conta por token e a lista de espera. Um passo de roteamento que custa dezenas de milissegundos cabe dentro de uma requisição, e uma chamada a um modelo grande não cabe.

Reserve tempo para a calibração antes de confiar num número de confiança. Reajuste a temperatura por tipo de pergunta com os seus dados. Depois registre confiança e resultado por uma semana e verifique se 0,7 significa mesmo setenta por cento. Este site sugeriu a mesma verificação para o Jev, e um ponto de verificação aberto ao menos deixa você fazê-la.

Aproveite para conferir a licença diante dos seus planos. A Apache 2.0 permite uso comercial e modificação. A comparação honesta com uma interface fechada não é só a latência, mas também quem pode auditar o sistema quando uma decisão dá errado.

Fontes

  1. Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
  2. convaiinnovations/laya model card - Hugging Face
  3. Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly

Artigos relacionados