Skip to content

Laya responde a Jev con un modelo abierto de 421M

Laya devuelve decisiones tipadas en 32,8 milisegundos con 421 millones de parámetros y licencia Apache 2.0. Sin ajuste, su acierto roza el azar.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
A passively cooled data-center graphics card carrying an NVIDIA wordmark on its end plate, standing on a plain gray studio backdrop.

En cifras

parameters, on a ModernBERT-large backbone
421M
median latency for one question on a Tesla T4
32.8 ms
zero-shot typed-decisions accuracy, against 0.318 for random
0.362

Convai Innovations ha publicado Laya, un modelo que responde a preguntas tipadas en lugar de escribir texto, con licencia Apache 2.0. Tiene 421 millones de parámetros y se puede descargar y ejecutar en local. Esa es la diferencia que importa, porque el modelo comercial al que sigue solo está disponible por lista de espera.

Laya hace el mismo tipo de trabajo que este sitio describió cuando Jev, de TypeSafe, devolvió decisiones tipadas en vez de texto, el 15 de septiembre. Se le entrega un estado, por ejemplo un correo o un documento JSON, junto a preguntas con tipos de respuesta definidos. El modelo rellena cada respuesta en una sola pasada y añade a cada una un número de confianza.

Qué hay realmente dentro

La ficha del modelo describe un montaje pequeño y no una arquitectura nueva. ModernBERT-large aporta 395 millones de los parámetros. Encima se sitúa una cabeza de decisión entrenada desde cero: dos capas de transformador, un evaluador de opciones de respuesta y una cabeza que elige entre actuar y escalar.

El punto de control en inglés lee hasta 512 tokens de una vez. Una variante multilingüe usa otra base, mmBERT-base, tiene 322 millones de parámetros, lee 1.024 tokens y cubre más de 100 idiomas. El modelo se instala como biblioteca de Python.

Una ventana de 512 tokens es corta. Equivale más o menos a un correo, no a un hilo de soporte entero, y es el primer límite que conviene probar con sus propias entradas.

La afirmación de velocidad, y quién la midió

El sitio del proyecto indica una latencia mediana de 32,8 milisegundos para una sola pregunta en una tarjeta gráfica Tesla T4. En lotes de diez, indica 7,2 milisegundos por pregunta.

La cifra de comparación es la que exige cuidado. La ficha sitúa a Jev entre 236 y 276 milisegundos y habla de una aceleración de 7,8 veces. También dice con claridad que las "Jev figures are third-party published, never measured here."

Los relatos difieren además sobre qué punto de control logró los 32,8 milisegundos. AI Weekly informa de esa cifra para la variante multilingüe y de 39,5 milisegundos para la inglesa, mientras que el sitio del proyecto presenta 32,8 milisegundos como dato principal. Ambas se refieren a la misma clase de hardware.

Las cifras de acierto hay que leerlas dos veces

Los propios materiales de Laya son poco habituales por su franqueza sobre lo que significa su cifra estrella.

MediciónValor
Decisiones tipadas, ajustado con la partición de entrenamiento de esa prueba0,766
Decisiones tipadas, sin ajuste previo0,362
Referencia aleatoria en la misma prueba0,318
Referencia de la clase mayoritaria0,461
Filtrado de correo basura0,993
Detección de phishing0,980
Banking77, detección de intención0,425

La segunda fila merece una pausa. Sin ajuste, el modelo obtiene 0,362 donde adivinar obtiene 0,318 y responder siempre lo más frecuente da 0,461. La ficha extrae ella misma la conclusión: "Laya is a fast base to specialise, not a zero-shot decision engine."

La calibración sigue el mismo patrón. Los números de confianza deberían coincidir con el acierto real, y el error de calibración que se informa parte de 0,466. Solo llega al 0,081 anunciado tras reajustar la temperatura para cada tipo de pregunta, un paso que ejecuta usted.

El fundador Nandakishor Mukkunnoth señala otro límite: "Choice questions degrade with >20 options."

Qué significa esto para los desarrolladores

Trátelo como una base para ajustar, no como un servicio de decisión listo para usar. La distancia entre 0,362 y 0,766 procede por completo de la partición de entrenamiento de una prueba. Si no puede etiquetar unos miles de ejemplos de su propia decisión, la cifra sin ajuste es la que predice sus resultados.

Donde encaja, la economía cambia por completo. El correo basura y el phishing superan 0,98, y esas son justamente las decisiones binarias estrechas a las que apunta el diseño. Ejecutarlo en local elimina la factura por token y la lista de espera. Un paso de enrutado que cuesta decenas de milisegundos cabe dentro de una petición, y una llamada a un modelo grande no.

Presupueste el trabajo de calibración antes de fiarse de un número de confianza. Reajuste la temperatura por tipo de pregunta con sus propios datos. Después registre confianza y resultado durante una semana y compruebe si 0,7 significa de verdad el setenta por ciento. Este sitio sugirió la misma verificación para Jev, y un punto de control abierto al menos le deja hacerla usted.

Compruebe de paso la licencia frente a sus planes. Apache 2.0 permite uso comercial y modificación. La comparación honesta con una interfaz cerrada no es solo la latencia, sino también quién puede auditar el sistema cuando una decisión sale mal.

Fuentes

  1. Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
  2. convaiinnovations/laya model card - Hugging Face
  3. Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly

Artículos relacionados