Laya responde a Jev con un modelo abierto de 421M
Laya devuelve decisiones tipadas en 32,8 milisegundos con 421 millones de parámetros y licencia Apache 2.0. Sin ajuste, su acierto roza el azar.
3 min de lectura

En cifras
- parameters, on a ModernBERT-large backbone
- 421M
- median latency for one question on a Tesla T4
- 32.8 ms
- zero-shot typed-decisions accuracy, against 0.318 for random
- 0.362
Convai Innovations ha publicado Laya, un modelo que responde a preguntas tipadas en lugar de escribir texto, con licencia Apache 2.0. Tiene 421 millones de parámetros y se puede descargar y ejecutar en local. Esa es la diferencia que importa, porque el modelo comercial al que sigue solo está disponible por lista de espera.
Laya hace el mismo tipo de trabajo que este sitio describió cuando Jev, de TypeSafe, devolvió decisiones tipadas en vez de texto, el 15 de septiembre. Se le entrega un estado, por ejemplo un correo o un documento JSON, junto a preguntas con tipos de respuesta definidos. El modelo rellena cada respuesta en una sola pasada y añade a cada una un número de confianza.
Qué hay realmente dentro
La ficha del modelo describe un montaje pequeño y no una arquitectura nueva. ModernBERT-large aporta 395 millones de los parámetros. Encima se sitúa una cabeza de decisión entrenada desde cero: dos capas de transformador, un evaluador de opciones de respuesta y una cabeza que elige entre actuar y escalar.
El punto de control en inglés lee hasta 512 tokens de una vez. Una variante multilingüe usa otra base, mmBERT-base, tiene 322 millones de parámetros, lee 1.024 tokens y cubre más de 100 idiomas. El modelo se instala como biblioteca de Python.
Una ventana de 512 tokens es corta. Equivale más o menos a un correo, no a un hilo de soporte entero, y es el primer límite que conviene probar con sus propias entradas.
La afirmación de velocidad, y quién la midió
El sitio del proyecto indica una latencia mediana de 32,8 milisegundos para una sola pregunta en una tarjeta gráfica Tesla T4. En lotes de diez, indica 7,2 milisegundos por pregunta.
La cifra de comparación es la que exige cuidado. La ficha sitúa a Jev entre 236 y 276 milisegundos y habla de una aceleración de 7,8 veces. También dice con claridad que las "Jev figures are third-party published, never measured here."
Los relatos difieren además sobre qué punto de control logró los 32,8 milisegundos. AI Weekly informa de esa cifra para la variante multilingüe y de 39,5 milisegundos para la inglesa, mientras que el sitio del proyecto presenta 32,8 milisegundos como dato principal. Ambas se refieren a la misma clase de hardware.
Las cifras de acierto hay que leerlas dos veces
Los propios materiales de Laya son poco habituales por su franqueza sobre lo que significa su cifra estrella.
| Medición | Valor |
|---|---|
| Decisiones tipadas, ajustado con la partición de entrenamiento de esa prueba | 0,766 |
| Decisiones tipadas, sin ajuste previo | 0,362 |
| Referencia aleatoria en la misma prueba | 0,318 |
| Referencia de la clase mayoritaria | 0,461 |
| Filtrado de correo basura | 0,993 |
| Detección de phishing | 0,980 |
| Banking77, detección de intención | 0,425 |
La segunda fila merece una pausa. Sin ajuste, el modelo obtiene 0,362 donde adivinar obtiene 0,318 y responder siempre lo más frecuente da 0,461. La ficha extrae ella misma la conclusión: "Laya is a fast base to specialise, not a zero-shot decision engine."
La calibración sigue el mismo patrón. Los números de confianza deberían coincidir con el acierto real, y el error de calibración que se informa parte de 0,466. Solo llega al 0,081 anunciado tras reajustar la temperatura para cada tipo de pregunta, un paso que ejecuta usted.
El fundador Nandakishor Mukkunnoth señala otro límite: "Choice questions degrade with >20 options."
Qué significa esto para los desarrolladores
Trátelo como una base para ajustar, no como un servicio de decisión listo para usar. La distancia entre 0,362 y 0,766 procede por completo de la partición de entrenamiento de una prueba. Si no puede etiquetar unos miles de ejemplos de su propia decisión, la cifra sin ajuste es la que predice sus resultados.
Donde encaja, la economía cambia por completo. El correo basura y el phishing superan 0,98, y esas son justamente las decisiones binarias estrechas a las que apunta el diseño. Ejecutarlo en local elimina la factura por token y la lista de espera. Un paso de enrutado que cuesta decenas de milisegundos cabe dentro de una petición, y una llamada a un modelo grande no.
Presupueste el trabajo de calibración antes de fiarse de un número de confianza. Reajuste la temperatura por tipo de pregunta con sus propios datos. Después registre confianza y resultado durante una semana y compruebe si 0,7 significa de verdad el setenta por ciento. Este sitio sugirió la misma verificación para Jev, y un punto de control abierto al menos le deja hacerla usted.
Compruebe de paso la licencia frente a sus planes. Apache 2.0 permite uso comercial y modificación. La comparación honesta con una interfaz cerrada no es solo la latencia, sino también quién puede auditar el sistema cuando una decisión sale mal.
Fuentes
- Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
- convaiinnovations/laya model card - Hugging Face
- Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly
Artículos relacionados

Jev, de TypeSafe, devuelve decisiones tipadas, no texto
Jev responde en 70 a 500 milisegundos y cuesta 0,042 dólares por millón de tokens de entrada, con salida gratis. No sabe generar texto en absoluto.

Salesforce Koa parte de pesos abiertos pero sale cerrado
Salesforce dice que Koa comete tres veces menos errores en su propio CRM Bench, pero los pesos son propietarios y el modelo solo corre en su infraestructura.

Qwen3.5-9B gasta 32 KB por token en la caché KV
Qwen3.5-9B usa atención completa en solo 8 de sus 32 capas, así que su caché KV cuesta 32 KB por token. Esa proporción decide si cabe en 8 GB.