Skip to content

Laya répond à Jev avec un modèle ouvert de 421M

Laya rend des décisions typées en 32,8 millisecondes à partir de 421 millions de paramètres, sous Apache 2.0. Sans réglage, sa précision frôle le hasard.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
A passively cooled data-center graphics card carrying an NVIDIA wordmark on its end plate, standing on a plain gray studio backdrop.

En chiffres

parameters, on a ModernBERT-large backbone
421M
median latency for one question on a Tesla T4
32.8 ms
zero-shot typed-decisions accuracy, against 0.318 for random
0.362

Convai Innovations a publié Laya, un modèle qui répond à des questions typées au lieu d'écrire du texte, sous licence Apache 2.0. Il compte 421 millions de paramètres et peut être téléchargé puis exécuté en local. C'est la différence qui compte, car le modèle commercial qu'il suit n'est accessible que par liste d'attente.

Laya reprend la forme de travail que ce site a décrite quand Jev, de TypeSafe, a rendu des décisions typées plutôt que du texte, le 15 septembre. Vous donnez au modèle un état, par exemple un courriel ou un document JSON, plus des questions dont le type de réponse est défini. Il remplit chaque réponse en une passe et attache à chacune un indice de confiance.

Ce qu'il y a vraiment dedans

La fiche du modèle décrit un petit assemblage plutôt qu'une architecture inédite. ModernBERT-large fournit 395 millions des paramètres. Au-dessus se trouve une tête de décision entraînée depuis zéro : deux couches de transformeur, un évaluateur des options de réponse, et une tête qui choisit entre agir et escalader.

Le point de contrôle anglais lit jusqu'à 512 jetons à la fois. Une variante multilingue utilise une autre base, mmBERT-base, compte 322 millions de paramètres, lit 1 024 jetons et couvre plus de 100 langues. Le modèle s'installe comme une bibliothèque Python.

Une fenêtre de 512 jetons est courte. Cela correspond à peu près à un courriel, pas à un fil d'assistance entier, et c'est la première limite à éprouver sur vos propres entrées.

L'affirmation de vitesse, et qui l'a mesurée

Le site du projet annonce une latence médiane de 32,8 millisecondes pour une question seule, sur une carte graphique Tesla T4. Par lots de dix, il annonce 7,2 millisecondes par question.

C'est le chiffre de comparaison qui exige de la prudence. La fiche situe Jev entre 236 et 276 millisecondes et parle d'une accélération de 7,8 fois. Elle précise aussi clairement que les "Jev figures are third-party published, never measured here."

Les récits diffèrent également sur le point de contrôle qui atteint 32,8 millisecondes. AI Weekly rapporte ce chiffre pour la variante multilingue et 39,5 millisecondes pour l'anglaise, tandis que le site du projet présente 32,8 millisecondes comme valeur phare. Les deux portent sur la même classe de matériel.

Les chiffres de précision se lisent deux fois

Les documents de Laya sont d'une franchise inhabituelle sur ce que signifie leur score principal.

MesureValeur
Décisions typées, réglé sur le jeu d'entraînement de ce test0,766
Décisions typées, sans réglage préalable0,362
Référence aléatoire sur le même test0,318
Référence de la classe majoritaire0,461
Filtrage du courrier indésirable0,993
Détection d'hameçonnage0,980
Banking77, détection d'intention0,425

La deuxième ligne mérite qu'on s'y arrête. Sans réglage, le modèle obtient 0,362 là où le hasard obtient 0,318 et où répondre toujours la réponse la plus fréquente donne 0,461. La fiche en tire elle-même la conclusion : "Laya is a fast base to specialise, not a zero-shot decision engine."

L'étalonnage suit le même schéma. Les indices de confiance doivent correspondre à la précision réelle, et l'erreur d'étalonnage rapportée part de 0,466. Elle n'atteint les 0,081 annoncés qu'après un réajustement de température par type de question, une étape que vous exécutez vous-même.

Le fondateur Nandakishor Mukkunnoth nomme une limite de plus : "Choice questions degrade with >20 options."

Ce que cela signifie pour les développeurs

Considérez ceci comme une base à régler, pas comme un service de décision prêt à l'emploi. L'écart entre 0,362 et 0,766 vient entièrement du jeu d'entraînement d'un test. Si vous ne pouvez pas étiqueter quelques milliers d'exemples de votre propre décision, c'est le chiffre sans réglage qui prédit vos résultats.

Là où il convient, l'économie change complètement. Le courrier indésirable et l'hameçonnage dépassent 0,98, et ce sont exactement les décisions binaires étroites que la conception vise. L'exécution locale supprime la facture au jeton et la liste d'attente. Une étape d'aiguillage de quelques dizaines de millisecondes tient dans un chemin de requête, ce qu'un appel à un grand modèle ne permet pas.

Prévoyez le travail d'étalonnage avant de croire un indice de confiance. Réajustez la température par type de question sur vos propres données. Consignez ensuite confiance et résultat pendant une semaine, puis vérifiez si 0,7 signifie vraiment soixante-dix pour cent. Ce site a recommandé la même vérification pour Jev, et un point de contrôle ouvert vous laisse au moins la faire vous-même.

Vérifiez au passage la licence face à vos projets. Apache 2.0 autorise l'usage commercial et la modification. La comparaison honnête avec une interface fermée porte donc sur la latence, mais aussi sur la question de savoir qui peut inspecter la chose quand une décision tourne mal.

Sources

  1. Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
  2. convaiinnovations/laya model card - Hugging Face
  3. Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly

Articles liés