Laya ist eine offene Antwort auf Jev mit 421M Parametern
Laya liefert typisierte Entscheidungen in 32,8 Millisekunden aus 421 Millionen Parametern unter Apache 2.0. Ohne Feinabstimmung liegt die Trefferquote nahe am Zufall.
3 Min. Lesezeit

Die Zahlen
- parameters, on a ModernBERT-large backbone
- 421M
- median latency for one question on a Tesla T4
- 32.8 ms
- zero-shot typed-decisions accuracy, against 0.318 for random
- 0.362
Convai Innovations hat Laya veröffentlicht, ein Modell, das typisierte Fragen beantwortet, statt Text zu schreiben, unter der Apache-2.0-Lizenz. Es umfasst 421 Millionen Parameter und lässt sich herunterladen und lokal ausführen. Genau das ist der Unterschied, denn das kommerzielle Vorbild gibt es nur über eine Warteliste.
Laya übernimmt dieselbe Art von Arbeit, über die diese Seite berichtete, als TypeSafes Jev typisierte Entscheidungen statt Text lieferte, am 15. September. Man übergibt dem Modell einen Zustand, etwa eine E-Mail oder ein JSON-Dokument, dazu Fragen mit festgelegten Antworttypen. Es füllt jede Antwort in einem Durchgang aus und hängt an jede eine Vertrauenszahl.
Was wirklich enthalten ist
Die Modellkarte beschreibt einen kleinen Aufbau und keine neue Architektur. ModernBERT-large liefert 395 Millionen der Parameter. Darüber sitzt ein von Grund auf trainierter Entscheidungskopf: zwei Transformer-Schichten, ein Bewerter für Antwortoptionen und ein Kopf, der zwischen Handeln und Eskalieren wählt.
Der englische Prüfpunkt liest bis zu 512 Token am Stück. Eine mehrsprachige Variante nutzt eine andere Basis, mmBERT-base, umfasst 322 Millionen Parameter, liest 1.024 Token und deckt mehr als 100 Sprachen ab. Installiert wird das Modell als Python-Bibliothek.
512 Token sind wenig. Das entspricht etwa einer E-Mail, nicht einem ganzen Support-Verlauf, und ist die erste Grenze, die Sie an Ihren eigenen Eingaben prüfen sollten.
Die Geschwindigkeitsangabe, und wer sie gemessen hat
Die Projektseite nennt eine mittlere Latenz von 32,8 Millisekunden für eine einzelne Frage auf einer Tesla-T4-Grafikkarte. Im Zehnerbündel meldet sie 7,2 Millisekunden je Frage.
Beim Vergleichswert ist Vorsicht nötig. Die Modellkarte setzt Jev bei 236 bis 276 Millisekunden an und spricht von 7,8-facher Beschleunigung. Sie sagt aber auch deutlich, die "Jev figures are third-party published, never measured here."
Die Angaben weichen auch darin ab, welcher Prüfpunkt die 32,8 Millisekunden erreichte. AI Weekly nennt diesen Wert für die mehrsprachige Variante und 39,5 Millisekunden für die englische, während die Projektseite 32,8 Millisekunden als Kennzahl führt. Beide beziehen sich auf dieselbe Hardwareklasse.
Die Trefferquoten muss man zweimal lesen
Layas eigene Unterlagen sind ungewöhnlich offen darüber, was der Spitzenwert bedeutet.
| Messung | Wert |
|---|---|
| Typisierte Entscheidungen, auf dem Trainingsteil dieses Tests feinabgestimmt | 0,766 |
| Typisierte Entscheidungen, ohne Feinabstimmung | 0,362 |
| Zufallsbasislinie im selben Test | 0,318 |
| Basislinie der häufigsten Klasse | 0,461 |
| Spam-Filterung bei E-Mail | 0,993 |
| Phishing-Erkennung | 0,980 |
| Banking77, Absichtserkennung | 0,425 |
Die zweite Zeile verdient Aufmerksamkeit. Ohne Feinabstimmung erreicht das Modell 0,362, während Raten 0,318 erreicht und die stets häufigste Antwort 0,461. Die Modellkarte zieht den Schluss selbst: "Laya is a fast base to specialise, not a zero-shot decision engine."
Bei der Kalibrierung zeigt sich dasselbe Muster. Vertrauenszahlen sollen zur tatsächlichen Treffergenauigkeit passen, und der gemeldete Kalibrierungsfehler beginnt bei 0,466. Die beworbenen 0,081 erreicht er erst nach einer Temperaturanpassung je Fragetyp, also nach einem Schritt, den Sie selbst ausführen.
Gründer Nandakishor Mukkunnoth nennt eine weitere Grenze: "Choice questions degrade with >20 options."
Was das für Entwickler bedeutet
Behandeln Sie das als Basis zum Feinabstimmen, nicht als fertigen Entscheidungsdienst. Der Abstand zwischen 0,362 und 0,766 entsteht allein aus dem Trainingsteil eines Tests. Wer nicht ein paar tausend eigene Beispiele beschriften kann, sollte sich am Wert ohne Feinabstimmung orientieren.
Wo es passt, ändert sich die Rechnung vollständig. Spam- und Phishing-Erkennung liegen über 0,98, und genau solche engen Ja-Nein-Entscheidungen zielt der Entwurf an. Lokaler Betrieb streicht zudem die Kosten je Token und die Warteliste. Ein Weiterleitungsschritt von einigen Dutzend Millisekunden passt in einen Anfragepfad, ein Aufruf an ein großes Modell nicht.
Planen Sie die Kalibrierungsarbeit ein, bevor Sie einer Vertrauenszahl glauben. Passen Sie die Temperatur je Fragetyp an Ihren eigenen Daten an. Protokollieren Sie danach eine Woche lang Vertrauen und Ergebnis und prüfen Sie, ob 0,7 wirklich siebzig Prozent bedeutet. Dieselbe Prüfung empfahl diese Seite für Jev, und ein offener Prüfpunkt erlaubt sie wenigstens im eigenen Haus.
Prüfen Sie dabei gleich die Lizenz gegen Ihre Pläne. Apache 2.0 erlaubt kommerzielle Nutzung und Änderungen. Der ehrliche Vergleich mit einer geschlossenen Schnittstelle betrifft daher nicht nur die Latenz, sondern auch die Frage, wer nachsehen darf, wenn eine Entscheidung schiefgeht.
Quellen
- Laya - 33ms Multilingual System 1 Decision Engine with Calibrated Probabilities - Convai Innovations
- convaiinnovations/laya model card - Hugging Face
- Convai ships Laya, a 421M ModernBERT decision model, Apache 2.0 - AI Weekly
Ähnliche Artikel

TypeSafes Jev liefert typisierte Entscheidungen, nicht Text
Jev antwortet in 70 bis 500 Millisekunden und kostet 0,042 Dollar pro Million Eingabe-Token, Ausgabe gratis. Text erzeugen kann es überhaupt nicht.

Salesforce Koa baut auf offenen Gewichten, liefert aber geschlossen
Salesforce sagt, Koa mache auf dem eigenen CRM Bench dreimal weniger Fehler, doch die Gewichte sind proprietär und das Modell läuft nur auf Salesforce-Infrastruktur.

Qwen3.5-9B braucht 32KB pro Token für den KV-Cache
Qwen3.5-9B nutzt volle Attention in nur 8 seiner 32 Schichten, daher kostet sein KV-Cache 32KB pro Token. Dieses Verhältnis entscheidet, ob er in 8GB passt.