Nach unserem Praxistest von Jev kam in den Kommentaren eine naheliegende Frage: Wie schlägt sich Laya? Laya ist ein offenes Modell unter Apache-2.0-Lizenz, das dieselbe Art Urteil liefert wie Jev und auf der eigenen Grafikkarte läuft. Kein Datenverkehr zu einem Anbieter, keine Kosten je Anfrage.

Die Frage ist berechtigt, denn Laya vergleicht sich selbst mit Jev. Die Modellkarte zeigt eine große Vergleichsgrafik und sagt dazu offen: Die Jev-Zahlen stammen von Dritten, gemessen wurde Jev dort nie. Wir haben Zugang zu beiden. Also haben wir beide mit denselben Eingaben gemessen.

Das Ergebnis vorweg, als Faustregel: Lokal ist ein Umbau, kein Tausch. Wer Jev gegen Laya austauscht und sonst nichts ändert, verliert. Wer den Aufbau um Laya herum neu denkt, bekommt Tempo und Unabhängigkeit, muss aber zwei Lücken selbst füllen.

Was Laya ist

Die Gewichte liegen beim Hugging-Face-Konto convaiinnovations, der Code auf GitHub. Es kennt dieselben drei Fragetypen wie Jev: eine Option aus einer Menge wählen (choice), eine Ja/Nein-Wahrscheinlichkeit (noul) und eine Stufe auf einer Skala (score). Es schreibt keinen Text, sondern gibt Wahrscheinlichkeiten zurück, und das in einem einzigen Rechendurchgang.

Dazu gibt es drei Checkpoints, also drei trainierte Fassungen des Modells:

  • ein englisches Modell auf Basis von ModernBERT-large mit 421 Millionen Parametern,
  • ein mehrsprachiges auf Basis von mmBERT-base mit 322 Millionen,
  • typed-decisions, ebenfalls 421 Millionen, trainiert auf typisierte Entscheidungen.

Ein mitgelieferter Router erkennt Schrift und Sprache und wählt danach den Checkpoint. Den empfiehlt die Modellkarte als Standardweg. Inzwischen gibt es außerdem laya-serve, einen Server mit derselben Schnittstelle wie Jev. Bestehende Programme sollen nur die Adresse ändern müssen.

Die Modellkarte nennt ihre Grenzen selbst: Bei mehr als 20 Optionen liegt Jev vorn, ab Werk sind die Wahrscheinlichkeiten zu selbstsicher, und Ja/Nein-Fragen können an den Bezeichnungen der Antworten hängen statt am Text. Die erste Grenze bestätigt sich bei uns deutlich. Bei der zweiten kommt es auf den Checkpoint an. Dazu kommen zwei Stellen, die wir dort nicht gefunden haben: das Auswählen von Werten aus einem Text und die mitgelieferte Vorauswahl.

Der Aufbau

Laya lief lokal auf einer RTX 4090, Jev wie im ersten Artikel über die API. Beide bekamen dieselben Fragen. Die kommen nicht aus einer Abschrift, sondern aus denselben Programmfunktionen, die schon die Anfragen an Jev gebaut haben. Gewertet hat für beide dasselbe Skript.

Gemessen haben wir zwei Teile:

# Teil Fälle Worum es geht
1 Acht kleine Aufgaben 628 Mail-Triage, Prompt-Injection, Behauptungsprüfung, KI-Ton, Alarme, Rechnungen, Schwächen-Probe und der öffentliche Satz deepset/prompt-injections
2 Skill-Routing 561 Welcher von 117 Skills passt zu einer Anfrage, dieselben Anfragen wie im ersten Artikel

Alles lief zero-shot, also ohne Nachtraining auf unseren Daten. Das ist die Frage, die uns gestellt wurde: Kann man Laya an die Stelle von Jev setzen?

Die acht kleinen Aufgaben

Hier gibt es zehn Maße. Jedes haben wir gepaart verglichen, also Fall für Fall über dieselben Eingaben.

# Aufgabe Maß n Jev Laya Router Laya typed-decisions
1 Prompt-Injection richtig 80 100,0 % 63,7 % 60,0 %
2 deepset richtig 116 75,0 % 66,4 % 66,4 %
3 KI-Ton richtig 58 100,0 % 43,1 % 63,8 %
4 Alarme richtig 68 100,0 % 70,6 % 75,0 %
5 Behauptungen richtig 74 97,3 % 86,5 % 73,0 %
6 Mail Kategorie 77 92,2 % 66,2 % 59,7 %
7 Mail Antwort nötig 77 89,6 % 40,3 % 37,7 %
8 Mail Dringlichkeit exakt 77 48,1 % 22,1 % 19,5 %
9 Rechnung Fälligkeit 60 83,3 % 15,0 % 8,3 %
10 Rechnung Betrag 60 100,0 % 31,7 % 23,3 %
Prompt-InjectionLaya Router 63,7 %Laya typed-decisions 60,0 %Jev 100,0 %deepsetLaya Router 66,4 %Laya typed-decisions 66,4 %Jev 75,0 %KI-TonLaya Router 43,1 %Laya typed-decisions 63,8 %Jev 100,0 %AlarmeLaya Router 70,6 %Laya typed-decisions 75,0 %Jev 100,0 %BehauptungenLaya Router 86,5 %Laya typed-decisions 73,0 %Jev 97,3 %Mail: KategorieLaya Router 66,2 %Laya typed-decisions 59,7 %Jev 92,2 %Mail: Antwort nötigLaya Router 40,3 %Laya typed-decisions 37,7 %Jev 89,6 %Mail: DringlichkeitLaya Router 22,1 %Laya typed-decisions 19,5 %Jev 48,1 %Rechnung: FälligkeitLaya Router 15,0 %Laya typed-decisions 8,3 %Jev 83,3 %Rechnung: BetragLaya Router 31,7 %Laya typed-decisions 23,3 %Jev 100,0 %0255075100JevLaya RouterLaya typed-decisionsAnteil richtig in Prozent
Dieselben 628 Fälle, zehn Maße. Der gefüllte Punkt ist Jev, der Kreis der Laya-Router, die Raute der Checkpoint typed-decisions, beide mit Voreinstellungen. In keinem Maß liegt Laya vorn. Am weitesten auseinander liegen die Aufgaben, bei denen ein Wert aus dem Text zu wählen ist.

Mit den Voreinstellungen verliert Laya alle zehn Maße. Neun Abstände sind statistisch abgesichert (p unter 0,05), nur deepset beim Router nicht. Vier der zehn Maße stehen bei Jev auf 100 Prozent. Dort sind unsere synthetischen Sätze zu leicht, und der Abstand misst teils diese Decke.

Die Tabelle ist aber nicht die ganze Geschichte. Zwei Stellschrauben holen viel zurück.

Der Checkpoint entscheidet

Beim KI-Ton ordnet der Router die Texte so gut wie zufällig: Die AUROC liegt bei 46,0 Prozent. Die AUROC misst, ob ein Modell die Fälle richtig sortiert, unabhängig von einer Schwelle. 50 Prozent heißt Raten. Dieselben Fragen auf typed-decisions ergeben 93,8 Prozent. Der Router wählt nach Sprache, nicht nach Aufgabe, und für diese Aufgaben wählt er falsch.

Die Schwelle entscheidet

Laya wertet eine Ja/Nein-Frage ab Werk bei 0,5. Misst man die Schwelle stattdessen auf einem Teil der Daten ein und prüft auf dem anderen, steigt typed-decisions beim KI-Ton von 63,8 auf 77,6 Prozent. Auf deepset kommt es auf 81,9 Prozent gegen Jevs 89,7. Die 89,7 sind genau die Zahl aus dem ersten Artikel, und alle drei Werte sind mit demselben Verfahren gerechnet, zwei Teilungen der Daten. Der Abstand bei deepset ist knapp abgesichert (p = 0,049).

Wer Laya mit 0,5 misst, misst also die Voreinstellung. Bei kurzen Ja/Nein-Urteilen kommt Laya mit dem richtigen Checkpoint und einer eingemessenen Schwelle in Reichweite, bleibt aber hinter Jev.

Beim Auswählen bricht es ein

Anders sieht es aus, wenn ein Wert aus dem Text zu wählen ist. Bei der Rechnung bekommt das Modell mehrere Datumsangaben und soll die Fälligkeit nennen. Der Router trifft 15,0 Prozent, typed-decisions 8,3. Zufällig geraten wären es 24 Prozent. Jev liegt bei 83,3. Hier hilft keine Schwelle, weil es nichts zu schwellen gibt.

Wie gut Jev genau diese Art Angabe aus echten Rechnungen liest, zeigt unser Labor. Dort bekommt Jev nur die Freitexte von 34 öffentlichen Testrechnungen und sagt zu zehn Angaben, ob sie im Text stehen. Die Messung lässt sich abspielen, die Schwellen kann man selbst verschieben.

Eine Frage läuft sogar verkehrt herum. Bei „Antwort nötig” in der Mail-Triage liegt die AUROC bei 31,8 Prozent für typed-decisions und 35,7 für den Router. Die Wahrscheinlichkeit zeigt in die falsche Richtung. Das passt zu einer Grenze, die die Modellkarte selbst nennt (Issue 156): Eine Ja/Nein-Frage kann den Bezeichnungen „false” und „true” folgen statt dem Text. Als Umweg empfiehlt die Karte, dieselbe Frage als Auswahl aus zwei neutral benannten Optionen zu stellen. Das haben wir nicht getestet, alle Ja/Nein-Fragen liefen so, wie sie auch an Jev gingen.

Das Skill-Routing

Unser Assistent hat 117 Skills. Jev bekommt im ersten Durchgang alle 117 Beschreibungen in einer Frage, im Median 23.766 Token. Laya kann diese Frage gar nicht annehmen. Sein Encoder, der Teil des Modells, der den Text liest, trägt höchstens 8.192 Token. Und davon bekommen alle Optionen zusammen ab Werk nur 256.

Frage an Jev: 117 BeschreibungenMedian 23.766 TokenLaya: was der Encoder höchstens liest8.192 TokenLaya: Budget im Versuch4.096 TokenLaya ab Werk: alle Optionen zusammen256 Token, rund 2 je Skill010.00020.00030.000Token, gleiche Skala für alle Balken
Die Routing-Frage passt nicht hinein. Selbst das Maximum des Encoders ist rund ein Drittel dessen, was Jev liest. Ab Werk teilen sich die 117 Optionen 256 Token. Das Budget zu heben hat im Versuch nicht geholfen.

Das Ergebnis ist entsprechend:

# Aufbau richtig auf Platz 1
1 Jev, erster Durchgang, alle 117 Optionen 88,8 %
2 Jev, volle Kette mit zweitem Durchgang 90,6 %
3 Laya, alle 117 Optionen 5,5 %
4 Laya, alle 117 Optionen, Budget auf 4.096 von 8.192 Token 4,3 %
5 Laya, eigene Vorauswahl auf 20, dann entscheiden 4,1 bis 4,9 %
6 Laya, Jevs drei Kandidaten, mehrsprachig 42,2 %
7 Laya, Jevs drei Kandidaten, typed-decisions 52,2 %

Gewertet über die 490 Anfragen, denen ein Skill zugeordnet ist. Richtig heißt: Platz 1 ist der gemeinte Skill oder eine geprüfte Alternative. Deshalb weichen die Jev-Werte von der Tabelle im ersten Artikel ab, der anders zählt. Jeder Laya-Aufbau liegt gepaart mit p unter 0,0001 hinter Jev.

Die Vorauswahl fehlt

Für große Optionsmengen nennt das GitHub-README von Laya zwei Wege: das Budget heben oder erst per Einbettung vorwählen und dann über die kleine Menge entscheiden. Das Budget haben wir oben gehoben. Für die Vorauswahl haben wir genau den mitgelieferten Weg genommen. Unter seinen 20 Vorschlägen liegt der richtige Skill in 19,4 Prozent der Fälle mit dem mehrsprachigen Checkpoint und in 22,7 Prozent mit typed-decisions. Blind gezogen wären es 18,2 Prozent. Eine reine Wortsuche (BM25) schafft 56,7.

Die mitgelieferte Vorauswahl trägt also nicht. Sie mittelt die inneren Zustände des Encoders, und das ist keine Darstellung, die auf Suche trainiert wurde. Wer lokal baut, braucht dafür ein eigenes Suchmodell. Das haben wir nicht gemessen.

Die Feinunterscheidung trägt auch nicht

Die Zeilen 6 und 7 sind der fairste Vergleich. Laya bekommt dort genau die drei Kandidaten, die Jev nach dem ersten Durchgang behalten hat, mit voller Beschreibung. Eine Kontextgrenze gibt es da nicht mehr. Zählt man nur die 478 Anfragen, bei denen der richtige Skill unter den drei liegt, trifft Laya mit typed-decisions 53,6 Prozent und mit dem mehrsprachigen Checkpoint 43,3. Der Zufall liegt bei drei Optionen bei 33,3, Jev bei 92,9.

Das ist für mich der entscheidende Befund. Selbst wo der Kontext kein Hindernis ist, liegt Laya rund 20 Punkte über dem Zufall und Jev fast 60.

Kalibrierung

Bei Jev haben wir im ersten Artikel viel über Kalibrierung geschrieben. Gemeint ist, ob eine angegebene Sicherheit von 90 Prozent auch in 90 Prozent der Fälle stimmt. Auf der Testhälfte des Routings sieht das so aus:

# Modell n ECE Antworten ab 99 % Sicherheit davon richtig Antworten unter 50 %
1 Jev, erster Durchgang über 117 Optionen 257 0,056 103 100,0 % 21
2 Laya typed-decisions, drei Kandidaten 257 0,083 0 215
3 Laya mehrsprachig, drei Kandidaten 257 0,365 27 22,2 % 36

Die Aufgaben sind nicht gleich: Jev entscheidet über 117 Optionen, Laya über drei. Verglichen wird hier nur, ob die angegebene Sicherheit zur Trefferquote passt.

Jev, erster Durchgang: alle Antworten mit mindestens 99 % Sicherheitangegeben im Mittel 99,8 % · richtig 103 von 103 = 100,0 %Laya mehrsprachig, drei Kandidaten: alle Antworten mit mindestens 99 % Sicherheitangegeben im Mittel 99,6 % · richtig 6 von 27 = 22,2 %richtiger Skillfalscher Skill
Jeder Punkt ist eine Anfrage aus der Testhälfte, bei der das Modell mindestens 99 Prozent Sicherheit angibt. Gefüllt heißt richtiger Skill, Ring heißt falscher Skill. Wer bei Laya mehrsprachig ab 99 Prozent automatisch handelt, liegt meistens falsch.

Die ECE ist die mittlere Lücke zwischen angegebener Sicherheit und Trefferquote, kleiner ist besser. Der mehrsprachige Checkpoint sagt im obersten Band 99,6 Prozent und liegt in 22,2 Prozent richtig. Das ist genau der Fehler, den die Laya-Seite generativen Modellen vorwirft. Die Karte des mehrsprachigen Modells nennt den Grund: Es wird ohne angepasste Temperatur ausgeliefert. typed-decisions ist das Gegenteil. Es gibt in 215 von 257 Fällen weniger als 50 Prozent an und trifft in jedem belegten Band häufiger, als es angibt. Es ist also eher zu vorsichtig als zu selbstsicher.

Tempo

Hier ist Laya klar vorn. Eine Anfrage dauert auf der 4090 mit Version 0.3.20 im Median rund 21 Millisekunden, mit 0.3.5 waren es 22. Jev brauchte bei uns 694 Millisekunden je Anfrage, das ist aber die Rundreise zur API mit acht parallelen Anfragen und unserer Leitung. Unabhängige Messungen sehen Jev bei 236 bis 276 Millisekunden. Beides ist nicht dasselbe Maß, die Richtung ist trotzdem eindeutig.

Geld ist dagegen kein Argument. Jev hat für alle 628 kleinen Fälle zusammen 0,0149 US-Dollar gekostet.

Zwei Erklärungen, die nicht gestimmt haben

Meine erste Vermutung war das Optionsbudget. Laya teilt seinen Kontext in einen Teil für die Optionen und einen für den Text. Bei den Rechnungsfragen sind die Optionen länger als die voreingestellten 256 Token. Also haben wir das Budget auf 512 gehoben. Bei Behauptungen, Mail und Fälligkeit änderte sich keine einzige Antwort, und der Betrag wurde schlechter, von 23,3 auf 10,0 Prozent.

Im Routing habe ich es ein zweites Mal versucht, mit 4.096 statt 256 Token für die Optionen. Die Quote sank von 5,5 auf 4,3 Prozent, bei vier- bis sechsmal so langer Rechenzeit je nach Version. Das Budget ist nicht der Grund.

Dazu eine Korrektur vor der Veröffentlichung: In meinem Entwurf für die Antwort auf LinkedIn stand zuerst, Laya liege bei deepset gleichauf mit Jev. Das hing am Rechenverfahren. Mit fünf Teilungen der Daten war der Abstand nicht abgesichert, mit den zwei aus dem ersten Artikel schon. Rausgegangen ist die Fassung mit dem Verfahren aus dem Artikel, und so steht es auch hier.

Nachgemessen mit Version 0.3.20

Gemessen haben wir am 22. September mit Laya 0.3.5. Bis zum Morgen des 24. September sind 13 weitere Versionen erschienen. Ein Artikel über alte Zahlen wäre dem Projekt gegenüber unfair, also haben wir alle Läufe mit 0.3.20 wiederholt.

Die Gewichte auf Hugging Face sind seit dem 19. September unverändert, das sagen auch die Release-Notes. Neu ist nur die Bibliothek drumherum. Von 4.833 Fällen sind 4.818 in jeder einzelnen Antwort identisch. Die übrigen 15 sind Router-Fälle, die die neue Spracherkennung jetzt an das mehrsprachige statt an das englische Modell gibt. Dadurch verschieben sich zwei Werte leicht: deepset beim Router von 66,4 auf 67,2 Prozent, Alarme von 70,6 auf 66,2. Alle Aussagen oben bleiben stehen.

Grenzen dieser Messung

# Grenze
1 Alles zero-shot. Die Modellkarte nennt die Checkpoints eine Basis zum Spezialisieren und liefert ein Notebook zum Nachtrainieren. Das haben wir nicht getestet.
2 117 Skills sind unser Bestand. Bei zehn oder zwanzig Optionen sähe das Routing anders aus, darüber sagt diese Messung nichts.
3 Ein eigenes Suchmodell vor Laya haben wir nicht gemessen. Das ist der Aufbau, der klären würde, ob lokal mit zwei Modellen trägt.
4 Die meisten Testsätze sind synthetisch, von Claude Sonnet erzeugt und von Claude Opus geprüft. Der einzige öffentliche, von Menschen gelabelte Satz ist deepset, und dort ist der Abstand am kleinsten.
5 Zeit: Jev ist eine Rundreise zur API, Laya ein Durchgang auf der lokalen Karte.
6 Ja/Nein-Fragen liefen als noul, wie bei Jev. Den Umweg über eine Auswahl aus zwei Optionen, den die Modellkarte für Issue 156 empfiehlt, haben wir nicht getestet.

Was wir daraus mitnehmen

Laya ist ein ernsthaftes Projekt, das sich schnell bewegt und seine Grenzen offen dokumentiert. Für kurze Ja/Nein-Urteile auf eigener Hardware kommt es in Reichweite, wenn man den Checkpoint bewusst wählt und die Schwelle einmisst.

Für unseren Anwendungsfall reicht das nicht. Viele Optionen, Werte aus Text wählen und feine Unterschiede zwischen ähnlichen Skills kann Jev deutlich besser. Wer lokal bleiben will, baut sich ein Suchmodell davor und trainiert auf eigenen Daten nach. Das ist ein Projekt, keine Konfigurationsänderung.

Offen ist, was Nachtrainieren auf eigenen Daten bringt. Stand heute gilt die Faustregel vom Anfang.

Quellen

Alles Öffentliche, am 24. September 2026 abgerufen.

Die Laya-Werte stammen aus unseren Läufen auf einer RTX 4090 mit laya 0.3.5 (22. September 2026) und 0.3.20 (24. September 2026), torch 2.11.0. Die Jev-Werte stammen aus den Läufen zum ersten Artikel, Modellversion jev-1.13.0.