Seit dem 15. September steht Jev in vielen Feeds. TypeSafe hat das Modell an diesem Tag veröffentlicht, zusammen mit einer Finanzierungsrunde und einer Doom-Demo, über die auch The Register geschrieben hat. Jev schreibt keinen Text. Es liefert typisierte Urteile mit Wahrscheinlichkeit: eine Option aus einer Menge, ein Ja oder Nein als Wahrscheinlichkeit, eine Stufe auf einer Skala.

Wir haben es nicht kommentiert, wir haben es gemessen. Vier Tage nach der Veröffentlichung, an einer Aufgabe, die wir jeden Tag haben.

Unser interner Assistent hat 117 Skills. Jede Anfrage beginnt deshalb mit einer Entscheidung, bevor irgendetwas passiert: welches Werkzeug ist hier das richtige, und braucht es überhaupt eines? Wer sich diese Entscheidung ansieht, findet dort eine Liste aus Namen und je einer Zeile Beschreibung. Mehr hat das Modell nicht, wenn es wählt. Genau dafür schlägt TypeSafe im Kochbuch zum Skill-Vorschlag ein vorgeschaltetes Urteil vor, gemessen an 182 Skills eines fremden Harness.

Dieser Artikel zeigt den Aufbau, alle Zahlen und die Stellen, an denen wir uns geirrt haben.

Was andere in den ersten Tagen gebaut haben

In den vier Tagen bis zu unserem Test sind mehrere Projekte entstanden, die wir nicht nachgemessen haben und deshalb nur als Fundstellen nennen: ein Browser-Agent, der das nächste Element auswählt statt es zu beschreiben, ein Handelsbot mit einer Entscheidung je Block, ein offener Nachbau auf eigener Hardware und ein Werkstattbericht von LangChain. Die Vergleichszahlen des Herstellers selbst sind bereits öffentlich kritisiert worden, weil sie von TypeSafe selbst gemessen wurden.

Unsere Zahlen unten sind ebenfalls selbst gemessen. Der Unterschied ist, dass wir das Testmaterial, die Fragen und die Grenzen offenlegen.

Der Aufbau

1.732 Beispiele, elf Tests, zwei Blöcke. Der erste Block stellt eine Frage: findet ein Router aus einer Anfrage den richtigen Skill? Der zweite Block prüft, was das Modell sonst kann, und endet mit einem öffentlichen Benchmark, den wir nicht selbst gebaut haben.

Sonnet erzeugtAnfragen und BeispieleProgramm erzeugtSchwächen-Probe, exaktÖffentliche Datendeepset/prompt-injectionsOpus prüftLabel, Alternativen, WortlautTestmaterial1.732 BeispieleJevClaude HaikuClaude OpusWortsuche BM25AuswertungTreffer, IntervallMcNemar, Brier
Nur die von Sonnet erzeugten Anfragen laufen durch die Prüfung. Die Schwächen-Probe entsteht im Programm mit exakten Antworten, der öffentliche Datensatz kommt von außen. Alle vier Router sehen dieselben Beispiele.

Die 561 realistischen Anfragen hat Claude Sonnet aus den Skill-Dateien geschrieben, Claude Opus hat jede Zuordnung geprüft, gleichwertige Alternativen ergänzt und Unklares verworfen. Die Schwächen-Probe entsteht im Programm, dort stehen die richtigen Antworten exakt fest. Jede Trefferquote trägt ein 95-Prozent-Intervall nach Wilson, jeder Vergleich zwischen zwei Routern läuft gepaart über dieselben Anfragen mit einem exakten McNemar-Test.

Block 1: den richtigen Skill wählen

Test Anfragen Daten Router
Trigger-Sätze 508 mit Skill, 35 ohne aus den Beschreibungen gezogen, Beschreibung dafür ohne Trigger Jev, Wortsuche
Realistische Anfragen 561: 461 mit Skill, 29 nach fehlenden Diensten, 71 ohne Skill Sonnet schreibt, Opus prüft Jev in drei Varianten, Wortsuche, Haiku und Opus je ohne und mit Jev-Hinweis
Nach dem Schärfen der Beschreibungen 297, die Testhälfte dieselben Anfragen, neue Beschreibungen dieselben fünf Router

Block 2: acht weitere Aufgaben

Aufgabe Fragetyp n Daten
Mail-Triage: Kategorie, Antwort nötig, Dringlichkeit Choice, Noul, Score 77 synthetisch, geprüft
Prompt-Injection erkennen Noul 80 synthetisch, vier Härtegrade
Behauptung gegen Quelle prüfen Choice 74 synthetisch, je Text drei Behauptungen
Klingt der Text nach KI Noul 58 synthetisch, halb und halb
Ist ein Alarm umsetzbar Noul 68 synthetisch, Betrieb und Rauschen
Rechnung: Fälligkeit und Zahlbetrag Choice über Kandidaten 60 synthetisch, mehrere Daten je Text
Schwächen-Probe: zählen, Datum, Zahlen, Verneinung, rechnen Choice und Noul 95 im Programm erzeugt, Labels exakt
deepset/prompt-injections Noul 116 öffentlich, von Menschen gelabelt

Dieselben Definitionen gingen auch an Claude Haiku und Claude Opus, dort als Stapel-Auftrag in normaler Sprache statt als typisierte Frage.

Ergebnis 1: Jev landet auf dem Niveau des kleinen Modells

Claude Opus allein94,3 %Claude Opus mit Jev-Hinweis93,2 %Claude Haiku mit Jev-Hinweis87,9 %Jev allein84,3 %Jev ohne Trigger, gekürzt83,2 %Jev gekürzt83,1 %Claude Haiku allein82,7 %0255075100Anteil richtig über alle 561 Anfragen, Balken mit 95-Prozent-Intervall
Sieben Router auf denselben 561 Anfragen. Die Querlinie ist das 95-Prozent-Intervall. Jev liegt auf dem Niveau von Claude Haiku, Claude Opus liegt darüber.
Router gesamt richtig Skill richtig falscher Skill keiner gewählt Fehlalarm
Claude Opus allein 94,3 % 93,5 % 1,0 % 5,5 % 0,0 %
Claude Opus mit Jev-Hinweis 93,2 % 92,2 % 2,0 % 5,7 % 0,0 %
Claude Haiku mit Jev-Hinweis 87,9 % 86,5 % 6,7 % 6,7 % 2,8 %
Jev allein, volle Beschreibungen 84,3 % 82,9 % 6,7 % 10,4 % 5,6 %
Jev allein, ohne Trigger, gekürzt 83,2 % 81,8 % 7,3 % 10,8 % 7,0 %
Jev allein, Beschreibung gekürzt 83,1 % 81,4 % 6,7 % 11,8 % 5,6 %
Claude Haiku allein 82,7 % 80,4 % 11,0 % 8,6 % 1,4 %

Die Spalte „gesamt richtig” zählt über alle 561 Anfragen, die drei mittleren Spalten über die 490 Anfragen mit Skill, der Fehlalarm über die 71 Anfragen ohne Skill. Die Wortsuche BM25 steht nicht in der Tabelle, weil sie nie „keiner” antworten kann. Auf den Anfragen mit Skill trifft sie 19,0 Prozent auf Platz 1, über alle Anfragen gerechnet 16,6 Prozent.

Auf den Trigger-Sätzen traf dieselbe Wortsuche noch 52,6 Prozent, auf echten Anfragen 19,0. Dieser Abfall zeigt das Grundproblem: echte Anfragen enthalten die Wörter der Beschreibung nicht. Wer fragt, ob die Sicherung heute Nacht durchgelaufen ist, benutzt kein Stichwort aus dem passenden Skill.

Welche Unterschiede halten

Vergleich nur a richtig nur b richtig p
Haiku allein / Haiku mit Hinweis 15 44 0,0002
Opus allein / Opus mit Hinweis 6 0 0,031
Jev / Haiku allein 46 37 0,38
Jev / Opus allein 0 56 kleiner als 0,001
Jev ohne Trigger, gekürzt / Jev volle Beschreibungen 11 17 0,34

Der Abstand zwischen Jev und Haiku ist nicht abgesichert, der Abstand zu Opus schon.

Nach Art der Anfrage

Gruppe n Haiku Haiku mit Hinweis Jev Opus
Anfragen mit passendem Skill 461 85,5 % 92,0 % 88,1 % 99,3 %
Anfragen nach fehlenden Diensten 29 0,0 % 0,0 % 0,0 % 0,0 %
Alltag, kein Skill nötig 20 100 % 100 % 100 % 100 %
Technikfrage, kein Skill nötig 25 100 % 100 % 100 % 100 %
Routinearbeit im Repo, kein Skill 25 96,0 % 92,0 % 84,0 % 100 %
deutsche Anfragen 428 82,0 % 86,9 % 83,2 % 94,2 %
englische Anfragen 133 85,0 % 91,0 % 88,0 % 94,7 %
kurze Anfragen 177 76,3 % 80,2 % 78,5 % 87,6 %
lange Anfragen 116 87,9 % 93,1 % 90,5 % 99,1 %

Die oberen fünf Gruppen ergeben zusammen 560 Anfragen. Die eine fehlende Gegenprobe fragt nach einem Dienst, den es nicht gibt, und steht deshalb nicht unter „kein Skill nötig”.

Zwei Zeilen fallen auf. Kurze Anfragen sind für jeden Router schwerer als lange, der Abstand beträgt rund zehn Punkte. Und die zweite Zeile steht bei allen auf null. Dazu gleich mehr.

Ergebnis 2: Ein Zusatzurteil hilft dem kleinen Modell und stört das große

Wir haben Jevs Vorschlag als Hinweis in den Prompt gelegt, so wie es das Kochbuch des Herstellers vorschlägt. Haiku steigt damit um 5,2 Punkte, und dieser Gewinn ist abgesichert. Opus verliert 1,1 Punkte. Sechs Fälle kippen von richtig nach falsch, keiner in die andere Richtung.

Daraus ist bei uns eine Faustregel geworden: Ein fremdes Urteil hilft dem Modell, das unsicher ist, und nimmt dem sicheren Modell die eigene Entscheidung ab. Wer ein starkes Modell fährt, kauft mit einem Vorschalt-Router vor allem eine zweite Meinung ein, die er nicht gebraucht hätte.

Ergebnis 3: Stimmen die Wahrscheinlichkeiten?

Jev liefert zu jeder Wahl eine Wahrscheinlichkeit. Die Frage ist, ob man ihr trauen kann.

0 bis 50 %n = 3941,0 %50 bis 70 %n = 6468,8 %70 bis 90 %n = 8987,6 %90 bis 99 %n = 11499,1 %99 bis 100 %n = 184100,0 %0255075100vom Modell angegebene Sicherheittatsächlich richtig
Die 490 Anfragen mit Skill, gruppiert nach der Wahrscheinlichkeit, die Jev seinem ersten Platz gibt. Der offene Punkt ist die angegebene Sicherheit, der gefüllte die tatsächliche Trefferquote. Steht der gefüllte hier rechts, ist das Modell vorsichtiger als nötig.
Sicherheit für Platz 1 n mittlere Sicherheit tatsächlich richtig
0 bis 50 % 39 34,0 % 41,0 %
50 bis 70 % 64 59,7 % 68,8 %
70 bis 90 % 89 80,3 % 87,6 %
90 bis 99 % 114 94,9 % 99,1 %
99 bis 100 % 184 99,8 % 100 %

Das Modell ist durchgehend etwas vorsichtiger als nötig. Für die Praxis zählt die letzte Zeile: ab 99 Prozent Sicherheit stimmte die Wahl in allen 184 Fällen. Damit lässt sich eine Schwelle bauen, ab der man einem Vorschlag folgt und unterhalb derer man ihn verwirft. Wie viel diese Schwelle abdeckt und was mit dem Rest passiert, steht im Nachtrag am Ende.

Robustheit der Wertung

Opus hat die Labels geprüft und wird zugleich gemessen. Das kann Opus begünstigen. Deshalb haben wir dieselben Antworten noch zweimal anders gewertet: einmal streng, also nur der ursprünglich gemeinte Skill ohne die von Opus ergänzten Alternativen, und einmal nur auf den Anfragen, an denen die Prüfung nichts geändert hat.

Router normal, alle 561 streng, alle 561 streng, nur die 439 unveränderten
Claude Opus allein 94,3 % 92,9 % 97,9 %
Claude Opus mit Hinweis 93,2 % 92,0 % 97,0 %
Claude Haiku mit Hinweis 87,9 % 86,6 % 92,3 %
Jev allein 84,3 % 83,2 % 88,6 %
Claude Haiku allein 82,7 % 81,6 % 87,5 %

Die Reihenfolge bleibt in allen drei Wertungen gleich.

Ergebnis 4: Die Lücke, die kein Router geschlossen hat

Ein Teil der Testanfragen zielt auf Dienste, die bei uns gar nicht angebunden sind. Ein Ticket in einem fremden Tracker, eine Seite in einer Notiz-App, eine Zahlung bei einem Zahlungsdienst. Für diesen Fall gibt es bei uns einen Skill. Er prüft, ob wirklich eine Lücke vorliegt, und macht dann einen Vorschlag, statt selbst loszulaufen.

Trefferquote bei diesen Anfragen: null Prozent. Bei allen fünf Routern, Opus eingeschlossen.

Das Modell war nicht das Problem. Die Beschreibung war es. Sie sagte, wofür der Skill gedacht ist, aber nicht so, dass ein Router es an einer normalen Anfrage erkennt. Bei Jev lässt sich das in der Rangliste sehen: in diesen 29 Anfragen stand der Skill 14 mal auf Platz 1 und 25 mal unter den ersten drei. Verworfen hat ihn jedes Mal die Vorprüfung der zweistufigen Kette.

Also haben wir 39 verwechselte Beschreibungen geschärft. Opus schrieb, ein zweiter Opus-Lauf prüfte jede neue Fassung gegen die eigentliche Skill-Datei. Gemessen wurde auf der Hälfte der Anfragen, die beim Schreiben niemand gesehen hatte. Was das Umschreiben mit den Wahrscheinlichkeiten macht, steht im Nachtrag.

Claude Opus allein93,3 % → 99,0 %Claude Opus mit Hinweis92,6 % → 99,0 %Claude Haiku mit Hinweis87,2 % → 89,6 %Claude Haiku allein82,8 % → 88,2 %Jev allein82,8 % → 85,9 %60708090100vorhernachherSkala ab 60 Prozent, gemessen auf der Testhälfte mit 297 Anfragen
Gemessen auf der Hälfte der Anfragen, die beim Umschreiben der Beschreibungen niemand gesehen hat. Der offene Punkt ist der Wert davor, der gefüllte danach.
Router vorher nachher verloren / gewonnen p fehlende Dienste (n = 20)
Claude Opus allein 93,3 % 99,0 % 3 / 20 0,0005 0 auf 100 %
Claude Opus mit Hinweis 92,6 % 99,0 % 1 / 20 kleiner als 0,001 0 auf 100 %
Claude Haiku mit Hinweis 87,2 % 89,6 % 11 / 18 0,26 0 auf 55 %
Claude Haiku allein 82,8 % 88,2 % 14 / 30 0,023 0 auf 65 %
Jev allein 82,8 % 85,9 % 1 / 10 0,012 0 auf 20 %

Zwei Dinge stehen in dieser Tabelle, die man leicht übersieht. Bei Opus steckt der gesamte Netto-Gewinn in der Gruppe der fehlenden Dienste, auf Anfragen mit passendem Skill verliert Opus dabei drei von 237. Bei Jev trägt diese Gruppe nur vier der neun gewonnenen Fälle. Und der Vorteil des Jev-Hinweises, der bei Haiku vorher abgesichert war, ist es danach nicht mehr: 89,6 gegen 88,2 Prozent bei p gleich 0,63.

Der Preis der Aktion ist auch messbar. Die Skill-Liste wird um 9.965 Byte länger und wird in jede Sitzung geladen. Unsere eigene Obergrenze dafür liegt bei 80.000 Byte, aktuell belegt sind 78.808. Alle 39 Beschreibungen zusammen sprengen sie. Die eine, die den Gewinn trägt, kostet 294 Byte und passt.

Ergebnis 5: Was das Modell sonst kann

Aufgabe n Jev Claude Haiku Claude Opus
Mail-Kategorie, sieben Klassen 77 92,2 % 87,0 % 100 %
Mail: Antwort nötig 77 89,6 % 90,9 % 97,4 %
Mail: Dringlichkeit exakt, wahrscheinlichste Stufe 77 59,7 % 45,5 % 62,3 %
Behauptung gegen Quelle 74 97,3 % 98,6 % 100 %
Rechnung: Fälligkeitsdatum 60 83,3 % 100 % 100 %
Rechnung: Zahlbetrag 60 100 % 100 % 100 %
Prompt-Injection, eigene Daten 80 100 % 100 % 100 %
Klingt nach KI 58 100 % 100 % 100 %
Alarm umsetzbar 68 100 % 100 % 100 %

Eine Zeile braucht eine Erklärung. Claude nennt bei der Dringlichkeit eine Stufe, Jev liefert eine Verteilung über die vier Stufen. Verglichen wird die wahrscheinlichste Stufe. Nimmt man stattdessen den gerundeten Erwartungswert, den Jev ebenfalls liefert, trifft er nur 48,1 Prozent.

Vier Zeilen stehen bei allen Modellen auf 100 Prozent. Das ist ein Befund über unsere Daten, nicht über die Modelle: der Prüfer hat unklare Fälle bewusst aussortiert, damit waren diese Aufgaben zu leicht. Genau deshalb haben wir einen öffentlichen Datensatz dazugeholt.

Der externe Benchmark

Der Datensatz deepset/prompt-injections ist öffentlich, von Menschen gelabelt und enthält deutsche und englische Texte. Wir haben den Testsplit mit 116 Beispielen genommen.

Modell Treffer bei Schwelle 0,5 Präzision Recall AUROC Brier
Claude Opus 94,0 % 100 % 88,3 % 0,998 0,052
Claude Haiku 90,5 % 100 % 81,7 % 0,929 0,100
Jev 75,0 % 100 % 51,7 % 0,985 0,187

Jev meldet nie fälschlich Alarm, übersieht aber 29 von 60 Injections. Die Rangfolge der Fälle stimmt fast perfekt, das zeigt die AUROC von 0,985, die über der von Haiku liegt. Der Standardwert 0,5 passt nur nicht zu dieser Aufgabe. Mit einer auf der Hälfte der Daten eingemessenen Schwelle von 0,03 bis 0,06 kommt Jev auf 89,7 Prozent, kreuzvalidiert auf der anderen Hälfte.

Faustregel daraus: Bei einem Urteilsmodell ist die Schwelle Teil der Anwendung, nicht des Modells.

Die Schwächen, die der Hersteller selbst nennt

Aufgabe n Jev Claude Haiku Claude Opus
direkt zählen 20 65,0 % 100 % 100 %
zählen per Einzelfrage, Summe im Code 20 95,0 % nicht gemessen nicht gemessen
Datum vergleichen, gemischte Formate 20 100 % 100 % 100 %
Zahlen vergleichen, deutsche und englische Formate 20 95,0 % 100 % 100 %
Verneinung und doppelte Verneinung 20 100 % 100 % 100 %
rechnen knapp an einer Schwelle 15 66,7 % 100 % 100 %

TypeSafe nennt diese Schwächen selbst und benannt. Von fünf angekündigten haben sich zwei bestätigt. Der empfohlene Umweg wirkt: fragt man je Listeneintrag einzeln und addiert im Code, steigt das Zählen von 65 auf 95 Prozent.

Tempo und Preis

Aufgabe Anfragen Token je Anfrage Median Laufzeit
Skill-Routing, zwei Aufrufe je Anfrage, Lauf mit den geschärften Beschreibungen 561 26.380 1,94 s
Mail-Triage, drei Fragen in einem Aufruf 77 677 0,71 s
Behauptung gegen Quelle 74 674 0,69 s
Alarme 68 361 0,68 s

Alle Tests zusammen: 6.202 TypeSafe-Aufrufe, 46,7 Millionen Eingabe-Token, 1,96 US-Dollar. Der Preis steht in der Modellübersicht bei 0,042 Dollar je Million Eingabe-Token, Ausgabe kostenlos. Über alle Aufrufe liegt der Median bei 0,78 Sekunden. Die Claude-Seite ist darin nicht enthalten, sie lief als Subagent über das Abo und verbrauchte weitere 28,7 Millionen Token.

Der unangenehme Teil

Wir haben vor dem Test einen Filter gebaut, der Kundennamen aus allem entfernt, was nach außen geht. Bei den Anfragen hat er gegriffen. Bei den Beschreibungen nur teilweise: dort blieben 14 Nennungen stehen, davon zwei Kunden- und Partnernamen. Und er hat gar nicht erfasst, dass der zweite Durchgang zusätzlich 700 Zeichen aus jeder Skill-Datei mitschickt. In diesen Auszügen standen Kundennamen und zwei Personennamen, ein Skillname trug ohnehin einen Kundennamen im Namen.

Gefunden hat das nicht der Autor, sondern eine unabhängige Prüfrunde, die wir nach dem Schreiben des internen Berichts auf ihn angesetzt haben. Drei Prüfläufe lieferten zehn schwere und über vierzig mittlere Befunde, darunter eine falsche Laufzeitangabe, eine inkonsistente Wertung und eine falsch wiedergegebene Vertragslage. Diesen Artikel hat dieselbe Prüfung noch einmal durchlaufen.

Die Lehre ist unbequem und einfach: Wer ein fremdes Modell in eine Werkzeugkette hängt, muss den gesamten Pfad der Nutzlast kennen, nicht allein die Anfrage, die er selbst formuliert hat. Bei uns heißt das konkret: der Filter wird erweitert, bevor irgendetwas davon produktiv läuft.

Zur Rechtslage, weil die Frage in jedem Kundengespräch kommt: Der Dienst läuft laut Datenschutzerklärung in den USA. Der Auftragsverarbeitungsvertrag bindet die EU-Standardvertragsklauseln ein, mit irischem Recht und irischer Aufsicht. Kein Training auf Eingaben. Verzicht auf Aufbewahrung gibt es nur im Enterprise-Vertrag. Ob Kundendaten dorthin gehen, entscheidet der Kunde, nicht wir.

Wann sich so ein Modell lohnt

Für uns nicht als Vorschalt-Router vor einer Sitzung mit einem starken Modell. Dafür ist der Gewinn negativ und der Datenweg zu lang. Interessant wird es dort, wo viele kleine Urteile schnell fallen müssen und ein kleineres Modell entscheidet: Alarme vorsortieren, eingehende Texte auf versteckte Anweisungen prüfen, Belege gegen ihre Quelle halten. Immer mit einer Schwelle, die man an den eigenen Daten einmisst, und neu einmisst, sobald sich die Beschreibungen ändern.

Grenzen dieser Messung

  • Die Testanfragen sind synthetisch, nicht die echten Anfragen aus dem Alltag. Echte Prompts hätten Kundeninhalt an einen Dienst in den USA gegeben.
  • Opus hat die Labels geprüft und wurde zugleich gemessen. Die strenge Wertung mindert diesen Vorteil, sie beseitigt ihn nicht.
  • Claude hat in Stapeln zu 25 Anfragen geantwortet, Jev jede Anfrage einzeln. In einer echten Sitzung entscheidet Claude pro Nachricht und mit mehr Kontext.
  • Die Claude-Läufe hatten die echte Skill-Liste der Sitzung zusätzlich im Kontext, auch wenn die Anweisung lautete, allein die übergebene Liste zu benutzen.
  • Entwicklungs- und Testhälfte sind zufällig geteilt, aber vom selben Typ. Wer die Beschreibungen schärft, kennt damit die Art der Fehler, auch wenn er die Testanfragen nicht sieht.
  • Gemessen wurde eine Modellversion, vier Tage nach der Veröffentlichung.
  • Der Nachtrag misst die Kalibrierung über alle 490 Anfragen mit Skill, Ergebnis 4 misst die Trefferquote über die Testhälfte. Die beiden Reihen sind nicht direkt vergleichbar.
  • Drei unserer eigenen Aufgaben waren zu leicht. Belastbar trennen nur Mail-Kategorie, Fälligkeitsdatum, Zählen und der externe Benchmark.

Das trägt keine Aussage über den Dauerbetrieb, für eine Entscheidung reicht es.

Der billigste Gewinn lag am Ende nicht im neuen Modell. Er lag in 294 Byte Beschreibung, die vorher niemand geschrieben hatte, weil alle wussten, was der Skill tut.

Nachtrag vom 22. September 2026

Unter dem LinkedIn-Post zu diesem Artikel kamen zwei Fragen, die eine Lücke im Abschnitt über die Wahrscheinlichkeiten treffen. Wie viel deckt das oberste Sicherheitsband überhaupt ab? Und haben wir die Kalibrierung nach dem Umschreiben der Beschreibungen noch einmal gemessen? Beides berechtigt, hier die Antworten.

Was das oberste Band abdeckt

Die 184 Anfragen ab 99 Prozent sind 37,6 Prozent der 490 Anfragen, für die es einen richtigen Skill gibt. Nicht der 1.732 Beispiele, das ist das Material über alle elf Tests zusammen.

Schwelle Abdeckung richtig darin Rest richtig im Rest
ab 90 % 298 von 490, 60,8 % 99,7 % 192 71,9 %
ab 95 % 249 von 490, 50,8 % 99,6 % 241 77,6 %
ab 99 % 184 von 490, 37,6 % 100 % 306 82,0 %

Damit trägt die letzte Zeile der Kalibrierungstabelle die Entscheidung nicht allein. Wer bei 99 Prozent abschneidet, schiebt 306 von 490 Anfragen unter die Schwelle, und das Modell hätte davon 82,0 Prozent richtig beantwortet. Die Schwelle fängt dort überwiegend richtige Antworten ab. Bei 90 Prozent trennt sie besser: 298 Anfragen laufen durch und sind zu 99,7 Prozent richtig, die übrigen 192 liegen nur noch bei 71,9 Prozent und sind beim größeren Modell besser aufgehoben.

Diese Tabelle zählt die 490 Anfragen mit Skill. Im Betrieb laufen alle 561 durch die Schwelle, auch die 71, zu denen keiner passt. Bei 90 Prozent rutscht davon vorher genau eine durch, der Durchlass liegt damit bei 299 Anfragen und 99,3 statt 99,7 Prozent. Ab 99 Prozent rutscht keine durch, und nach dem Umschreiben auch bei 90 Prozent keine mehr.

Die Kalibrierung nach dem Umschreiben

Nachgemessen hatten wir sie nicht. Der Rohlauf lag noch vor, also haben wir es nachgeholt, mit demselben Verfahren wie oben. Die Tabelle steht auf allen 490 Anfragen mit Skill, damit die Vorher-Spalte dieselbe ist wie weiter oben. Die Trefferquoten in Ergebnis 4 stehen dagegen nur auf der Testhälfte.

0 bis 50 %n 39 → 2641,0 % → 61,5 %50 bis 70 %n 64 → 4768,8 % → 74,5 %70 bis 90 %n 89 → 9687,6 % → 94,8 %90 bis 99 %n 114 → 11699,1 % → 100,0 %99 bis 100 %n 184 → 205100,0 % → 100,0 %405060708090100Trefferquote davorTrefferquote danachSkala ab 40 Prozent, 490 Anfragen mit Skill
Dieselben 490 Anfragen, dieselben Bänder. Die Belegung wandert mit: das unterste Band schrumpft von 39 auf 26 Anfragen, das oberste wächst von 184 auf 205. Das unterste Band bewegt sich am weitesten und steht zugleich auf den wenigsten Anfragen. Der Ring ist die Trefferquote davor, der gefüllte Punkt danach. Wo beide gleich sind, liegt der Ring um den Punkt.
Sicherheit für Platz 1 n vorher n nachher richtig vorher richtig nachher
0 bis 50 % 39 26 41,0 % 61,5 %
50 bis 70 % 64 47 68,8 % 74,5 %
70 bis 90 % 89 96 87,6 % 94,8 %
90 bis 99 % 114 116 99,1 % 100 %
99 bis 100 % 184 205 100 % 100 %

Die Belegung wandert. Ab 99 Prozent steigt die Abdeckung von 37,6 auf 41,8 Prozent, ab 90 Prozent von 60,8 auf 65,5 Prozent.

Diese Zahlen stehen auf allen 490 Anfragen, damit sie mit der Tabelle weiter oben vergleichbar bleiben. Darin steckt die Hälfte, an der wir die Beschreibungen geschärft haben. Auf der Testhälfte, die beim Umschreiben niemand gesehen hat, bleiben 257 Anfragen, und dort sieht der Gewinn an Abdeckung anders aus.

Schwelle Abdeckung vorher Abdeckung nachher richtig darunter vorher richtig darunter nachher
ab 90 % 61,5 % 64,2 % 68,7 % 83,7 %
ab 99 % 40,1 % 40,9 % 79,9 % 90,1 %

Auf der sauberen Hälfte wandert die Belegung also kaum: ab 99 Prozent sind es 0,8 Punkte statt 4,3. Deutlich steigt dort etwas anderes, nämlich der Anteil richtiger Antworten unterhalb der Schwelle, von 79,9 auf 90,1 Prozent. Die Schwelle wird nicht durchlässiger, sie wirft mehr Richtiges weg.

Unangenehm ist das untere Ende. Vorher gab das Modell dort im Mittel 34,0 Prozent an und lag bei 41,0. Nachher gibt es dort 37,6 Prozent Sicherheit an und liegt bei 61,5. Der mittlere Abstand zwischen angegebener Sicherheit und Trefferquote steigt von 0,041 auf 0,069, die Kalibrierung wird also schlechter. Der Brier-Score, der Treffer und Sicherheit zusammen misst, fällt von 0,073 auf 0,047.

Die Trefferquote wird also besser und die Kalibrierung schlechter. Ein Vorzeichen dreht dabei nicht: das Modell gibt in jedem Band weniger an, als es trifft, vor und nach dem Umschreiben. Der Abstand wächst nur. Im untersten Band sieht das am größten aus, von 7 auf 24 Punkte, aber dort liegen vorher 39 und nachher 26 Anfragen. Der Unterschied ist nicht abgesichert, der exakte Test gibt p = 0,13. Wir nennen ihn, weil er in dieselbe Richtung zeigt wie der Rest, nicht als Beleg.

Abgesichert ist der Befund, auf den es ankommt. Unterhalb der empfohlenen Schwelle von 90 Prozent waren auf der Testhälfte vorher 68 von 99 Antworten richtig, nachher 77 von 92, also 68,7 gegen 83,7 Prozent bei p = 0,018. Praktisch heißt das: eine Schwelle, die vor dem Umschreiben eingemessen wurde, verwirft danach Vorschläge, die richtig gewesen wären.

Daraus wird eine Regel, die wir vorher nicht hatten. Wer die Beschreibungen ändert, misst die Schwelle neu. Die Beschreibungen sind Teil der Eingabe, nicht Teil der Umgebung.

Nachtrag vom 23. September 2026: Jev liest E-Rechnungen

Dieser Artikel misst Jev als Skill-Router. Im BKS-Labor steht jetzt ein zweiter Messaufbau, näher an unserer Arbeit mit E-Rechnungen. Eine E-Rechnung trägt viele Angaben zweimal, als Strukturfeld und als Freitext. Steht eine Angabe nur im Text, etwa eine Skontofrist, sieht eine Software sie nicht, wenn sie nur die Felder liest.

Jev bekommt deshalb nur die Freitexte einer Rechnung und beantwortet zehn Ja/Nein-Fragen in einer Anfrage. Der Code liest dieselben Angaben aus den Strukturfeldern und vergleicht.

Auf 34 öffentlichen Testfällen der KoSIT kamen 340 Urteile in 11,3 Sekunden zusammen. Nur 4,1 Prozent davon liegen zwischen 0,3 und 0,7, Jev legt sich also fast immer fest. In 9 Zellen stand eine Angabe nur im Text. Sechs davon haben die Gegenprüfung überstanden, drei nicht, und die Seite zeigt beide.

Die Messung lässt sich auf der Laborseite abspielen, die Schwellen kann man selbst verschieben: Jev liest E-Rechnungen.

Quellen

Alles Öffentliche, am 20. September 2026 abgerufen.

Die Messwerte in diesem Artikel stammen aus unseren eigenen Läufen gegen die API, Stand 19. und 20. September 2026, Modellversion jev-1.13.0.