Seit dem 15. September steht Jev in vielen Feeds. TypeSafe hat das Modell an diesem Tag veröffentlicht, zusammen mit einer Finanzierungsrunde und einer Doom-Demo, über die auch The Register geschrieben hat. Jev schreibt keinen Text. Es liefert typisierte Urteile mit Wahrscheinlichkeit: eine Option aus einer Menge, ein Ja oder Nein als Wahrscheinlichkeit, eine Stufe auf einer Skala.
Wir haben es nicht kommentiert, wir haben es gemessen. Vier Tage nach der Veröffentlichung, an einer Aufgabe, die wir jeden Tag haben.
Unser interner Assistent hat 117 Skills. Jede Anfrage beginnt deshalb mit einer Entscheidung, bevor irgendetwas passiert: welches Werkzeug ist hier das richtige, und braucht es überhaupt eines? Wer sich diese Entscheidung ansieht, findet dort eine Liste aus Namen und je einer Zeile Beschreibung. Mehr hat das Modell nicht, wenn es wählt. Genau dafür schlägt TypeSafe im Kochbuch zum Skill-Vorschlag ein vorgeschaltetes Urteil vor, gemessen an 182 Skills eines fremden Harness.
Dieser Artikel zeigt den Aufbau, alle Zahlen und die Stellen, an denen wir uns geirrt haben.
Was andere in den ersten Tagen gebaut haben
In den vier Tagen bis zu unserem Test sind mehrere Projekte entstanden, die wir nicht nachgemessen haben und deshalb nur als Fundstellen nennen: ein Browser-Agent, der das nächste Element auswählt statt es zu beschreiben, ein Handelsbot mit einer Entscheidung je Block, ein offener Nachbau auf eigener Hardware und ein Werkstattbericht von LangChain. Die Vergleichszahlen des Herstellers selbst sind bereits öffentlich kritisiert worden, weil sie von TypeSafe selbst gemessen wurden.
Unsere Zahlen unten sind ebenfalls selbst gemessen. Der Unterschied ist, dass wir das Testmaterial, die Fragen und die Grenzen offenlegen.
Der Aufbau
1.732 Beispiele, elf Tests, zwei Blöcke. Der erste Block stellt eine Frage: findet ein Router aus einer Anfrage den richtigen Skill? Der zweite Block prüft, was das Modell sonst kann, und endet mit einem öffentlichen Benchmark, den wir nicht selbst gebaut haben.
Die 561 realistischen Anfragen hat Claude Sonnet aus den Skill-Dateien geschrieben, Claude Opus hat jede Zuordnung geprüft, gleichwertige Alternativen ergänzt und Unklares verworfen. Die Schwächen-Probe entsteht im Programm, dort stehen die richtigen Antworten exakt fest. Jede Trefferquote trägt ein 95-Prozent-Intervall nach Wilson, jeder Vergleich zwischen zwei Routern läuft gepaart über dieselben Anfragen mit einem exakten McNemar-Test.
Block 1: den richtigen Skill wählen
| Test | Anfragen | Daten | Router |
|---|---|---|---|
| Trigger-Sätze | 508 mit Skill, 35 ohne | aus den Beschreibungen gezogen, Beschreibung dafür ohne Trigger | Jev, Wortsuche |
| Realistische Anfragen | 561: 461 mit Skill, 29 nach fehlenden Diensten, 71 ohne Skill | Sonnet schreibt, Opus prüft | Jev in drei Varianten, Wortsuche, Haiku und Opus je ohne und mit Jev-Hinweis |
| Nach dem Schärfen der Beschreibungen | 297, die Testhälfte | dieselben Anfragen, neue Beschreibungen | dieselben fünf Router |
Block 2: acht weitere Aufgaben
| Aufgabe | Fragetyp | n | Daten |
|---|---|---|---|
| Mail-Triage: Kategorie, Antwort nötig, Dringlichkeit | Choice, Noul, Score | 77 | synthetisch, geprüft |
| Prompt-Injection erkennen | Noul | 80 | synthetisch, vier Härtegrade |
| Behauptung gegen Quelle prüfen | Choice | 74 | synthetisch, je Text drei Behauptungen |
| Klingt der Text nach KI | Noul | 58 | synthetisch, halb und halb |
| Ist ein Alarm umsetzbar | Noul | 68 | synthetisch, Betrieb und Rauschen |
| Rechnung: Fälligkeit und Zahlbetrag | Choice über Kandidaten | 60 | synthetisch, mehrere Daten je Text |
| Schwächen-Probe: zählen, Datum, Zahlen, Verneinung, rechnen | Choice und Noul | 95 | im Programm erzeugt, Labels exakt |
| deepset/prompt-injections | Noul | 116 | öffentlich, von Menschen gelabelt |
Dieselben Definitionen gingen auch an Claude Haiku und Claude Opus, dort als Stapel-Auftrag in normaler Sprache statt als typisierte Frage.
Ergebnis 1: Jev landet auf dem Niveau des kleinen Modells
| Router | gesamt richtig | Skill richtig | falscher Skill | keiner gewählt | Fehlalarm |
|---|---|---|---|---|---|
| Claude Opus allein | 94,3 % | 93,5 % | 1,0 % | 5,5 % | 0,0 % |
| Claude Opus mit Jev-Hinweis | 93,2 % | 92,2 % | 2,0 % | 5,7 % | 0,0 % |
| Claude Haiku mit Jev-Hinweis | 87,9 % | 86,5 % | 6,7 % | 6,7 % | 2,8 % |
| Jev allein, volle Beschreibungen | 84,3 % | 82,9 % | 6,7 % | 10,4 % | 5,6 % |
| Jev allein, ohne Trigger, gekürzt | 83,2 % | 81,8 % | 7,3 % | 10,8 % | 7,0 % |
| Jev allein, Beschreibung gekürzt | 83,1 % | 81,4 % | 6,7 % | 11,8 % | 5,6 % |
| Claude Haiku allein | 82,7 % | 80,4 % | 11,0 % | 8,6 % | 1,4 % |
Die Spalte „gesamt richtig” zählt über alle 561 Anfragen, die drei mittleren Spalten über die 490 Anfragen mit Skill, der Fehlalarm über die 71 Anfragen ohne Skill. Die Wortsuche BM25 steht nicht in der Tabelle, weil sie nie „keiner” antworten kann. Auf den Anfragen mit Skill trifft sie 19,0 Prozent auf Platz 1, über alle Anfragen gerechnet 16,6 Prozent.
Auf den Trigger-Sätzen traf dieselbe Wortsuche noch 52,6 Prozent, auf echten Anfragen 19,0. Dieser Abfall zeigt das Grundproblem: echte Anfragen enthalten die Wörter der Beschreibung nicht. Wer fragt, ob die Sicherung heute Nacht durchgelaufen ist, benutzt kein Stichwort aus dem passenden Skill.
Welche Unterschiede halten
| Vergleich | nur a richtig | nur b richtig | p |
|---|---|---|---|
| Haiku allein / Haiku mit Hinweis | 15 | 44 | 0,0002 |
| Opus allein / Opus mit Hinweis | 6 | 0 | 0,031 |
| Jev / Haiku allein | 46 | 37 | 0,38 |
| Jev / Opus allein | 0 | 56 | kleiner als 0,001 |
| Jev ohne Trigger, gekürzt / Jev volle Beschreibungen | 11 | 17 | 0,34 |
Der Abstand zwischen Jev und Haiku ist nicht abgesichert, der Abstand zu Opus schon.
Nach Art der Anfrage
| Gruppe | n | Haiku | Haiku mit Hinweis | Jev | Opus |
|---|---|---|---|---|---|
| Anfragen mit passendem Skill | 461 | 85,5 % | 92,0 % | 88,1 % | 99,3 % |
| Anfragen nach fehlenden Diensten | 29 | 0,0 % | 0,0 % | 0,0 % | 0,0 % |
| Alltag, kein Skill nötig | 20 | 100 % | 100 % | 100 % | 100 % |
| Technikfrage, kein Skill nötig | 25 | 100 % | 100 % | 100 % | 100 % |
| Routinearbeit im Repo, kein Skill | 25 | 96,0 % | 92,0 % | 84,0 % | 100 % |
| deutsche Anfragen | 428 | 82,0 % | 86,9 % | 83,2 % | 94,2 % |
| englische Anfragen | 133 | 85,0 % | 91,0 % | 88,0 % | 94,7 % |
| kurze Anfragen | 177 | 76,3 % | 80,2 % | 78,5 % | 87,6 % |
| lange Anfragen | 116 | 87,9 % | 93,1 % | 90,5 % | 99,1 % |
Die oberen fünf Gruppen ergeben zusammen 560 Anfragen. Die eine fehlende Gegenprobe fragt nach einem Dienst, den es nicht gibt, und steht deshalb nicht unter „kein Skill nötig”.
Zwei Zeilen fallen auf. Kurze Anfragen sind für jeden Router schwerer als lange, der Abstand beträgt rund zehn Punkte. Und die zweite Zeile steht bei allen auf null. Dazu gleich mehr.
Ergebnis 2: Ein Zusatzurteil hilft dem kleinen Modell und stört das große
Wir haben Jevs Vorschlag als Hinweis in den Prompt gelegt, so wie es das Kochbuch des Herstellers vorschlägt. Haiku steigt damit um 5,2 Punkte, und dieser Gewinn ist abgesichert. Opus verliert 1,1 Punkte. Sechs Fälle kippen von richtig nach falsch, keiner in die andere Richtung.
Daraus ist bei uns eine Faustregel geworden: Ein fremdes Urteil hilft dem Modell, das unsicher ist, und nimmt dem sicheren Modell die eigene Entscheidung ab. Wer ein starkes Modell fährt, kauft mit einem Vorschalt-Router vor allem eine zweite Meinung ein, die er nicht gebraucht hätte.
Ergebnis 3: Stimmen die Wahrscheinlichkeiten?
Jev liefert zu jeder Wahl eine Wahrscheinlichkeit. Die Frage ist, ob man ihr trauen kann.
| Sicherheit für Platz 1 | n | mittlere Sicherheit | tatsächlich richtig |
|---|---|---|---|
| 0 bis 50 % | 39 | 34,0 % | 41,0 % |
| 50 bis 70 % | 64 | 59,7 % | 68,8 % |
| 70 bis 90 % | 89 | 80,3 % | 87,6 % |
| 90 bis 99 % | 114 | 94,9 % | 99,1 % |
| 99 bis 100 % | 184 | 99,8 % | 100 % |
Das Modell ist durchgehend etwas vorsichtiger als nötig. Für die Praxis zählt die letzte Zeile: ab 99 Prozent Sicherheit stimmte die Wahl in allen 184 Fällen. Damit lässt sich eine Schwelle bauen, ab der man einem Vorschlag folgt und unterhalb derer man ihn verwirft. Wie viel diese Schwelle abdeckt und was mit dem Rest passiert, steht im Nachtrag am Ende.
Robustheit der Wertung
Opus hat die Labels geprüft und wird zugleich gemessen. Das kann Opus begünstigen. Deshalb haben wir dieselben Antworten noch zweimal anders gewertet: einmal streng, also nur der ursprünglich gemeinte Skill ohne die von Opus ergänzten Alternativen, und einmal nur auf den Anfragen, an denen die Prüfung nichts geändert hat.
| Router | normal, alle 561 | streng, alle 561 | streng, nur die 439 unveränderten |
|---|---|---|---|
| Claude Opus allein | 94,3 % | 92,9 % | 97,9 % |
| Claude Opus mit Hinweis | 93,2 % | 92,0 % | 97,0 % |
| Claude Haiku mit Hinweis | 87,9 % | 86,6 % | 92,3 % |
| Jev allein | 84,3 % | 83,2 % | 88,6 % |
| Claude Haiku allein | 82,7 % | 81,6 % | 87,5 % |
Die Reihenfolge bleibt in allen drei Wertungen gleich.
Ergebnis 4: Die Lücke, die kein Router geschlossen hat
Ein Teil der Testanfragen zielt auf Dienste, die bei uns gar nicht angebunden sind. Ein Ticket in einem fremden Tracker, eine Seite in einer Notiz-App, eine Zahlung bei einem Zahlungsdienst. Für diesen Fall gibt es bei uns einen Skill. Er prüft, ob wirklich eine Lücke vorliegt, und macht dann einen Vorschlag, statt selbst loszulaufen.
Trefferquote bei diesen Anfragen: null Prozent. Bei allen fünf Routern, Opus eingeschlossen.
Das Modell war nicht das Problem. Die Beschreibung war es. Sie sagte, wofür der Skill gedacht ist, aber nicht so, dass ein Router es an einer normalen Anfrage erkennt. Bei Jev lässt sich das in der Rangliste sehen: in diesen 29 Anfragen stand der Skill 14 mal auf Platz 1 und 25 mal unter den ersten drei. Verworfen hat ihn jedes Mal die Vorprüfung der zweistufigen Kette.
Also haben wir 39 verwechselte Beschreibungen geschärft. Opus schrieb, ein zweiter Opus-Lauf prüfte jede neue Fassung gegen die eigentliche Skill-Datei. Gemessen wurde auf der Hälfte der Anfragen, die beim Schreiben niemand gesehen hatte. Was das Umschreiben mit den Wahrscheinlichkeiten macht, steht im Nachtrag.
| Router | vorher | nachher | verloren / gewonnen | p | fehlende Dienste (n = 20) |
|---|---|---|---|---|---|
| Claude Opus allein | 93,3 % | 99,0 % | 3 / 20 | 0,0005 | 0 auf 100 % |
| Claude Opus mit Hinweis | 92,6 % | 99,0 % | 1 / 20 | kleiner als 0,001 | 0 auf 100 % |
| Claude Haiku mit Hinweis | 87,2 % | 89,6 % | 11 / 18 | 0,26 | 0 auf 55 % |
| Claude Haiku allein | 82,8 % | 88,2 % | 14 / 30 | 0,023 | 0 auf 65 % |
| Jev allein | 82,8 % | 85,9 % | 1 / 10 | 0,012 | 0 auf 20 % |
Zwei Dinge stehen in dieser Tabelle, die man leicht übersieht. Bei Opus steckt der gesamte Netto-Gewinn in der Gruppe der fehlenden Dienste, auf Anfragen mit passendem Skill verliert Opus dabei drei von 237. Bei Jev trägt diese Gruppe nur vier der neun gewonnenen Fälle. Und der Vorteil des Jev-Hinweises, der bei Haiku vorher abgesichert war, ist es danach nicht mehr: 89,6 gegen 88,2 Prozent bei p gleich 0,63.
Der Preis der Aktion ist auch messbar. Die Skill-Liste wird um 9.965 Byte länger und wird in jede Sitzung geladen. Unsere eigene Obergrenze dafür liegt bei 80.000 Byte, aktuell belegt sind 78.808. Alle 39 Beschreibungen zusammen sprengen sie. Die eine, die den Gewinn trägt, kostet 294 Byte und passt.
Ergebnis 5: Was das Modell sonst kann
| Aufgabe | n | Jev | Claude Haiku | Claude Opus |
|---|---|---|---|---|
| Mail-Kategorie, sieben Klassen | 77 | 92,2 % | 87,0 % | 100 % |
| Mail: Antwort nötig | 77 | 89,6 % | 90,9 % | 97,4 % |
| Mail: Dringlichkeit exakt, wahrscheinlichste Stufe | 77 | 59,7 % | 45,5 % | 62,3 % |
| Behauptung gegen Quelle | 74 | 97,3 % | 98,6 % | 100 % |
| Rechnung: Fälligkeitsdatum | 60 | 83,3 % | 100 % | 100 % |
| Rechnung: Zahlbetrag | 60 | 100 % | 100 % | 100 % |
| Prompt-Injection, eigene Daten | 80 | 100 % | 100 % | 100 % |
| Klingt nach KI | 58 | 100 % | 100 % | 100 % |
| Alarm umsetzbar | 68 | 100 % | 100 % | 100 % |
Eine Zeile braucht eine Erklärung. Claude nennt bei der Dringlichkeit eine Stufe, Jev liefert eine Verteilung über die vier Stufen. Verglichen wird die wahrscheinlichste Stufe. Nimmt man stattdessen den gerundeten Erwartungswert, den Jev ebenfalls liefert, trifft er nur 48,1 Prozent.
Vier Zeilen stehen bei allen Modellen auf 100 Prozent. Das ist ein Befund über unsere Daten, nicht über die Modelle: der Prüfer hat unklare Fälle bewusst aussortiert, damit waren diese Aufgaben zu leicht. Genau deshalb haben wir einen öffentlichen Datensatz dazugeholt.
Der externe Benchmark
Der Datensatz deepset/prompt-injections ist öffentlich, von Menschen gelabelt und enthält deutsche und englische Texte. Wir haben den Testsplit mit 116 Beispielen genommen.
| Modell | Treffer bei Schwelle 0,5 | Präzision | Recall | AUROC | Brier |
|---|---|---|---|---|---|
| Claude Opus | 94,0 % | 100 % | 88,3 % | 0,998 | 0,052 |
| Claude Haiku | 90,5 % | 100 % | 81,7 % | 0,929 | 0,100 |
| Jev | 75,0 % | 100 % | 51,7 % | 0,985 | 0,187 |
Jev meldet nie fälschlich Alarm, übersieht aber 29 von 60 Injections. Die Rangfolge der Fälle stimmt fast perfekt, das zeigt die AUROC von 0,985, die über der von Haiku liegt. Der Standardwert 0,5 passt nur nicht zu dieser Aufgabe. Mit einer auf der Hälfte der Daten eingemessenen Schwelle von 0,03 bis 0,06 kommt Jev auf 89,7 Prozent, kreuzvalidiert auf der anderen Hälfte.
Faustregel daraus: Bei einem Urteilsmodell ist die Schwelle Teil der Anwendung, nicht des Modells.
Die Schwächen, die der Hersteller selbst nennt
| Aufgabe | n | Jev | Claude Haiku | Claude Opus |
|---|---|---|---|---|
| direkt zählen | 20 | 65,0 % | 100 % | 100 % |
| zählen per Einzelfrage, Summe im Code | 20 | 95,0 % | nicht gemessen | nicht gemessen |
| Datum vergleichen, gemischte Formate | 20 | 100 % | 100 % | 100 % |
| Zahlen vergleichen, deutsche und englische Formate | 20 | 95,0 % | 100 % | 100 % |
| Verneinung und doppelte Verneinung | 20 | 100 % | 100 % | 100 % |
| rechnen knapp an einer Schwelle | 15 | 66,7 % | 100 % | 100 % |
TypeSafe nennt diese Schwächen selbst und benannt. Von fünf angekündigten haben sich zwei bestätigt. Der empfohlene Umweg wirkt: fragt man je Listeneintrag einzeln und addiert im Code, steigt das Zählen von 65 auf 95 Prozent.
Tempo und Preis
| Aufgabe | Anfragen | Token je Anfrage | Median Laufzeit |
|---|---|---|---|
| Skill-Routing, zwei Aufrufe je Anfrage, Lauf mit den geschärften Beschreibungen | 561 | 26.380 | 1,94 s |
| Mail-Triage, drei Fragen in einem Aufruf | 77 | 677 | 0,71 s |
| Behauptung gegen Quelle | 74 | 674 | 0,69 s |
| Alarme | 68 | 361 | 0,68 s |
Alle Tests zusammen: 6.202 TypeSafe-Aufrufe, 46,7 Millionen Eingabe-Token, 1,96 US-Dollar. Der Preis steht in der Modellübersicht bei 0,042 Dollar je Million Eingabe-Token, Ausgabe kostenlos. Über alle Aufrufe liegt der Median bei 0,78 Sekunden. Die Claude-Seite ist darin nicht enthalten, sie lief als Subagent über das Abo und verbrauchte weitere 28,7 Millionen Token.
Der unangenehme Teil
Wir haben vor dem Test einen Filter gebaut, der Kundennamen aus allem entfernt, was nach außen geht. Bei den Anfragen hat er gegriffen. Bei den Beschreibungen nur teilweise: dort blieben 14 Nennungen stehen, davon zwei Kunden- und Partnernamen. Und er hat gar nicht erfasst, dass der zweite Durchgang zusätzlich 700 Zeichen aus jeder Skill-Datei mitschickt. In diesen Auszügen standen Kundennamen und zwei Personennamen, ein Skillname trug ohnehin einen Kundennamen im Namen.
Gefunden hat das nicht der Autor, sondern eine unabhängige Prüfrunde, die wir nach dem Schreiben des internen Berichts auf ihn angesetzt haben. Drei Prüfläufe lieferten zehn schwere und über vierzig mittlere Befunde, darunter eine falsche Laufzeitangabe, eine inkonsistente Wertung und eine falsch wiedergegebene Vertragslage. Diesen Artikel hat dieselbe Prüfung noch einmal durchlaufen.
Die Lehre ist unbequem und einfach: Wer ein fremdes Modell in eine Werkzeugkette hängt, muss den gesamten Pfad der Nutzlast kennen, nicht allein die Anfrage, die er selbst formuliert hat. Bei uns heißt das konkret: der Filter wird erweitert, bevor irgendetwas davon produktiv läuft.
Zur Rechtslage, weil die Frage in jedem Kundengespräch kommt: Der Dienst läuft laut Datenschutzerklärung in den USA. Der Auftragsverarbeitungsvertrag bindet die EU-Standardvertragsklauseln ein, mit irischem Recht und irischer Aufsicht. Kein Training auf Eingaben. Verzicht auf Aufbewahrung gibt es nur im Enterprise-Vertrag. Ob Kundendaten dorthin gehen, entscheidet der Kunde, nicht wir.
Wann sich so ein Modell lohnt
Für uns nicht als Vorschalt-Router vor einer Sitzung mit einem starken Modell. Dafür ist der Gewinn negativ und der Datenweg zu lang. Interessant wird es dort, wo viele kleine Urteile schnell fallen müssen und ein kleineres Modell entscheidet: Alarme vorsortieren, eingehende Texte auf versteckte Anweisungen prüfen, Belege gegen ihre Quelle halten. Immer mit einer Schwelle, die man an den eigenen Daten einmisst, und neu einmisst, sobald sich die Beschreibungen ändern.
Grenzen dieser Messung
- Die Testanfragen sind synthetisch, nicht die echten Anfragen aus dem Alltag. Echte Prompts hätten Kundeninhalt an einen Dienst in den USA gegeben.
- Opus hat die Labels geprüft und wurde zugleich gemessen. Die strenge Wertung mindert diesen Vorteil, sie beseitigt ihn nicht.
- Claude hat in Stapeln zu 25 Anfragen geantwortet, Jev jede Anfrage einzeln. In einer echten Sitzung entscheidet Claude pro Nachricht und mit mehr Kontext.
- Die Claude-Läufe hatten die echte Skill-Liste der Sitzung zusätzlich im Kontext, auch wenn die Anweisung lautete, allein die übergebene Liste zu benutzen.
- Entwicklungs- und Testhälfte sind zufällig geteilt, aber vom selben Typ. Wer die Beschreibungen schärft, kennt damit die Art der Fehler, auch wenn er die Testanfragen nicht sieht.
- Gemessen wurde eine Modellversion, vier Tage nach der Veröffentlichung.
- Der Nachtrag misst die Kalibrierung über alle 490 Anfragen mit Skill, Ergebnis 4 misst die Trefferquote über die Testhälfte. Die beiden Reihen sind nicht direkt vergleichbar.
- Drei unserer eigenen Aufgaben waren zu leicht. Belastbar trennen nur Mail-Kategorie, Fälligkeitsdatum, Zählen und der externe Benchmark.
Das trägt keine Aussage über den Dauerbetrieb, für eine Entscheidung reicht es.
Der billigste Gewinn lag am Ende nicht im neuen Modell. Er lag in 294 Byte Beschreibung, die vorher niemand geschrieben hatte, weil alle wussten, was der Skill tut.
Nachtrag vom 22. September 2026
Unter dem LinkedIn-Post zu diesem Artikel kamen zwei Fragen, die eine Lücke im Abschnitt über die Wahrscheinlichkeiten treffen. Wie viel deckt das oberste Sicherheitsband überhaupt ab? Und haben wir die Kalibrierung nach dem Umschreiben der Beschreibungen noch einmal gemessen? Beides berechtigt, hier die Antworten.
Was das oberste Band abdeckt
Die 184 Anfragen ab 99 Prozent sind 37,6 Prozent der 490 Anfragen, für die es einen richtigen Skill gibt. Nicht der 1.732 Beispiele, das ist das Material über alle elf Tests zusammen.
| Schwelle | Abdeckung | richtig darin | Rest | richtig im Rest |
|---|---|---|---|---|
| ab 90 % | 298 von 490, 60,8 % | 99,7 % | 192 | 71,9 % |
| ab 95 % | 249 von 490, 50,8 % | 99,6 % | 241 | 77,6 % |
| ab 99 % | 184 von 490, 37,6 % | 100 % | 306 | 82,0 % |
Damit trägt die letzte Zeile der Kalibrierungstabelle die Entscheidung nicht allein. Wer bei 99 Prozent abschneidet, schiebt 306 von 490 Anfragen unter die Schwelle, und das Modell hätte davon 82,0 Prozent richtig beantwortet. Die Schwelle fängt dort überwiegend richtige Antworten ab. Bei 90 Prozent trennt sie besser: 298 Anfragen laufen durch und sind zu 99,7 Prozent richtig, die übrigen 192 liegen nur noch bei 71,9 Prozent und sind beim größeren Modell besser aufgehoben.
Diese Tabelle zählt die 490 Anfragen mit Skill. Im Betrieb laufen alle 561 durch die Schwelle, auch die 71, zu denen keiner passt. Bei 90 Prozent rutscht davon vorher genau eine durch, der Durchlass liegt damit bei 299 Anfragen und 99,3 statt 99,7 Prozent. Ab 99 Prozent rutscht keine durch, und nach dem Umschreiben auch bei 90 Prozent keine mehr.
Die Kalibrierung nach dem Umschreiben
Nachgemessen hatten wir sie nicht. Der Rohlauf lag noch vor, also haben wir es nachgeholt, mit demselben Verfahren wie oben. Die Tabelle steht auf allen 490 Anfragen mit Skill, damit die Vorher-Spalte dieselbe ist wie weiter oben. Die Trefferquoten in Ergebnis 4 stehen dagegen nur auf der Testhälfte.
| Sicherheit für Platz 1 | n vorher | n nachher | richtig vorher | richtig nachher |
|---|---|---|---|---|
| 0 bis 50 % | 39 | 26 | 41,0 % | 61,5 % |
| 50 bis 70 % | 64 | 47 | 68,8 % | 74,5 % |
| 70 bis 90 % | 89 | 96 | 87,6 % | 94,8 % |
| 90 bis 99 % | 114 | 116 | 99,1 % | 100 % |
| 99 bis 100 % | 184 | 205 | 100 % | 100 % |
Die Belegung wandert. Ab 99 Prozent steigt die Abdeckung von 37,6 auf 41,8 Prozent, ab 90 Prozent von 60,8 auf 65,5 Prozent.
Diese Zahlen stehen auf allen 490 Anfragen, damit sie mit der Tabelle weiter oben vergleichbar bleiben. Darin steckt die Hälfte, an der wir die Beschreibungen geschärft haben. Auf der Testhälfte, die beim Umschreiben niemand gesehen hat, bleiben 257 Anfragen, und dort sieht der Gewinn an Abdeckung anders aus.
| Schwelle | Abdeckung vorher | Abdeckung nachher | richtig darunter vorher | richtig darunter nachher |
|---|---|---|---|---|
| ab 90 % | 61,5 % | 64,2 % | 68,7 % | 83,7 % |
| ab 99 % | 40,1 % | 40,9 % | 79,9 % | 90,1 % |
Auf der sauberen Hälfte wandert die Belegung also kaum: ab 99 Prozent sind es 0,8 Punkte statt 4,3. Deutlich steigt dort etwas anderes, nämlich der Anteil richtiger Antworten unterhalb der Schwelle, von 79,9 auf 90,1 Prozent. Die Schwelle wird nicht durchlässiger, sie wirft mehr Richtiges weg.
Unangenehm ist das untere Ende. Vorher gab das Modell dort im Mittel 34,0 Prozent an und lag bei 41,0. Nachher gibt es dort 37,6 Prozent Sicherheit an und liegt bei 61,5. Der mittlere Abstand zwischen angegebener Sicherheit und Trefferquote steigt von 0,041 auf 0,069, die Kalibrierung wird also schlechter. Der Brier-Score, der Treffer und Sicherheit zusammen misst, fällt von 0,073 auf 0,047.
Die Trefferquote wird also besser und die Kalibrierung schlechter. Ein Vorzeichen dreht dabei nicht: das Modell gibt in jedem Band weniger an, als es trifft, vor und nach dem Umschreiben. Der Abstand wächst nur. Im untersten Band sieht das am größten aus, von 7 auf 24 Punkte, aber dort liegen vorher 39 und nachher 26 Anfragen. Der Unterschied ist nicht abgesichert, der exakte Test gibt p = 0,13. Wir nennen ihn, weil er in dieselbe Richtung zeigt wie der Rest, nicht als Beleg.
Abgesichert ist der Befund, auf den es ankommt. Unterhalb der empfohlenen Schwelle von 90 Prozent waren auf der Testhälfte vorher 68 von 99 Antworten richtig, nachher 77 von 92, also 68,7 gegen 83,7 Prozent bei p = 0,018. Praktisch heißt das: eine Schwelle, die vor dem Umschreiben eingemessen wurde, verwirft danach Vorschläge, die richtig gewesen wären.
Daraus wird eine Regel, die wir vorher nicht hatten. Wer die Beschreibungen ändert, misst die Schwelle neu. Die Beschreibungen sind Teil der Eingabe, nicht Teil der Umgebung.
Nachtrag vom 23. September 2026: Jev liest E-Rechnungen
Dieser Artikel misst Jev als Skill-Router. Im BKS-Labor steht jetzt ein zweiter Messaufbau, näher an unserer Arbeit mit E-Rechnungen. Eine E-Rechnung trägt viele Angaben zweimal, als Strukturfeld und als Freitext. Steht eine Angabe nur im Text, etwa eine Skontofrist, sieht eine Software sie nicht, wenn sie nur die Felder liest.
Jev bekommt deshalb nur die Freitexte einer Rechnung und beantwortet zehn Ja/Nein-Fragen in einer Anfrage. Der Code liest dieselben Angaben aus den Strukturfeldern und vergleicht.
Auf 34 öffentlichen Testfällen der KoSIT kamen 340 Urteile in 11,3 Sekunden zusammen. Nur 4,1 Prozent davon liegen zwischen 0,3 und 0,7, Jev legt sich also fast immer fest. In 9 Zellen stand eine Angabe nur im Text. Sechs davon haben die Gegenprüfung überstanden, drei nicht, und die Seite zeigt beide.
Die Messung lässt sich auf der Laborseite abspielen, die Schwellen kann man selbst verschieben: Jev liest E-Rechnungen.
Quellen
Alles Öffentliche, am 20. September 2026 abgerufen.
- TypeSafe, Produktseite und Ankündigung: typesafe.ai und typesafe.ai/blog
- Dokumentation: docs.typesafe.ai, Fragetypen, HTTP-API, Modelle, Preise und Limits
- Bekannte Schwächen des Modells: docs.typesafe.ai/model-jaggedness/jev-1.13
- Kochbuch Skill-Vorschlag, die Vorlage für unseren Hinweis-Arm: docs.typesafe.ai/cookbooks/skill_suggestion
- Agent-Skill und Plugin von TypeSafe: github.com/typesafe-ai/skills
- Rechtliches: Auftragsverarbeitungsvertrag, Datenschutzerklärung
- Externer Benchmark: huggingface.co/datasets/deepset/prompt-injections
- Presse und Kritik: The Register, ts2.tech zu den selbst gemessenen Vergleichszahlen
- Projekte aus den ersten Tagen: jev-ultrafast, jev-trader, openjev, LangChain-Blog
Die Messwerte in diesem Artikel stammen aus unseren eigenen Läufen gegen die API, Stand 19. und 20. September 2026, Modellversion jev-1.13.0.

