Jev, die KI, die nur entscheidet
Warum Jev gerade für so viel Wirbel sorgt

Ein KI-Modell, mit dem man nicht reden kann
Seit dem 15. September beschäftigt ein KI-Modell die Entwicklerszene ungewöhnlich stark. Am Tag seiner Vorstellung sammelte der Ankündigungsbeitrag auf Hacker News, dem Forum, in dem sich diese Leute treffen, 1.930 Punkte und 507 Kommentare. TechCrunch berichtet, der Dienst sei wegen der Nachfrage zeitweise gar nicht mehr erreichbar gewesen.
Seine Besonderheit: Man kann nicht mit ihm sprechen. Es verfasst nichts, keinen Satz, keine Zeile Code. Wer ihm eine offene Frage stellt, bekommt keine Antwort: Es beantwortet nur geschlossene Fragen, und das mit einer Wahl. Kein schwächeres ChatGPT also, sondern eine andere Gattung.
Das Modell heißt Jev und stammt von TypeSafe AI, einem Labor aus San Francisco, das Diogo Almeida 2024 gegründet hat. Almeida war zuvor bei OpenAI und Mitautor des InstructGPT-Papers. Am selben Tag trat das Labor aus der Deckung, mit 40 Millionen US-Dollar Startkapital, angeführt laut eigener Pressemitteilung von DCVC.
Es bleibt zu klären, warum ein stummes Modell ausgerechnet Softwareentwickler begeistert. Dafür lohnt ein Blick darauf, was diese gerade bauen.
Was man einen Agenten nennt
Seit zwei Jahren hat sich die Aufgabe der KI verändert: Man verlangt nicht mehr nur Antworten, sondern Handlungen. Genau das nennt man einen Agenten, eine Software, der man eine ganze Aufgabe überträgt und die die einzelnen Schritte selbstständig abarbeitet.
Ein Beispiel, das uns bis zum Schluss begleitet: Ein Kunde schreibt an den Support. Seit drei Tagen scheitert die Verbindung zu seinem Stripe-Konto, das Zahlungstool funktioniert nicht mehr, er verliert Umsatz.
Früher las ein Mensch diese Nachricht: Er schätzte die Dringlichkeit ein, leitete sie an die richtige Stelle weiter, prüfte den Verlauf, entschied über eine Rückerstattung. Ein Agent erledigt dieselbe Runde allein und hält nur dann inne, um nachzufragen, wenn er sich seiner Sache nicht sicher ist.
Eine Kette von Entscheidungen, keine Redaktion
Betrachtet man diese Runde genauer, besteht sie ausschließlich aus Entscheidungen. Reklamation oder technische Frage? Dringend oder nicht? Verlangt dieser Kunde eine Rückerstattung? Ist die Sache sicher genug, um allein zu handeln, oder muss jemand geweckt werden?
Keine dieser Fragen verlangt Schreiben. Sie verlangen eine Wahl. Ein Kästchen ankreuzen, eine Note vergeben, Ja oder Nein sagen.
Und doch vertraut man sie einem Modell an, das schreibt. Bei jedem Schritt wird ein ChatGPT oder ein verwandtes Modell befragt, es formuliert eine Antwort, und weil eine Maschine keinen Fließtext lesen kann, soll es diese Antwort in ein Format packen, das ein Programm wieder auslesen kann. Man prüft, ob das Format hält, und lässt es notfalls erneut versuchen.
Jede kleine Entscheidung kostet damit den Preis und die Dauer einer Redaktion. Man lässt jemanden einen Aufsatz schreiben, von dem man nur ein Häkchen erwartet.
Was Jev tut
Jev geht das Problem von der anderen Seite an. Man gibt ihm eine Situation, hier die Nachricht des Kunden und den Zustand seines Kontos, und stellt ihm geschlossene Fragen. Es kann nur drei Arten von Antworten liefern.
Eine Wahl aus einer vorab festgelegten Liste: Abrechnung, Technik oder Kontoverwaltung. Eine Note auf einer beschriebenen Skala: Kunde ruhig, verärgert, sehr aufgebracht. Ein Ja oder Nein: Verlangt er eine Rückerstattung? Alle Fragen werden in einem einzigen Durchgang gemeinsam bearbeitet.
Vor allem aber liefert jede Antwort eine Zahl mit: die Wahrscheinlichkeit, dass sie richtig ist. Kein sicherer Tonfall, sondern eine Kennzahl. Sie erlaubt es der Software, allein zu handeln, wenn der Wert hoch ist, und die Entscheidung weiterzureichen, wenn er niedrig ist, mit einer umso höheren Schwelle, je schwerer sich die Handlung später korrigieren lässt.
Verfahren, die ein geschwätziges Modell zu einer sauber sortierten Antwort zwingen, gab es bereits. Sie garantieren die Form der Antwort, nicht das Vertrauen, das man ihr entgegenbringen kann. Zwischen einem sauber ausgefüllten Formular und einem mit zittriger Hand unterschriebenen ist das Kästchen in beiden Fällen angekreuzt.
Wofür das gut ist
Alles, was sortiert. Eine E-Mail an die richtige Abteilung weiterleiten, eine Moderationsmeldung bewerten, in einem Text eine Information aus einer bekannten Liste erkennen.
Ein raffinierterer Einsatz kam von frühen Nutzern: die Überwachung eines anderen Modells. Ein ChatGPT von einem zweiten ChatGPT gegenlesen zu lassen, ist teuer, viele verzichten deshalb darauf. Übernimmt Jev diese Aufgabe, berechnet mit 42 US-Dollar pro Milliarde Eingabe-Token und kostenlos bei der Ausgabe, ändert sich die Rechnung.
Warum der Hype so groß ist
Drei Dinge kommen zusammen: die Unterschrift eines OpenAI-Veteranen, die Erzählung vom Anti-Chatbot in einem Jahr der Ermüdung, und spektakuläre Zahlen.
Genau hier lohnt sich Vorsicht. Die Startseite wirbt mit 193,6-facher Geschwindigkeit und 444,6-fach niedrigeren Kosten, die Pressemitteilung zur Finanzierungsrunde, am selben Tag veröffentlicht, spricht von „bis zu 100-mal“. Ein Produkt, zwei Zahlen, je nach Zielpublikum.
Und auf der Seite, auf der das Unternehmen seine Methode erläutert, ist die richtige Antwort keine belegte Wahrheit, sondern der Durchschnitt der Antworten zweier konkurrierender Modelle bei vier von den eigenen Teams erstellten Testfällen. TypeSafe misst also nicht seine Treffergenauigkeit, sondern seine Übereinstimmung mit der Konkurrenz.
Die einzigen Messungen von unabhängiger Seite fallen nüchterner aus. Ein Vercel-Ingenieur, zitiert von TechCrunch, ersetzte einen ChatGPT-Sortierer durch Jev: 5- bis 18-fach schneller. Der technische Leiter von Bryo AI verglich es mit Gemini beim Einsortieren von E-Mails: 10- bis 20-fach günstiger, wobei Gemini geringfügig präziser blieb.
Was der Anbieter selbst über sein Modell sagt
TypeSafe veröffentlicht eine Seite mit neun bekannten Schwächen der aktuellen Version, und das ist die aufschlussreichste Lektüre des ganzen Dossiers. Jev nimmt Fragen wörtlich, zählt nicht zuverlässig, liest Datumsangaben wie gewöhnlichen Text, und besitzt kein Weltwissen.
Zwei Beispiele aus der Dokumentation sagen mehr als jede Warnung. Bei einem Ticket ergibt die Frage nach einer Rückerstattung, je nach Formulierung, 0,22 oder 0,01. Bei einem zweiten Fall liefert „Rückerstattung“ 0,72 und das Gegenteil 0,47, zusammen also 1,19. Wahrscheinlichkeiten addieren sich hier offenbar nicht.
Eine Einschränkung wiegt für Frankreich besonders schwer: Englisch ist laut Dokumentation die vorrangige Trainingssprache, andere Sprachen werden nach eigenem Eingeständnis schlechter verarbeitet. Das Ganze im Früheinsatz, ohne unabhängige Messung.
Das fehlende Glied der Agenten, Mythos oder Wirklichkeit?
Das Ökosystem hat sich schnell entschieden, zumindest in seinen Gesten. Vercel band Jev bereits am 16. September in seine Gateway ein. LangChain, das Werkzeug, mit dem viele Agenten zusammengesetzt werden, veröffentlicht ein eigenes Paket und schreibt, Jev ersetze das geschwätzige Modell nicht, sondern ergänze es: Text für das freie Denken, Jev für die Entscheidungen unterwegs. LlamaIndex, Pydantic AI und LiteLLM zogen binnen fünf Tagen nach.
Es bleibt eine Hürde, und ausgerechnet die Dokumentation von TypeSafe benennt sie: Jev misstraut nicht dem, was man ihm zu lesen gibt. Eine in einen Text eingeschmuggelte Anweisung kann seine Antwort verschieben. Ein Agent aber liest genau das, was er nicht kontrolliert: eine Webseite, eine von außen kommende E-Mail, die Ausgabe eines anderen Modells. Ausgerechnet dort, wo man das Bauteil als Wächter einsetzen möchte, erweist es sich als anfällig.
Das Urteil fällt zweigeteilt aus. Sinnvoll, wenn die Entscheidung geschlossen und die Eingabe kontrolliert ist: eine interne Warteschlange sortieren, einen Vorgang bewerten, festlegen, welches Modell eine Anfrage übernimmt. Verfrüht überall dort, wo der Agent von außen kommende Inhalte liest. Die fortgeschrittensten Integrationen tragen im Übrigen selbst den Vermerk „experimentell“.
Eine Entscheidung kann gültig und trotzdem falsch sein
Das meistwiederholte Verkaufsargument: Jev kann sich nichts ausdenken. Das stimmt in einem engen Sinn, es wird nie eine Antwort außerhalb der vorgegebenen Liste liefern. Doch wie es ein Entwickler formulierte: Das Format einzuhalten heißt nicht, die Wahrheit zu sagen. Ein Modell, das zwischen „Abrechnung“ und „Technik“ entscheiden muss, wählt immer eines von beiden, selbst wenn die richtige Antwort „keins von beidem“ gewesen wäre.
Die Dokumentation sagt es auf ihre Weise. Die Zuverlässigkeit dieser Wahrscheinlichkeiten lasse sich nur über große Mengen von Antworten hinweg prüfen und garantiere nicht, dass eine einzelne, isoliert betrachtete Antwort richtig sei. Almeida selbst räumt es ein: Es bleibt möglich, sich mit Zuversicht zu irren.
Das Risiko verschwindet dadurch nicht, es ändert nur seine Form. Es sieht nicht mehr aus wie ein erfundener Satz, den man mit bloßem Auge erkennt, sondern wie eine sauber formatierte 0,94 in einer Variablen, die direkt in den weiteren Programmablauf einfließt.
Behandelte Themen:
Häufig gestellte Fragen
Was ist Jev, das Modell von TypeSafe AI?
Welche Antworten kann Jev liefern?
Sind die Geschwindigkeits- und Kostenangaben zu Jev geprüft?
Welche Schwächen von Jev sind bekannt?
Kann Jev als Wächter in einem Agenten dienen?
Wie viel hat TypeSafe AI eingesammelt, und von wem?

Alexandre Noto
Mitgründer & Tech-Experte
Alexandre ist seit über 20 Jahren in der Tech-Branche. Unternehmer, Software-Architekt und KI-Enthusiast, übersetzt er komplexe Konzepte in verständliche Erklärungen. Bei Declic Media ist er die technische Stimme, die KI für alle verständlich macht.
Alle Artikel von Alexandre →