Schnelles Denken für Software: Was das KI-Modell Jev von ChatGPT und Co. unterscheidet

Jev und System-1-KI: Wenn ein KI-Modell nicht schreibt, sondern entscheidet
Abstract
- #Jev
- #System-1-KI
- #künstliche Intelligenz
- #KI-Modelle
- #Softwareentwicklung
System-1-KI einfach erklärt: So trifft Jev blitzschnelle Entscheidungen mit Wahrscheinlichkeiten
Wenn von künstlicher Intelligenz die Rede ist, denken die meisten Menschen an Chatbots, die Texte verfassen. Das Modell Jev des Start-ups TypeSafe geht einen anderen Weg: Es schreibt kein einziges Wort. Stattdessen beantwortet es Fragen, indem es aus vorgegebenen Antworten auswählt und zu jeder Antwort eine Wahrscheinlichkeit nennt. In diesem Artikel erfahren Sie Schritt für Schritt, was dahintersteckt, wie Jev trainiert wird und an welchen Stellen ein solches Modell in Ihrer Software nützlich sein kann.
Was bedeutet "System 1" überhaupt?
Der Begriff stammt vom Psychologen Daniel Kahneman. In seinem Buch "Schnelles Denken, langsames Denken" beschreibt er zwei Arten, wie Menschen denken.
Schnelles Denken: Die Antwort ist sofort da
Was ergibt 2 mal 2? Sie wissen die Antwort, ohne zu rechnen. Genau das ist System 1: schnell, automatisch und ohne spürbare Anstrengung. Es ist vergleichbar mit dem Blick auf eine Ampel. Bei Rot bleiben Sie stehen, ohne darüber nachzudenken.
Langsames Denken: Schritt für Schritt zum Ergebnis
Was ergibt 17 mal 24? Hier müssen die meisten Menschen kurz innehalten und die Aufgabe in Teilschritte zerlegen, bis sie bei 408 ankommen. Das ist System 2: langsam, bewusst und gründlich. Im Alltag entspricht das etwa dem Ausfüllen der Steuererklärung.
Wie arbeiten klassische Sprachmodelle?
Die meisten KI-Modelle, die wir heute nutzen, sind zum Schreiben gebaut. Ein Chatbot erzeugt seine Antwort Stück für Stück, ein sogenanntes Token nach dem anderen. Sogenannte Reasoning-Modelle gehen noch weiter: Sie schreiben zunächst ihren Gedankengang auf und kommen erst danach zur Antwort. Damit sind sie das, was einem System-2-Denker in der KI-Welt am nächsten kommt.
Viele Entscheidungen in einer Software benötigen jedoch gar kein gründliches Nachdenken. Es handelt sich um schnelle Einschätzungen, wie sie ein Mensch beim Überfliegen eines Textes trifft. Für genau diese Aufgaben ist Jev gedacht.
Ein Beispiel aus der Praxis: Die E-Mail an den Kundenservice
Stellen Sie sich vor, im Kundenservice trifft folgende Nachricht ein: "Mir wurde diesen Monat zweimal Geld abgebucht. Bitte korrigieren Sie das."
Die Software, die diese E-Mail verarbeitet, muss drei Fragen klären:
- Handelt es sich um eine Rückerstattungsanfrage? (ja oder nein)
- Welches Team ist zuständig? (Abrechnung, technischer Support oder Vertrieb)
- Wie dringend ist das Anliegen? (von niedrig bis kritisch)
Ein Mensch erkennt beim ersten Lesen: Ja, hier möchte jemand sein Geld zurück. Das ist typische System-1-Arbeit.
Der bisherige Weg über ein Sprachmodell
Heute wird eine solche Aufgabe häufig so gelöst: Die E-Mail geht an ein großes Sprachmodell (LLM), und dieses liefert die Antworten in einem strukturierten Format zurück, zum Beispiel als JSON. Das funktioniert meistens. Es fehlt jedoch eine wichtige Information: Wie sicher ist sich das Modell?
Natürlich können Sie das Modell danach fragen. Die genannte Zahl entspricht aber nicht unbedingt den tatsächlichen Wahrscheinlichkeiten, mit denen das Modell intern gearbeitet hat. Es ist ein wenig so, als würden Sie einen sehr selbstbewussten Kollegen fragen, ob er sich sicher ist. Er sagt fast immer "ja".
So arbeitet Jev: Fragen hinein, Wahrscheinlichkeiten heraus
Jev erhält zwei Arten von Eingaben und liefert eine ganz andere Art von Ausgabe als ein Chatbot.
Die Eingaben: Zustand und Fragen
Zunächst bekommt Jev den sogenannten Zustand (englisch "State"). Das sind die Daten, um die es bei der Entscheidung geht. In unserem Beispiel gehören dazu die E-Mail und vielleicht auch die letzten Abbuchungen des Kunden. Zusätzlich erhält Jev die Fragen selbst. Unsere drei Fragen gehören zu drei verschiedenen Typen:
- Ja-Nein-Frage: Ist es eine Rückerstattungsanfrage?
- Auswahlfrage: Welches Team aus einer festen Liste ist zuständig?
- Bewertungsfrage: Wie dringend ist das Anliegen auf einer Skala?
Alle drei Fragen werden in einer einzigen Anfrage gestellt.
Die Ausgabe: Zahlen statt Sätze
Jev erzeugt keinen Text. Zurück kommen ausschließlich Wahrscheinlichkeiten:
- Für die Rückerstattung eine einzelne Zahl, etwa 0,9. Das bedeutet: Mit 90 Prozent Wahrscheinlichkeit handelt es sich um eine Rückerstattungsanfrage.
- Für das Team eine Wahrscheinlichkeit je Option, zum Beispiel 0,85 für die Abrechnung.
- Für die Dringlichkeit einen Wert auf der Skala, in unserem Fall im Bereich von hoch bis kritisch.
Nur erlaubte Antworten sind möglich
Bei der Auswahlfrage kann Jev nur die Optionen nennen, die Sie vorgegeben haben. Das Team heißt also immer Abrechnung, Technik oder Vertrieb und niemals etwas Erfundenes.
Warum das schneller und günstiger ist
Ein Sprachmodell schreibt seine JSON-Antwort Token für Token. Jev liefert dagegen alle drei Antworten auf einmal. Das ist ein wesentlicher Grund, warum es bei solchen Fragen deutlich schneller und kostengünstiger arbeitet. Natürlich kann sich auch Jev irren. Die Wahrscheinlichkeit sagt Ihnen aber, wie oft damit zu rechnen ist.
Wie lernt ein Modell, sich richtig einzuschätzen?
Um das zu verstehen, lohnt sich ein kurzer Blick auf das Training herkömmlicher Sprachmodelle.
Vortraining und Nachtraining
Im Vortraining (Pre-Training) liest ein Modell riesige Textmengen und lernt, das jeweils nächste Token vorherzusagen. Danach weiß es sehr viel, ist aber noch kein brauchbarer Gesprächspartner. Dafür folgt das Nachtraining (Post-Training), das häufig auf bestärkendem Lernen (Reinforcement Learning) beruht: Das Modell gibt eine Antwort, die Antwort wird bewertet, und das Modell wird in Richtung gut bewerteter Antworten gelenkt. Entscheidend ist, wer oder was bewertet.
RLHF: Menschen bewerten
Beim "Reinforcement Learning from Human Feedback" vergleichen Menschen zwei Antworten und wählen die bessere aus. Aus diesen Urteilen entsteht ein Belohnungsmodell, an dem der Chatbot ausgerichtet wird. Der Nachteil: Menschen mögen Antworten, die überzeugt klingen. Das Modell kann dadurch lernen, sehr sicher aufzutreten, auch wenn es falsch liegt.
RLVR: Überprüfbare Ergebnisse bewerten
Beim "Reinforcement Learning with Verifiable Rewards" erfolgt die Bewertung automatisch. Stimmt das Ergebnis der Rechenaufgabe? Besteht der Programmcode seine Tests? Dieses Verfahren ist ein wichtiger Grund dafür, dass Reasoning-Modelle in Mathematik und Programmierung so gut geworden sind. Belohnt wird allerdings nur die richtige Endantwort, nicht die richtige Einschätzung der eigenen Sicherheit. Außerdem machen die langen Gedankengänge diese Modelle langsam und teuer.
RLCD: Das Training von Jev
Jev wird mit einer dritten Variante trainiert: "Reinforcement Learning for Calibrated Decisions". TypeSafe hat bisher wenig über den inneren Aufbau veröffentlicht. Bekannt ist: Jev nennt für jede Option eine Wahrscheinlichkeit und wird belohnt, wenn diese Wahrscheinlichkeiten zutreffen.
Das Schlüsselwort lautet Kalibrierung. Denken Sie an den Wetterbericht: Wenn an allen Tagen mit "80 Prozent Regenwahrscheinlichkeit" tatsächlich an etwa 80 Prozent dieser Tage Regen fällt, ist die Vorhersage gut kalibriert. In einem Diagramm, das die genannte Wahrscheinlichkeit der tatsächlichen Trefferquote gegenüberstellt, ergibt sich dann eine Diagonale.
Von der Wahrscheinlichkeit zur Entscheidung im Programm
Mit kalibrierten Zahlen lässt sich im Code sehr einfach arbeiten, nämlich über Schwellenwerte. Für die Rückerstattungsfrage könnte das so aussehen:
| Wahrscheinlichkeit | Aktion |
|---|---|
| über 0,9 | E-Mail geht direkt in die Warteschlange für Rückerstattungen |
| zwischen 0,1 und 0,9 | Ein Mensch prüft den Fall |
| unter 0,1 | Keine Rückerstattungsanfrage, es ist nichts zu tun |
Der Vorteil: Weil die Zahlen kalibriert sind, verrät der Schwellenwert ungefähr, wie oft der automatische Weg falsch liegen wird. Daraus folgt eine einfache Regel: Je teurer ein Fehler wäre, desto höher setzen Sie die Schwelle.
Weitere Einsatzgebiete und Grenzen
Jev als Schutzmechanismus
Jev eignet sich nicht nur für Support-E-Mails. Es kann auch als Leitplanke (Guardrail) dienen, etwa rund um einen Chatbot. Dort prüft es ein- und ausgehende Nachrichten, zum Beispiel auf Versuche, die Regeln des Chatbots zu umgehen (Jailbreaks).
Was Jev nicht kann
Einige Einschränkungen sollten Sie kennen:
- Jev verarbeitet derzeit ausschließlich Text.
- Rechnen und sogar Zählen gehören nicht zu seinen Stärken.
- Wie jedes KI-Modell kann es durch Anweisungen getäuscht werden, die in den gelesenen Daten versteckt sind.
Zusammenspiel von Jev und Sprachmodellen
Werden große Sprachmodelle nun überflüssig? Keineswegs. Beide Modellarten ergänzen sich, ähnlich wie Empfang und Fachabteilung in einem Unternehmen:
- Jev sortiert die eingehende E-Mail: Geht es um eine Rückerstattung?
- Ein Sprachmodell übernimmt die langsamere Arbeit und formuliert die Antwort an den Kunden.
- Jev ordnet anschließend die Rückmeldung des Kunden wieder ein.
Das entspricht dem, was Kahneman über uns Menschen sagt: Der größte Teil läuft über schnelle, automatische Prozesse. Das gründliche Denken setzt nur ein, wenn es wirklich nötig ist.
Woher der Name stammt und wohin die Reise gehen könnte
Jev ist nach dem Ökonomen William Stanley Jevons benannt. Er stellte 1865 fest, dass Großbritannien mehr Kohle verbrauchte, obwohl die Dampfmaschinen effizienter wurden. Dieser Effekt ist als Jevons-Paradoxon bekannt. Ähnliches könnte bei System-1-Modellen geschehen: Wenn eine Einschätzung sehr schnell und sehr günstig ist, lässt sie sich an Stellen einsetzen, an denen ein Sprachmodell heute zu langsam oder zu teuer wäre, etwa in jeder Zeile einer Datenbank oder einer Protokolldatei.
Fazit
Jev zeigt, dass ein KI-Modell nicht schreiben muss, um nützlich zu sein. Es beantwortet klar umrissene Fragen mit kalibrierten Wahrscheinlichkeiten, und das schnell und kostengünstig. Über Schwellenwerte lässt sich im Programm festlegen, wann automatisch gehandelt wird und wann ein Mensch prüfen soll. Sprachmodelle ersetzt Jev nicht, denn für das Formulieren und für gründliche Überlegungen bleiben sie zuständig. In der Kombination entsteht jedoch eine sinnvolle Arbeitsteilung: schnelles Denken für die vielen kleinen Entscheidungen, langsames Denken für die wenigen schwierigen. Überlegen Sie einmal, an welchen Stellen Ihrer eigenen Software solche schnellen Einschätzungen anfallen.
Häufige Fragen (FAQ)
Kann Jev einen Chatbot ersetzen?
Nein. Jev erzeugt keinen Text und kann daher weder Gespräche führen noch E-Mails formulieren. Es eignet sich für Einschätzungen mit festen Antwortmöglichkeiten und arbeitet am besten zusammen mit einem Sprachmodell.
Was bedeutet "kalibriert" bei einem KI-Modell?
Ein Modell ist kalibriert, wenn seine Wahrscheinlichkeiten mit der Wirklichkeit übereinstimmen. Nennt es bei vielen Fällen jeweils 80 Prozent, sollte es in etwa 80 Prozent dieser Fälle richtig liegen.
Wie lege ich einen passenden Schwellenwert fest?
Orientieren Sie sich an den Kosten eines Fehlers. Ist eine falsche automatische Entscheidung teuer, wählen Sie eine hohe Schwelle und lassen unsichere Fälle von Menschen prüfen. Bei geringem Risiko kann die Schwelle niedriger liegen.
Kategorien
Schlagworte