Zum Inhalt springen
KI-Modell im Test

Jev statt ChatGPT: 100-mal billiger, und meine Antwortquote war geschönt

Jev ist ein neues KI-Modell, das nicht schreibt, es entscheidet nur. Ich habe es an 193 echten Antworten aus meinen Kampagnen getestet: 0,8 Sekunden je Antwort, 0,6 Cent für alle zusammen, rund hundertmal billiger als ein Chatmodell. Nebenbei kam heraus, dass jede zehnte als positiv geführte Antwort keine war.

Florian LapizFL Digital20. September 2026, aktualisiert am 21. September10 Minuten
0,6 Cent
Kosten für alle 193 Einordnungen mit JevSelbst gemessen, 0,8 Sekunden je Antwort
1 von 10
Als positiv geführte Antworten war keineUrlaubsnotizen, eine Werbemail, eine klare Absage
91 %
Anteil, den eine Maschine sicher einordnetDer Rest geht zur Prüfung an einen Menschen

Eigene Auszählung aus dem Postfach von FL Digital, geprüft am 19. und 20. September 2026. Ein Postfach, eine Zielgruppe. Methode und Grenzen im letzten Abschnitt. Listenpreise laut TypeSafe AI, Stand 15. September 2026.

Die kurze Antwort

  • Das Modell heißt Jev, kommt von TypeSafe AI und ist seit dem 15. September 2026 in einer frühen Testphase zugänglich. Es schreibt keinen Text. Es wählt aus Antworten, die du vorgibst, und nennt dazu seine Sicherheit.
  • Jede zehnte als positiv geführte Antwort war keine. Darunter Urlaubsnotizen, eine Werbemail eines Software-Anbieters und eine klare Absage.
  • In den Streitfällen lag die Maschine öfter richtig als das Etikett aus dem Versandtool: von 21 Abweichungen gingen rund 12 auf ein falsches Etikett zurück.
  • Bessere Fragen haben die Trefferquote nicht gehoben. Vier Fassungen, dasselbe Ergebnis. Die Grenze liegt in der Datenqualität.
  • Der praktische Gewinn ist die Sortierung: 91 von 100 Antworten werden sicher eingeordnet, 9 landen zur Prüfung auf dem Tisch.
  • Credits sparst du vor allem durch Arbeitsteilung: Einsortieren an Jev, Schreiben an ein Chatmodell, alle Fragen in einen Aufruf und nur den Antworttext senden, nie den ganzen Verlauf.

Woher die Zahl kommt, mit der du dein Quartal bewertest

In einem typischen Aufbau laufen Kaltakquise-Mails über ein Versandtool. Antwortet jemand, bekommt die Antwort dort einen Status: interessiert, kein Interesse, abwesend, falscher Ansprechpartner. Gesetzt wird er teils von Hand, teils automatisch.

Aus diesen Status entsteht später der Bericht: so viele Kontakte angeschrieben, so viele positive Antworten, daraus die Quote. Diese eine Zahl entscheidet, ob eine Kampagne weiterläuft, ob die Ansprache taugt und ob das Geld richtig liegt.

Der Haken: Eine Urlaubsnotiz sieht für eine automatische Einordnung freundlich aus. Sie enthält Dank, einen vollständigen Satz und oft einen Namen. Sie sagt aber nichts über Interesse. Landet sie im Topf für positive Antworten, steigt deine Quote, ohne dass ein einziges Gespräch näher gerückt wäre.

Der Test: 193 echte Antworten

In meinem Versandtool liegen 1.683 Antworten, fast alle mit Status. Daraus habe ich 193 gezogen, absichtlich gemischt: 60 Abwesenheitsnotizen, 60 Absagen, 50 positive und 23 mit Verweis auf eine andere Person.

Jede Antwort ging an Jev, ein Entscheidungsmodell von TypeSafe AI, das keinen Text schreibt und ausschließlich einordnet. Zu jedem Urteil liefert es eine Sicherheit zwischen 0 und 1. Dauer je Antwort rund 0,8 Sekunden, Kosten für alle 193 zusammen sechs Zehntel Cent.

Dann habe ich jede Abweichung einzeln gelesen und entschieden, wer recht hatte: das Etikett aus dem Versandtool oder die Maschine.

KennzahlWert
Übereinstimmung mit dem Etikett aus dem Versandtool89 %
Abweichungen insgesamt21 Fälle
davon: Etikett war falschrund 12
davon: Fall wirklich doppeldeutigrund 8
davon: Maschine lag falsch1, mit Sicherheit 0,41
Dauer je Antwort0,8 Sekunden
Der eine Fehlgriff der Maschine hatte eine niedrige Sicherheit und wäre im laufenden Betrieb zur Prüfung gegangen.
Automatische Abwesenheitsnotiz im Postfach, Namen und Adressen geschwärztVollansicht
Genau dieser Fall steckt in den Daten: eine automatische Abwesenheitsnotiz mit Rückkehrdatum, die zusätzlich zwei Vertretungen nennt. Abwesend oder falscher Ansprechpartner? Das Versandtool entscheidet das nebenbei. Namen und Adressen sind geschwärzt.Eigener Bestand, September 2026

Welches Modell das ist: Jev von TypeSafe AI

Das Modell heißt Jev. Gebaut hat es TypeSafe AI, ein junges Unternehmen von der US-Westküste. Gründer Diogo Almeida war vorher bei OpenAI und hat dort an den Methoden mitgearbeitet, aus denen ChatGPT entstanden ist. Jev ist am 15. September 2026 erschienen, als erstes öffentliches Modell einer neuen Klasse, die TypeSafe System One Models nennt.

Die Namen sind Programm. System One steht für das schnelle, intuitive Denken aus Daniel Kahnemans Buch Schnelles Denken, langsames Denken. Jev ist nach William Stanley Jevons benannt, dem Ökonomen, der beobachtet hat, dass sparsamere Dampfmaschinen den Kohleverbrauch erhöht haben. Die Wette dahinter: Wird Intelligenz hundertmal billiger, findet sie hundertmal mehr Einsatzorte.

Der technische Kern in zwei Sätzen: Jev gibt keinen Text aus. Du legst vorher fest, welche Antworten erlaubt sind, und Jev liefert für jede eine Wahrscheinlichkeit, alle gleichzeitig statt Wort für Wort. Deshalb kann es sich keine Kategorie ausdenken, und deshalb ist es so schnell und so billig.

Zur Einordnung: Tempo und Kosten in diesem Artikel habe ich selbst gemessen, aus Deutschland, an meinen eigenen Daten. Die Vergleiche mit anderen Modellen stammen vom Hersteller. Die Originalquelle ist am Ende des Artikels verlinkt.

Zwei Balkendiagramme mit Fehlerquoten bei strukturierter Ausgabe und bei Werkzeugaufrufen, Jev bei null Prozent, andere Modelle bis 45,5 ProzentVollansicht
Wie oft ein Modell ein kaputtes Format liefert (links) oder einen fehlerhaften Werkzeugaufruf (rechts). Jev steht bei 0 Prozent, weil es konstruktionsbedingt nur erlaubte Werte ausgeben kann. Die Werte der anderen Modelle stammen laut Hersteller aus OpenRouter-Daten. Für einen Ablauf ohne Aufsicht ist genau diese Spalte entscheidend: Ein kaputtes Format hält die ganze Kette an.Grafik: TypeSafe AI, Blogpost vom 15. September 2026
So sieht eine Antwort des Modells aus
{
  "kategorie": "abwesenheit",
  "sicherheit": 0.99,
  "verteilung": {
    "abwesenheit": 0.99,
    "absage": 0.01,
    "positiv": 0.00,
    "falscher_ansprechpartner": 0.00
  }
}
Echte Ausgabe für eine Urlaubsnotiz. Kein Fließtext. Vier erlaubte Werte mit ihren Wahrscheinlichkeiten. Genau das lässt sich in einem Arbeitsablauf weiterverarbeiten.

Was in den Abweichungen steckte

Drei Muster erklären fast alles.

Das dritte Muster ist das interessanteste, weil es keine Fehlerquelle ist. Es ist eine Entscheidung. Für mein Geschäft zählt eine Nachricht wie diese als falscher Ansprechpartner, denn im selben Haus sitzt weiterhin jemand, der zuständig ist. Wer sie als Absage bucht, wirft ein Unternehmen weg, das noch offen ist.

MusterBeispiel aus den DatenWarum es schiefgeht
Höflichkeit gelesen als InteresseIch bin ab dem 7. April wieder im Büro, geführt als positivDie automatische Einordnung bewertet den Ton, nicht die Aussage
Absage gelesen als falscher AnsprechpartnerDanke, aber wir haben keinen BedarfWer die Kategorien nicht trennt, verschiebt nur Müll von einem Topf in den anderen
Zwei Dinge in einer NachrichtHerr X arbeitet nicht mehr hier, bitte keine Mails mehrDas ist Absage und falscher Ansprechpartner zugleich. Ein Topf kann das nicht abbilden
Die Beispiele stammen wörtlich aus den geprüften Antworten, Namen entfernt.

Bessere Fragen haben nichts gebracht

Nachdem die erste Fassung bei 89 Prozent lag, habe ich die Fragen dreimal nachgeschärft: einmal mit einer ausformulierten Rangfolge, einmal mit vielen Einzelfragen und einer Regel im Programmcode, einmal mit einer gezielten Ergänzung.

Die Deckelung liegt nicht bei der Formulierung. Sie liegt bei den Etiketten, an denen gemessen wird. Ungefähr jede zwanzigste Antwort ist falsch beschriftet, jede zwölfte ist echt doppeldeutig. Über diese Grenze kommt keine Frage hinaus, egal wie gut sie gestellt ist.

Ein Nebenbefund, der mich Zeit gekostet hat: Die Variante mit den Einzelfragen war die aufwendigste und die schlechteste. Ich hatte die Sicherheit selbst aus mehreren Werten zusammengerechnet. Damit war sie wertlos, und die Hälfte der Fälle ging unnötig an einen Menschen. Eine Sicherheitsangabe muss aus einem Urteil kommen, nicht aus einer Bastelei darüber.

Fassung der FrageÜbereinstimmungSicher entschieden
Schlicht, vier Kategorien89 %88 %
Rangfolge in der Anweisung88 %86 %
Einzelfragen plus Regel im Code85 %53 %
Schlicht plus eine Ergänzung89 %91 %
Vier Fassungen derselben Frage an denselben 193 Antworten. Die letzte Zeile läuft heute im Betrieb.
Ablaufdiagramm in vier Stufen: Einordnen, Entscheiden, Eindämmen, Maßnahme, jede Stufe mit mehreren kleinen Fragen an das ModellVollansicht
So sieht ein Ablauf aus, für den Jev gebaut ist: ein Sicherheitsalarm, zerlegt in viele kleine Fragen (ja oder nein, Punktwert, Auswahl), und der Code entscheidet anhand der Wahrscheinlichkeiten. TypeSafe empfiehlt genau diese Zerlegung. In meinem Test war die zerlegte Fassung trotzdem die schwächste, weil ich die Sicherheit selbst zusammengerechnet habe. Zerlegen hilft nur, wenn der Code die Wahrscheinlichkeiten sauber weiterverarbeitet.Grafik: TypeSafe AI, Blogpost vom 15. September 2026

Der ChatGPT-Budget-Killer: warum Sortieren kein Job für Chatmodelle ist

Die naheliegende Frage lautet: Kann das nicht einfach ChatGPT? Sortieren kann es auch. Für eine Maschine, die ohne Aufsicht läuft, fehlen ihm aber zwei Dinge.

Erstens liefert ein Chatmodell Text. Es schreibt dir: Das klingt nach einer Abwesenheitsnotiz, vermutlich kein Interesse. Damit kann ein Mensch etwas anfangen, eine Software nicht. Ein Arbeitsablauf braucht einen von vier festen Werten, jedes Mal exakt gleich geschrieben.

Zweitens sagt ein Chatmodell nicht ehrlich, wie sicher es ist. Es formuliert höflich weiter, auch wenn die Lage unklar ist. Genau diese Angabe brauchst du aber, um zu entscheiden, was ohne Nachprüfen durchlaufen darf.

Drittens der Preis, und hier kommt der Spitzname her. Ein Chatmodell rechnet jedes Wort ab, das es liest, und jedes, das es schreibt, die geschriebenen meist fünfmal teurer. Jev rechnet nur ab, was es liest: laut Hersteller 0,042 Dollar je Million Token (Textbausteine, grob drei Viertel eines Worts). Die Ausgabe kostet nichts. In meinem Test waren das 0,6 Cent für 193 Antworten, also rund 3 Cent für 1.000. Ein Chatmodell der oberen Klasse liegt bei derselben Textmenge bei rund 3 Dollar. Für Sortierarbeit ist ein Chatmodell ein Budgetfresser.

Das Bild, das es trifft: Ein Chatmodell ist der Kollege, der dir eine Einschätzung aufschreibt. Ein Entscheidungsmodell ist der Mitarbeiter an der Poststelle, der jeden Brief in eines von vier Fächern legt und dazusagt, bei welchen er sich nicht sicher war. Beides hat seinen Platz. Die Antwort an den Kunden schreibt weiterhin ein Mensch. Die Frage, in welches Fach etwas gehört, gehört an die Stelle, die schnell, billig und ehrlich unsicher ist.

Chatmodell (ChatGPT, Claude)Jev (Entscheidungsmodell)
ErgebnisText zum Lesenein Wert aus einer Liste, die du vorgibst
Angabe zur Sicherheitkeine belastbareZahl zwischen 0 und 1, geeicht
Tempo je Antwortmehrere Sekunden0,8 Sekunden, aus Deutschland gemessen
Preis je Million gelesener Token0,20 bis 10 Dollar0,042 Dollar
Preis für die Ausgabeetwa fünfmal teurer als die Eingabekostenlos
Kosten für 1.000 Antwortenrund 3 Dollar, gerechnetrund 3 Cent, gemessen
Kann es etwas erfinden?ja, auch neue Kategoriennein, nur erlaubte Werte. Falsch liegen kann es trotzdem
Wofür es gemacht istschreiben, zusammenfassen, berateneinsortieren, weiterleiten, freigeben
Listenpreise laut TypeSafe AI, Stand 15. September 2026. Tempo und Kosten von Jev selbst gemessen, die Kosten des Chatmodells sind eine Rechnung mit derselben Textmenge.
Streudiagramm Treffsicherheit gegen Kosten je Ablauf auf logarithmischer Achse, Jev ganz links bei rund 68 Prozent, Modelle von OpenAI und Anthropic weiter rechtsVollansicht
Treffsicherheit gegen Kosten je Ablauf, die Kostenachse ist logarithmisch. Jev (pink, ganz links) erreicht dieselbe Treffsicherheit wie die mittleren Modelle von OpenAI und liegt dabei rund zwei Zehnerpotenzen billiger. Gemessen hat der Hersteller an vier eigenen Abläufen, Referenz ist der Durchschnitt aus GPT-6 Astra und Fable 5.1.Grafik: TypeSafe AI, Blogpost vom 15. September 2026

Die Schwelle ist das eigentliche Werkzeug

Interessant ist nicht die Gesamtquote. Interessant ist, wie viel ohne Nachprüfen laufen darf.

Genau so läuft es jetzt bei mir: Jede eingehende Antwort wird eingeordnet, sichere Fälle landen direkt in der Datenbank, unsichere bekommen den Status Prüfen und eine eigene Ansicht. Die Arbeit schrumpft von alle Antworten lesen auf neun von hundert lesen.

Der Aufbau dahinter ist unspektakulär: Das Versandtool meldet eine eingegangene Antwort, der Text geht an das Modell, das Urteil samt Sicherheit läuft zurück in die Datenbank. Drei Arbeitsschritte je Antwort, keine Handarbeit.

Sicherheit des UrteilsAnteil der AntwortenWas passiert
ab 0,991 %wird automatisch einsortiert
unter 0,99 %bekommt den Status Prüfen und geht an einen Menschen
Die Schwelle ist eine Entscheidung über das eigene Risiko, keine Eigenschaft des Modells.
Ablauf mit Webhook, Weiche und drei Zweigen, im unteren Zweig der Modellaufruf und zwei Datenbank-UpdatesVollansicht
Der laufende Ablauf, neun Bausteine: Links meldet das Versandtool eine eingegangene Antwort, die Weiche schickt echte Antworten in den unteren Zweig. Dort geht der Text an das Modell, danach wird der Kontakt in der Datenbank gesucht und der Status geschrieben. Ab 0,9 Sicherheit der erkannte Wert, darunter der Status Prüfen.Eigener Aufbau, September 2026

So sparst du Credits: sechs Stellschrauben

Credits kosten an zwei Stellen: beim Modell selbst und im Automatisierungswerkzeug, das jeden Arbeitsschritt zählt. Bei mir sind es drei Schritte je Antwort.

Die größte Ersparnis liegt nicht im günstigsten Tarif. Sie liegt in der Arbeitsteilung: Welche Aufgabe braucht wirklich ein Modell, das schreiben kann? Einsortieren, weiterleiten, freigeben braucht es nicht. Alles, was unten in der Tabelle steht, habe ich in meinem eigenen Ablauf umgesetzt oder beim Nachschärfen teuer gelernt.

StellschraubeWas du tustWas es spart
Richtiges Modell für den JobEinsortieren an Jev, nur das Schreiben an ein ChatmodellRund Faktor 100 bei den Modellkosten
Filter vor dem AufrufNur echte Antworten mit Text weiterleiten, leere Meldungen und Versandereignisse vorher aussortierenEin Filter kostet keinen Arbeitsschritt, ein Aufruf kostet einen
Alle Fragen in einen AufrufKategorie und Zusatzfragen gemeinsam stellenDer Text wird nur einmal gelesen und bezahlt, die Antworten kosten nichts
Nur die Antwort sendenZitierten Mailverlauf und Signatur abschneidenBezahlt wird nur gelesener Text, und der Verlauf ist oft länger als die Antwort
Schwelle statt VollkontrolleAb 0,9 Sicherheit automatisch, darunter Status PrüfenEin Mensch liest 9 statt 100 von 100 Antworten
Sicherheit nicht selbst bastelnDie Sicherheit aus dem Urteil übernehmen, nicht aus Einzelwerten zusammenrechnenMeine Bastelvariante schickte 47 statt 9 von 100 Antworten an einen Menschen
Alle sechs Punkte laufen in meinem eigenen Ablauf. Der größte Hebel ist die erste Zeile, die anderen fünf halten die laufenden Kosten klein.

Was das für deinen Vertrieb bedeutet

Das Thema ist nicht Kaltakquise. Das Thema ist die Kette, an deren Ende eine Steuerungszahl steht.

Deine Quoten sind so gut wie die Etiketten darunter. Bevor du eine Kampagne abschaltest oder ausbaust, prüfe zwanzig Antworten von Hand nach. Das dauert zwanzig Minuten und beantwortet, ob deine Zahl trägt.

Ferienzeiten verzerren stärker, als man denkt. Abwesenheitsnotizen machen in meinem Bestand den größten Einzelblock aus. Wer sie nicht herausrechnet, misst im Sommer eine gesunde Kampagne, die keine ist.

Derselbe Fehler steckt in jedem CRM. Gewonnen, verloren, kein Interesse: Das sind ebenfalls Etiketten, die jemand nebenbei setzt. Jede Auswertung darüber erbt ihre Fehler.

Was dieser Artikel nicht beweist

Die 193 Antworten stammen aus einem Postfach und aus meinen eigenen Kampagnen. Andere Zielgruppen antworten anders.

Ob ein Etikett falsch war, habe ich selbst beurteilt. Bei den klaren Fällen ist das unstrittig, eine Urlaubsnotiz ist keine Zusage. Bei den acht doppeldeutigen Fällen ist es eine Entscheidung, keine Wahrheit.

Die Aussage, dass jede zehnte positive Antwort keine war, stammt aus 50 geprüften positiven Antworten. Sie ist ein Befund, keine belastbare Quote.

Getestet ist die Einordnung, nicht die Frage, ob dadurch mehr Termine entstehen. Diese Zahl liegt erst nach einigen Wochen Betrieb vor, und sie kommt in eine zweite Fassung dieses Artikels.

Die Vergleichszahlen zu anderen Modellen stammen von TypeSafe selbst. Der Hersteller schreibt offen, dass seine Werte von 193-mal schneller und 444-mal billiger eher am oberen Ende realer Einsätze liegen. Nachgemessen habe ich nur Tempo und Kosten von Jev, nicht die der Chatmodelle. Deren Kosten oben sind eine Rechnung mit derselben Textmenge.

Häufige Fragen

Du weißt nicht, welche Firmen gerade Bedarf haben?

Saubere Zahlen helfen nur, wenn die richtigen Firmen in der Liste stehen. Ich stelle dir eine Liste mit Unternehmen zusammen, bei denen gerade ein Anlass sichtbar ist, mit Ansprechpartner und Grund.

Drei Listen pro Woche, mehr schaffe ich nicht. Wenn dein Markt zu klein ist, sage ich das im ersten Gespräch.