Das Unternehmen TypeSafe AI hat das Jev-Modell vorgestellt, ein auf der Transformer-Architektur basierendes KI-Modell, das jedoch weder zur Kategorie der Large Language Models gehört noch Texte für Nutzer erzeugt. Stattdessen gibt das Modell Wahrscheinlichkeiten für das aus, was das Unternehmen als „kalibrierte Entscheidungen“ bezeichnet, nachdem der Entwickler die erforderlichen Ausgabetypen im Voraus festgelegt hat.
Das Unternehmen wird von Diogo Almeida geleitet, einem ehemaligen Forscher bei OpenAI, der am Aufbau von ChatGPT beteiligt war und zur Entwicklung der Technik des Reinforcement Learning from Human Feedback (RLHF) beigetragen hat. Almeida zufolge haben sich KI-Modelle in hohem Maße darauf konzentriert, den Umgang mit menschlicher Sprache zu verbessern, während Softwareautomatisierung stärker disziplinierte Ausgaben benötigt, die direkt vom Computer verwendet werden können.
Höhere Geschwindigkeit und geringere Kosten
TypeSafe AI zufolge macht der Verzicht auf die Generierung von Sprache Jev schnell und kostengünstig. Außerdem verringert er die Wahrscheinlichkeit von Halluzinationen, da der Nutzer die möglichen Ergebnisse im Voraus festlegt. Das Unternehmen erhebt keine Gebühren für Ausgabetokens, während Eingabetokens laut der Quelle pro Milliarde statt pro Million abgerechnet werden.
Das Modell stieß bei Entwicklern rasch auf Interesse, sodass seine API aufgrund der hohen Nachfrage vorübergehend keine Nutzer mehr bedienen konnte. In einem von Vercel durchgeführten Test zur Klassifizierung von Befehlen für eine Sicherheitsüberprüfung führte der Ersatz eines OpenAI-Modells durch Jev laut dem Softwareingenieur Pranit Sharma zu Ergebnissen, die zwischen fünf- und 18-mal schneller waren und zugleich eine höhere Genauigkeit aufwiesen.
In einem weiteren Test zur Klassifizierung geschäftlicher E-Mails stellte Nikhil Mudholkar, der technische Leiter von Bryo AI, fest, dass Gemini geringfügig genauer, aber 10- bis 20-mal teurer war. Mudholkar bewertete die von Jev ausgegebenen Konfidenzwerte als wichtiger für die Automatisierung, da sie eine Wahrscheinlichkeit liefern, anhand derer entschieden werden kann, ob eine bestimmte Aktion ausgeführt oder ignoriert werden sollte.
Was ändert sich in der Praxis?
Diese Anwendungsfälle zeigen, dass Jev nicht unbedingt darauf abzielt, Sprachmodelle bei allen Aufgaben zu ersetzen. Es kann Aufgaben wie Klassifizierung, die Weiterleitung von Anfragen an das passende Modell, die Überwachung der Auswirkungen von KI-Agenten oder die Erkennung von Versuchen zur Umgehung von Einschränkungen übernehmen. In diesen Szenarien können die hohe Geschwindigkeit und die niedrigen Kosten eine Echtzeitüberwachung praktikabler machen.
Die Verwendung von Wahrscheinlichkeiten beseitigt jedoch nicht den Bedarf an menschlichem Urteilsvermögen oder Betriebsregeln. Armin Ronacher, der technische Leiter von Earendil, wies darauf hin, dass Nutzer festlegen müssen, wie mit einem Wert wie 50 % oder 95 % umzugehen ist, also klare Schwellenwerte definieren müssen, bevor die Ausgaben in automatisierte Aktionen umgewandelt werden. Damit wird ein Teil der Verantwortung für den Umgang mit Unsicherheit vom Modell auf das Anwendungsdesign verlagert.
Nicht offengelegte Architektur und erwartete Konkurrenz
TypeSafe AI hat keine Details zur Architektur von Jev veröffentlicht. Externe Beobachter vermuten, dass es auf einem Open-Weight-Sprachmodell basieren könnte, was das Unternehmen in dem Artikel jedoch nicht bestätigt hat. TypeSafe AI beschreibt das Modell als „System-One-Modell“, das sich auf Intuition und die Auswahl der passenden Aufgabe konzentriert, und erklärt, es sei ausschließlich anhand synthetischer Daten mit einer Technik trainiert worden, die das Unternehmen als „Reinforcement Learning from Calibrated Decisions“ bezeichnet.
Der Analyse von certi.news zufolge liegt die Bedeutung von Jev nicht nur darin, dass es sich um ein neues Modell handelt, sondern auch darin, dass es KI als spezialisierte Entscheidungsschicht innerhalb von Software positioniert, statt als allgemeine Chat-Schnittstelle. Sollten die genannten Testergebnisse zutreffen, könnte dieser Ansatz für wiederkehrende Aufgaben mit festgelegten Ausgaben geeignet sein. Die veröffentlichten Vergleiche sind jedoch begrenzt und reichen allein nicht aus, um die Leistung über verschiedene Bereiche oder Arbeitslasten hinweg zu beurteilen. Zudem wirft die unklare Architektur und die Art der Datenerzeugung offene Fragen zur Überprüfbarkeit und Skalierbarkeit auf.
TypeSafe AI plant, weitere Versionen des Modells in unterschiedlichen Varianten zu entwickeln. Ronacher erwartet, dass Wettbewerber auftreten werden, sobald der praktische Nutzen dieser Art von Modellen deutlicher wird.