Cloudflare hat die KI-Modelle Clef und Clef-flash auf den Markt gebracht. Dabei handelt es sich um quelloffene Entscheidungsmodelle, die darauf ausgelegt sind, Klassifizierungen, strukturierte Ausgaben und Wahrscheinlichkeiten zu erzeugen, die programmatisch genutzt werden können, anstatt wie große Sprachmodelle üblicherweise offene Texte zu generieren. Das Unternehmen hostet beide Modelle auf der Plattform Workers AI und stellt sie außerdem auf Hugging Face unter der Apache-2.0-Lizenz bereit.
Gleichzeitig stellte Cloudflare einen neuen Dienst zur Feinabstimmung von Clef mithilfe von bestärkendem Lernen vor. Der Dienst startet mit einem Team aus Field-Deployment-Ingenieuren und soll sich später zu einer Self-Service-Plattform entwickeln, über die Kunden Daten sammeln, das Modell feinabstimmen und es anschließend auf der Infrastruktur von Cloudflare erneut bereitstellen können.
Was leisten Entscheidungsmodelle?
Entscheidungsmodelle zielen auf Fälle ab, in denen ein System innerhalb eines Workflows eine bestimmte Auswahl treffen muss, etwa um festzustellen, ob eine Supportnachricht dringend ist, sie dem Abrechnungsteam oder dem technischen Team zuzuweisen oder die Schwere ihrer Auswirkungen einzuschätzen. Die Modelle liefern Antworten, die nach bestimmten Typen strukturiert sind, etwa als Auswahl, Punktzahl oder boolescher Wert, zusammen mit Wahrscheinlichkeiten, die die Anwendung nutzen kann, um die Anfrage zu steuern, zu eskalieren oder an einen menschlichen Mitarbeiter weiterzuleiten.
Cloudflare zufolge wurde Clef beim Threat-Intelligence-Team zur Klassifizierung von Webdomains getestet. In einem Versuch, der das Abrufen, Anzeigen und Klassifizieren einer Website mit Browser Run umfasste, benötigte Clef 2,2 Sekunden, verglichen mit 4,7 Sekunden für das schnellste gpt-oss-120b-Modell des Unternehmens im selben Workflow. Clef gab außerdem mehrere Klassifizierungen mit Wahrscheinlichkeiten zurück, darunter die Wahrscheinlichkeit, dass es sich bei der Domain um eine Mode- oder E-Commerce-Website handelt, sowie eine Wahrscheinlichkeit von weniger als 1 %, dass es sich um eine Phishing-Website handelt.
Technische Unterschiede und Leistung
Cloudflare zufolge verfügt Clef über einen visuellen Encoder zur Verarbeitung von Bildern, während Jev laut dem Artikel auf die Klassifizierung von Texten ausgerichtet war. Das Modell bietet außerdem ein Kontextfenster mit einer Länge von 64.000 Tokens, gegenüber 32.000 bei Jev. Clef und Clef-flash verwenden in der Entscheidungsphase eine nicht-autoregressive Architektur: Die richtigen Optionen des Schemas werden parallel bewertet, anstatt einen Zwischentext Token für Token zu erzeugen.
In den veröffentlichten Testergebnissen erzielte Clef im BFCL-Benchmark eine Genauigkeit von 98,47 %, bei API-Bank 91,93 % und bei BANKING77 94,20 %, während Clef-flash in diesen Benchmarks jeweils 98,76 %, 93,11 % und 90,93 % erreichte. Die beiden Modelle waren nicht in allen Tests überlegen: Im When2Call-Benchmark erzielte Jev 80,97 %, gegenüber 72,37 % für Clef und 65,58 % für Clef-flash. Außerdem blieb Jev im BRIGHT-Benchmark führend.
Anpassung durch bestärkendes Lernen
Cloudflare verwendet beim Training von Clef Qwen als Basismodell, wobei Qwen3.8-27B für Clef und Qwen3.5-9B für Clef-flash eingesetzt werden. Anschließend werden beide Modelle für Entscheidungsaufgaben und die Kalibrierung von Wahrscheinlichkeiten optimiert. Der Feinabstimmungsdienst zielt auf Anwendungsfälle wie die Sortierung von Supportanfragen, die Bewertung von Meldungen zu Vertrauen und Sicherheit sowie die Klassifizierung von Bots.
Das vorgeschlagene System kombiniert AI Gateway zur Erfassung von Anfragedaten, Workers AI zur Generierung der Ergebnisse, Cloudflare Containers für Umgebungen des bestärkenden Lernens und einen Trainer zur Aktualisierung der Modellgewichte. Anschließend wird das Modell erneut auf Workers AI bereitgestellt. Das Unternehmen weist darauf hin, dass die Anpassung des Modells die Genauigkeit in einem bestimmten Bereich erhöhen kann, dies jedoch zulasten der allgemeinen Leistung gehen kann.
Warum ist diese Einführung wichtig?
Cloudflare positioniert Entscheidungsmodelle als spezialisierte Schicht zwischen Eingaben und dem Verhalten von Agenten: Ein vergleichsweise kleines Modell gibt schnell eine strukturierte Entscheidung zurück, woraufhin ein größeres Sprachmodell die daraus resultierende Aktion ausführen kann. Dieses Design könnte die Antwortzeit in Support-, Sicherheits- und automatisierten Weiterleitungsprozessen verkürzen. Es beseitigt jedoch nicht die Notwendigkeit, Kalibrierung und Zuverlässigkeit für jeden Anwendungsfall zu testen, insbesondere wenn Klassifizierungswahrscheinlichkeiten zu automatisierten Aktionen oder sensiblen Entscheidungen führen. Außerdem stammen die präsentierten Ergebnisse aus von Cloudflare ausgewählten Bewertungen und belegen keine Überlegenheit von Clef gegenüber allen Modellen oder in allen Bereichen.