Künstliche Intelligenz

Cloudflare startet Clef-omni zur Verarbeitung von Texten, Bildern, Audio und Video über ein einziges Modell

Cloudflare hat das Modell Clef-omni in die Familie der Open-Weight-Entscheidungsmodelle aufgenommen. Es bietet native Unterstützung für Texte, Bilder, Audio und Video innerhalb einer einzigen API-Anfrage. Außerdem senkte das Unternehmen den Preis von Clef-flash und erhöhte die Geschwindigkeit von Clef um bis zu das Doppelte, während das gehostete Kontextfenster von Clef-flash von 64.000 auf 24.000 Token verkleinert wurde.

2026-10-09
4 Min. Lesezeit
6 Aufrufe
certi.news Editorial Team
Cloudflare startet Clef-omni zur Verarbeitung von Texten, Bildern, Audio und Video über ein einziges Modell

Cloudflare hat das Modell Clef-omni vorgestellt. Dabei handelt es sich um ein Open-Weight-Entscheidungsmodell, das Texte, Bilder, Audio und Video in einer einzigen Verarbeitungspipeline analysieren kann. Die Ankündigung folgt auf die Einführung von Clef und Clef-flash in der vergangenen Woche und richtet sich an Anwendungsfälle, die die Extraktion von Entscheidungen nach einem festgelegten Schema erfordern, anstatt auf eine Kette separater Modelle zur Umwandlung von Audio in Text oder zur Trennung visueller Kanäle vom Video zurückzugreifen.

Ein Modell für multimodale Eingaben

Clef-omni unterstützt Audiodateien in den Formaten WAV und MP3 sowie Videos in den Formaten MP4 und WebM, zusätzlich zu Texten und Bildern. Cloudflare zeigt als Beispiel die Prüfung eines Geräts anhand eines Bildes der Produkteinheit, einer Audioaufnahme während ihres Betriebs und eines Videos des Lüfters. Anschließend werden strukturierte Fragen dazu gestellt, ob die Modellnummer sichtbar ist, ob der Ton unversehrt ist und ob der Lüfter funktioniert.

Das Modell basiert auf Qwen3-Omni-30B-A3B-Instruct mit Mixture-of-Experts-Technik (MoE). Dabei wird die grundlegende Verständnis-Komponente verwendet, während Komponenten zur Text-zu-Sprache-Umwandlung entfallen. Statt Ausgabetoken wie Large Language Models zu erzeugen, berechnet Clef die Bewertungen der in einem festgelegten Schema vorgeschlagenen Optionen direkt. Zum Einsatz kommen dabei ein zweistufiger Attention-Mechanismus sowie integrierte Grammatikregeln, um die Bedeutung der Optionen zu bewahren.

Cloudflare zufolge werden Textentscheidungen mit einer mittleren Latenz von etwa 130 Millisekunden zurückgegeben, Bildeingaben in etwa 150 Millisekunden verarbeitet, während Audioausschnitte einige hundert Millisekunden benötigen. Ein 21 Sekunden langes Video mit Audio wird über eine einzige API-Anfrage in etwa 1,5 Sekunden bewertet. Das Unternehmen hat die Gewichte von Clef-omni auf Hugging Face sowie eine Entwicklerdokumentation bereitgestellt.

Was ändert sich in der Praxis?

Das neue Design verringert den Bedarf, sequentielle Verarbeitungspipelines zur Umwandlung von Sprache oder zur Zerlegung von Videos vor der Entscheidungsfindung aufzubauen. Dies eignet sich für Prüf- und Klassifizierungsaufgaben, die strukturierte Antworten erfordern, etwa die Rechnungsverarbeitung, den Kundenservice und die Erkennung von Sicherheitsvorfällen, vorausgesetzt, die Modellqualität reicht für den jeweiligen Bereich aus.

Die Testergebnisse sind jedoch nicht bei allen Aufgaben besser als die anderer Modelle. Clef-omni erreichte im BFCL-Test für übereinstimmende Fälle 98,2 %, in API-Bank 92,7 % und in BANKING77 94,8 %. In einigen Tests, etwa zu Haushaltsgeräten, When2Call und PhishNChips, lag das Modell jedoch hinter Clef und Clef-flash. Die Hinzufügung neuer Modalitäten bedeutet daher keinen allgemeinen Vorsprung in jedem Szenario.

Preissenkung für Clef-flash und Beschleunigung von Clef

Cloudflare senkte den Preis von Clef-flash von 0,09 US-Dollar auf 0,038 US-Dollar pro einer Million Eingabetoken. Der Preis von Clef blieb bei 0,24 US-Dollar, während Clef-omni zu einem Preis von 0,15 US-Dollar pro einer Million Eingabetoken eingeführt wurde. Gleichzeitig wurde das Kontextfenster der gehosteten Version von Clef-flash von 64.000 auf 24.000 Token verkleinert. Das Unternehmen zufolge überschreiten nur 0,24 % der Anfragen die neue Grenze. Die auf Hugging Face verfügbaren Gewichte wurden hingegen weiterhin für ein Kontextfenster von bis zu 256.000 Token beim Self-Hosting trainiert.

Cloudflare verbesserte außerdem die Geschwindigkeit von Clef, das auf Workers AI gehostet wird. Die mittlere Latenz sank bei Eingaben mit etwa 800 Token von 262 auf 152 Millisekunden und bei etwa 3.400 Token von 616 auf 305 Millisekunden, was einer Beschleunigung um bis zu das 2,0-Fache entspricht. Das Unternehmen führt einen Teil der Verbesserung auf den Einsatz von SGLang zurück; weitere Beiträge sollen in Version 0.5.22 erscheinen.

Warum ist diese Ankündigung wichtig?

Die Ankündigung zeigt eine praktische Entwicklung bei Entscheidungsmodellen: die Verarbeitung unterschiedlicher Eingaben und die Extraktion strukturierter Optionen statt der Erzeugung eines langen Textes. Teams innerhalb von Cloudflare haben diese Modelle eingesetzt, um Spam in GitHub zu erkennen, Erweiterungen des EmDash-Systems auf Phishing zu prüfen, personenbezogene Metadaten zu überwachen und bösartige Domains zu erkennen. Diese Beispiele stammen jedoch aus dem Unternehmen selbst. Außerdem bleiben die unterschiedlichen Testergebnisse und die Beschränkungen des Kontextfensters von Clef-flash Faktoren, die vor dem Einsatz des Modells in sensiblen Prozessen bewertet werden sollten.

Nachrichtenquelle
Cloudflare Blog
Originalquelle öffnen ↗
c
Autor

certi.news Editorial Team

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen