Intelligence artificielle

Cloudflare lance Clef-omni pour traiter les textes, les images, l’audio et la vidéo avec un seul modèle

Cloudflare a ajouté le modèle Clef-omni à sa famille de modèles de décision à poids ouverts, avec une prise en charge native des textes, des images, de l’audio et de la vidéo dans une seule requête API. L’entreprise a également réduit le prix de Clef-flash et augmenté la vitesse de Clef jusqu’à deux fois, en contrepartie d’une réduction de la fenêtre de contexte hébergée de Clef-flash, passée de 64 000 à 24 000 tokens.

2026-10-09
5 min de lecture
6 vues
certi.news Editorial Team
Cloudflare lance Clef-omni pour traiter les textes, les images, l’audio et la vidéo avec un seul modèle

Cloudflare a lancé le modèle Clef-omni, un modèle de décision à poids ouverts capable d’analyser des textes, des images, de l’audio et de la vidéo dans un seul pipeline de traitement. Cette annonce intervient après le lancement de Clef et de Clef-flash la semaine dernière et vise les cas d’usage qui nécessitent l’extraction de décisions contraintes par un schéma déterminé, plutôt que le recours à une chaîne de modèles distincts pour convertir l’audio en texte ou séparer les canaux visuels de la vidéo.

Un seul modèle pour les entrées multimodales

Clef-omni prend en charge les fichiers audio aux formats WAV et MP3, ainsi que les vidéos aux formats MP4 et WebM, en plus des textes et des images. Cloudflare présente l’exemple de l’inspection d’un appareil au moyen d’une image de l’unité produit, d’un enregistrement audio pendant son fonctionnement et d’une vidéo du ventilateur, puis de la formulation de questions structurées sur la présence du numéro de modèle, l’intégrité du son et le fonctionnement du ventilateur.

Le modèle est basé sur Qwen3-Omni-30B-A3B-Instruct avec une architecture d’experts multiples (MoE), en utilisant le composant de compréhension de base et en abandonnant les composants de conversion du texte en parole. Au lieu de générer des tokens de sortie comme les grands modèles de langage, Clef calcule directement les scores des options candidates dans un schéma défini, avec un mécanisme d’orientation de l’attention en deux étapes et des règles grammaticales intégrées pour préserver le sens des options.

Cloudflare affirme que les décisions textuelles sont renvoyées avec une latence médiane d’environ 130 millisecondes, que les entrées d’image le sont en environ 150 millisecondes, tandis que les extraits audio nécessitent quelques centaines de millisecondes. Une vidéo de 21 secondes avec audio est, quant à elle, évaluée en environ 1,5 seconde au moyen d’une seule requête API. L’entreprise a mis les poids de Clef-omni à disposition sur Hugging Face, ainsi que la documentation destinée aux développeurs.

Qu’est-ce qui change concrètement ?

Cette nouvelle conception réduit la nécessité de construire des pipelines de traitement séquentiels pour convertir la parole ou décomposer la vidéo avant de prendre une décision. Elle convient ainsi aux tâches d’inspection et de classification qui exigent des réponses structurées, comme le traitement des factures, le service client et la surveillance des incidents de sécurité, à condition que la qualité du modèle soit suffisante pour le domaine concerné.

Les résultats des tests ne sont toutefois pas supérieurs à ceux des autres modèles pour toutes les tâches. Clef-omni a obtenu 98,2 % au test BFCL pour les cas correspondants, 92,7 % à API-Bank et 94,8 % à BANKING77, mais il est arrivé derrière Clef et Clef-flash dans certains tests, comme Home Appliances, When2Call et PhishNChips. L’ajout de nouvelles modalités ne signifie donc pas une supériorité générale dans tous les scénarios.

Réduction du prix de Clef-flash et accélération de Clef

Cloudflare a réduit le prix de Clef-flash de 0,09 dollar à 0,038 dollar par million de tokens d’entrée, tandis que le prix de Clef est resté fixé à 0,24 dollar et que Clef-omni a été lancé au prix de 0,15 dollar par million de tokens d’entrée. En contrepartie, la fenêtre de contexte de la version hébergée de Clef-flash a été réduite de 64 000 à 24 000 tokens. L’entreprise affirme que seulement 0,24 % des requêtes dépassent la nouvelle limite, tandis que les poids disponibles sur Hugging Face sont entraînés pour prendre en charge une fenêtre pouvant atteindre 256 000 tokens en auto-hébergement.

Cloudflare a également amélioré la vitesse de Clef hébergé sur Workers AI. La latence médiane pour des entrées d’environ 800 tokens est passée de 262 à 152 millisecondes, et celle pour environ 3 400 tokens de 616 à 305 millisecondes, soit une accélération pouvant atteindre 2,0 fois. L’entreprise attribue une partie de cette amélioration à l’utilisation de SGLang, avec des contributions qui apparaîtront dans la version 0.5.22.

Pourquoi cette annonce est-elle importante ?

Cette annonce présente une orientation pratique pour les modèles de décision : traiter différentes entrées et extraire des options structurées plutôt que produire un long texte. Des équipes au sein de Cloudflare ont utilisé ces modèles pour détecter les messages indésirables sur GitHub, inspecter les extensions du système EmDash afin d’y rechercher des tentatives d’hameçonnage, surveiller les données personnelles de métadonnées et détecter les domaines malveillants. Ces exemples restent toutefois internes, tandis que les résultats de tests contrastés et les limites de la fenêtre de contexte de Clef-flash demeurent des facteurs à évaluer avant l’adoption du modèle dans des opérations sensibles.

Source de l’actualité
c
Auteur

certi.news Editorial Team

Dans la même catégorie

À lire également

Voir toutes les actualités