Cloudflare a lancé les modèles d’intelligence artificielle Clef et Clef-flash, deux modèles de décision open source conçus pour produire des classifications, des sorties structurées et des probabilités exploitables par des logiciels, plutôt que de générer du texte ouvert comme le font habituellement les grands modèles de langage. L’entreprise héberge les deux modèles sur la plateforme Workers AI et les a également proposés sur Hugging Face sous licence Apache 2.0.
Parallèlement, Cloudflare a dévoilé un nouveau service de réglage de Clef au moyen de l’apprentissage par renforcement. Le service commence avec une équipe d’ingénieurs de déploiement sur le terrain, avant d’évoluer vers une plateforme en libre-service permettant aux clients de collecter des données, de régler le modèle, puis de le redéployer sur l’infrastructure de Cloudflare.
Que font les modèles de décision ?
Les modèles de décision ciblent les situations dans lesquelles le système doit effectuer un choix précis au sein d’un workflow, par exemple déterminer si un message d’assistance est urgent, l’attribuer à l’équipe de facturation ou à l’équipe technique, ou estimer la gravité de son impact. Les modèles renvoient des réponses rédigées selon des types définis, tels qu’un choix, un score ou une valeur booléenne, accompagnées de probabilités que l’application peut utiliser pour orienter ou faire remonter la demande, ou la transmettre à un employé humain.
Cloudflare affirme avoir testé Clef auprès de son équipe de renseignement sur les menaces afin de classer des domaines web. Lors d’une expérience comprenant la récupération, l’affichage et la classification du site à l’aide de Browser Run, Clef a pris 2,2 secondes, contre 4,7 secondes pour gpt-oss-120b, le modèle le plus rapide de l’entreprise dans ce même workflow. Clef a également renvoyé plusieurs classifications accompagnées de probabilités, notamment la probabilité que le domaine soit un site de mode ou de commerce électronique, ainsi qu’une probabilité inférieure à 1 % qu’il s’agisse d’un site d’hameçonnage.
Différences techniques et performances
Cloudflare indique que Clef intègre un encodeur visuel pour traiter les images, tandis que Jev, selon l’article, se concentrait sur la classification de textes. Le modèle offre également une fenêtre de contexte de 64 000 tokens, contre 32 000 pour Jev. Clef et Clef-flash utilisent une architecture non autorégressive lors de la phase de décision : les options valides du schéma sont évaluées en parallèle au lieu de générer un texte intermédiaire token par token.
Dans les résultats de tests publiés, Clef a obtenu une précision de 98,47 % sur le benchmark BFCL, de 91,93 % sur API-Bank et de 94,20 % sur BANKING77, tandis que Clef-flash a obtenu respectivement 98,76 %, 93,11 % et 90,93 % sur ces benchmarks. Les deux modèles n’ont pas été supérieurs dans tous les tests : sur le benchmark When2Call, Jev a obtenu 80,97 %, contre 72,37 % pour Clef et 65,58 % pour Clef-flash, et Jev est également resté en tête sur le benchmark BRIGHT.
Personnalisation par apprentissage par renforcement
Pour entraîner Clef, Cloudflare s’appuie sur Qwen comme modèle de base, en utilisant Qwen3.8-27B pour Clef et Qwen3.5-9B pour Clef-flash, puis en les optimisant pour les tâches de décision et l’étalonnage des probabilités. Le service de réglage cible des cas tels que le tri des demandes d’assistance, l’évaluation des signalements liés à la confiance et à la sécurité, ainsi que la classification des robots.
Le système proposé associe AI Gateway pour capturer les données des requêtes, Workers AI pour générer les résultats, Cloudflare Containers pour les environnements d’apprentissage par renforcement, ainsi qu’un entraîneur chargé de mettre à jour les poids du modèle, avant son redéploiement sur Workers AI. L’entreprise précise que la personnalisation du modèle peut améliorer la précision dans un domaine donné, mais qu’elle peut se faire au détriment des performances générales.
Pourquoi ce lancement est-il important ?
Cloudflare présente les modèles de décision comme une couche spécialisée entre les entrées et le comportement des agents : un modèle relativement petit renvoie rapidement une décision structurée, puis un modèle de langage plus grand peut exécuter l’action produite. Cette conception pourrait réduire le temps de réponse dans les parcours d’assistance, de sécurité et de routage automatisé, mais elle ne supprime pas la nécessité de tester l’étalonnage et la fiabilité pour chaque cas d’utilisation, en particulier lorsque les probabilités de classification entraînent des actions automatisées ou des décisions sensibles. En outre, les résultats présentés proviennent d’évaluations choisies par Cloudflare et ne démontrent pas la supériorité de Clef sur l’ensemble des modèles ou des domaines.