Cloudflareは、AIモデルのClefとClef-flashを発表した。両者は、通常の大規模言語モデルのように自由形式のテキストを生成するのではなく、分類、構造化された出力、プログラムで利用可能な確率を生成するよう設計されたオープンソースの意思決定モデルである。同社は両モデルをWorkers AIプラットフォームでホストし、Apache 2.0ライセンスの下でHugging Faceでも公開した。
これと同時に、Cloudflareは強化学習を用いてClefを微調整する新サービスを明らかにした。このサービスは、まずフィールド展開エンジニアのチームを通じて提供され、将来的には顧客がデータを収集し、モデルを調整し、その後Cloudflareのインフラ上に再デプロイできるセルフサービス型プラットフォームへ発展する予定だ。
意思決定モデルは何を行うのか?
意思決定モデルは、システムがワークフロー内で特定の選択を行う必要があるケースを対象とする。例えば、サポートメッセージが緊急かどうかの判定、請求チームまたは技術チームへの割り当て、影響の深刻度の推定などだ。モデルは、選択、スコア、真偽値など、特定の型に従って記述された回答を返し、アプリケーションはその確率を使ってリクエストの処理、エスカレーション、または人間の担当者への引き継ぎを行える。
Cloudflareによると、同社は脅威インテリジェンスチームでClefをウェブドメインの分類に利用してテストした。Browser Runを使ってウェブサイトを取得、表示、分類する実験では、同じワークフローにおいてClefの処理時間は2.2秒だったのに対し、同社が利用する最速のモデルであるgpt-oss-120bは4.7秒だった。Clefは確率を伴う複数の分類も返し、ドメインがファッションサイトまたはEコマースサイトである確率や、フィッシングサイトである確率が1%未満であることなどを示した。
技術面と性能の違い
Cloudflareによると、Clefは画像を処理するビジュアルエンコーダーを備えている。一方、記事によれば、Jevはテキスト分類に重点を置いていた。また、Clefは64,000トークンのコンテキストウィンドウを提供するのに対し、Jevは32,000トークンだ。ClefとClef-flashは意思決定段階で非回帰型のアーキテクチャを使用しており、中間テキストをトークンごとに生成するのではなく、正しいスキーマの選択肢を並列に評価する。
公表されたテスト結果では、ClefはBFCLベンチマークで98.47%、API-Bankで91.93%、BANKING77で94.20%の精度を記録した。一方、Clef-flashはこれらのベンチマークでそれぞれ98.76%、93.11%、90.93%を記録した。両モデルがすべてのテストで上回ったわけではない。When2Callベンチマークでは、Jevが80.97%だったのに対し、Clefは72.37%、Clef-flashは65.58%だった。また、BRIGHTベンチマークでもJevが優位を保った。
強化学習によるカスタマイズ
CloudflareはClefのトレーニングにQwenを基盤モデルとして使用し、ClefにはQwen3.8-27B、Clef-flashにはQwen3.5-9Bを用いた上で、意思決定タスクと確率のキャリブレーション向けに両モデルを改善している。微調整サービスは、サポートリクエストの振り分け、信頼と安全性に関する報告の評価、ボットの分類などを対象としている。
提案されているシステムは、リクエストデータを取得するAI Gateway、結果を生成するWorkers AI、強化学習環境を提供するCloudflare Containers、モデルの重みを更新するトレーナーを組み合わせ、その後Workers AI上に再デプロイする。同社は、モデルのカスタマイズによって特定分野での精度が向上する可能性がある一方、全般的な性能が犠牲になる場合もあると説明している。
なぜこの発表が重要なのか?
Cloudflareは、意思決定モデルを入力とエージェントの行動の間に位置する専門層として提示している。比較的小規模なモデルが構造化された意思決定を迅速に返し、その後、より大規模な言語モデルがその結果に基づくアクションを実行できるという設計だ。この設計は、サポート、セキュリティ、自動ルーティングの経路における応答時間を短縮する可能性がある。ただし、特に分類確率が自動処理や慎重な意思決定につながる場合には、各ユースケースでキャリブレーションと信頼性を検証する必要性がなくなるわけではない。また、提示された結果はCloudflareが選択した評価から得られたものであり、Clefがすべてのモデルや分野で優れていることを証明するものではない。