Cloudflareは、単一の処理パスでテキスト、画像、音声、動画を分析できるオープンウェイトの意思決定モデル、Clef-omniを発表した。今回の発表は、先週のClefおよびClef-flashの発表に続くもので、音声をテキストに変換したり、動画から視覚チャネルを分離したりするために複数のモデルを別々に連携させるのではなく、特定のスキーマに制約された意思決定の抽出を必要とするユースケースを対象としている。
マルチモーダル入力に対応する単一モデル
Clef-omniは、WAVおよびMP3形式の音声ファイル、MP4およびWebM形式の動画に加え、テキストと画像をサポートする。Cloudflareは、製品ユニットの画像、稼働中の音声録音、ファンの動画を使って装置を検査し、モデル番号が表示されているか、音声に問題がないか、ファンが動作しているかについて構造化された質問を行う例を紹介している。
このモデルは、Mixture of Experts(MoE)技術を採用したQwen3-Omni-30B-A3B-Instructを基盤として構築されており、基本的な理解コンポーネントを使用し、テキスト読み上げコンポーネントは省いている。大規模言語モデルのように出力トークンを生成するのではなく、Clefは特定のスキーマ内で候補となる選択肢のスコアを直接計算する。2段階のアテンション誘導機構と組み込みの文法規則により、選択肢の意味を維持する。
Cloudflareによると、テキストの意思決定は約130ミリ秒の中央値で返され、画像入力は約150ミリ秒、音声入力には数百ミリ秒を要する。音声付き21秒の動画は、単一のAPIリクエストを通じて約1.5秒で評価される。同社はClef-omniのウェイトをHugging Faceで公開するとともに、開発者向けドキュメントも提供している。
実際に何が変わるのか
新しい設計により、意思決定の前に音声を変換したり動画を分解したりするための逐次処理パイプラインを構築する必要性が減る。これは、請求書処理、カスタマーサービス、セキュリティインシデントの監視など、構造化された回答を必要とする検査および分類タスクに適している。ただし、特定の分野に対してモデルの品質が十分であることが条件となる。
ただし、テスト結果がすべてのタスクで他のモデルを上回っているわけではない。Clef-omniは、BFCLの一致ケーステストで98.2%、API-Bankで92.7%、BANKING77で94.8%を記録したが、家庭用機器、When2Call、PhishNChipsなど一部のテストではClefおよびClef-flashを下回った。したがって、マルチモーダル機能の追加があらゆるシナリオで全般的な優位性を意味するわけではない。
Clef-flashの価格引き下げとClefの高速化
Cloudflareは、Clef-flashの価格を入力100万トークンあたり0.09ドルから0.038ドルに引き下げた。一方、Clefの価格は0.24ドルに据え置かれ、Clef-omniは入力100万トークンあたり0.15ドルで提供開始された。これに対して、Clef-flashのホスト版のコンテキストウィンドウは6万4000トークンから2万4000トークンに縮小された。同社によると、新しい上限を超えるリクエストはわずか0.24%であり、Hugging Faceのウェイトはセルフホスティング時に最大25万6000トークンのウィンドウをサポートするよう引き続き訓練されている。
Cloudflareは、Workers AI上でホストされるClefの速度も改善した。約800トークンの入力では中央値のレイテンシーが262ミリ秒から152ミリ秒に、約3400トークンでは616ミリ秒から305ミリ秒に短縮され、最大2.0倍の高速化となった。同社は、この改善の一部をSGLangの使用によるものと説明しており、バージョン0.5.22ではさらなる貢献が反映される予定だとしている。
なぜこの発表が重要なのか
今回の発表は、意思決定モデルにおける実用的な方向性を示している。異なる入力を処理し、長いテキストを生成するのではなく、構造化された選択肢を抽出するという方向性だ。Cloudflare内のチームは、GitHub上のスパムメッセージの検出、EmDashシステムの拡張機能におけるフィッシングの検査、個人メタデータの監視、悪意のあるドメインの検出にこれらのモデルを使用している。ただし、これらは社内での例であり、テスト結果のばらつきやClef-flashにおけるコンテキストウィンドウの制約は、モデルを重要な業務に導入する前に評価すべき要因として残っている。