人工智能

Cloudflare推出Clef-omni,通过单一模型处理文本、图像、音频和视频

Cloudflare将Clef-omni模型加入开放权重决策模型系列,原生支持在单个API请求中处理文本、图像、音频和视频。同时,该公司下调了Clef-flash的价格,并将Clef的速度提升至最多两倍,但将托管版Clef-flash的上下文窗口从6.4万缩减至2.4万令牌。

2026-10-09
1 分钟阅读
6 浏览量
certi.news Editorial Team
Cloudflare推出Clef-omni,通过单一模型处理文本、图像、音频和视频

Cloudflare推出了Clef-omni,这是一款开放权重决策模型,能够在单一处理流程中分析文本、图像、音频和视频。此次发布是在上周推出Clef和Clef-flash之后进行的,目标是满足需要提取受特定模式约束的决策的使用场景,而不是依赖一系列独立模型将音频转换为文本,或将视频中的视觉通道分离出来。

用于多模态输入的单一模型

Clef-omni支持WAV和MP3格式的音频文件、MP4和WebM格式的视频,以及文本和图像。Cloudflare展示了一个设备检查示例:通过产品单元的图像、设备运行时的音频记录以及风扇的视频,然后围绕型号是否出现、声音是否正常以及风扇是否运转等问题提出结构化问题。

该模型基于采用混合专家(MoE)技术的Qwen3-Omni-30B-A3B-Instruct构建,使用其核心理解组件,并放弃文本转语音组件。Clef不像大语言模型那样生成输出令牌,而是在特定模式中直接计算候选选项的分数,同时采用两阶段注意力引导机制和内置语法规则,以保持选项的含义。

Cloudflare表示,文本决策的中位延迟约为130毫秒,图像输入约为150毫秒,而音频片段需要几百毫秒。对于一段包含音频、时长为21秒的视频,通过单个API请求评估约需1.5秒。该公司已在Hugging Face上提供Clef-omni的权重,并同时发布了开发者文档。

实际会发生什么变化?

新设计减少了在做出决策前构建语音转换或视频拆解串行处理流程的需求。这适合需要结构化回答的检查和分类任务,例如发票处理、客户服务和安全事件监控,但前提是模型质量足以满足特定领域的要求。

不过,测试结果并非在所有任务中都优于其他模型。Clef-omni在BFCL匹配案例测试中的得分为98.2%,在API-Bank中的得分为92.7%,在BANKING77中的得分为94.8%;但在家用设备、When2Call和PhishNChips等部分测试中,其表现低于Clef和Clef-flash。因此,新增多模态能力并不意味着它在每种场景中都具有普遍优势。

下调Clef-flash价格并加速Clef

Cloudflare将Clef-flash的价格从每百万输入令牌0.09美元下调至0.038美元,而Clef的价格维持在0.24美元;Clef-omni则以每百万输入令牌0.15美元的价格发布。与此同时,托管版Clef-flash的上下文窗口从6.4万令牌缩减至2.4万令牌。该公司表示,只有0.24%的请求会超过新的上限,而Hugging Face上的权重仍经过训练,可在自行托管时支持最高达25.6万令牌的窗口。

Cloudflare还提升了Workers AI上托管版Clef的速度。对于约800个令牌的输入,中位延迟从262毫秒降至152毫秒;对于约3400个令牌的输入,则从616毫秒降至305毫秒,速度最高提升至2.0倍。该公司将部分改进归因于采用SGLang,相关贡献将出现在0.5.22版本中。

为什么这一公告很重要?

这项公告展示了决策模型的一种实用方向:处理不同类型的输入并提取结构化选项,而不是生成冗长文本。Cloudflare内部团队已使用这些模型来发现GitHub中的垃圾消息、检查EmDash系统扩展中的网络钓鱼、监测个人元数据以及发现恶意域名。不过,这些示例均来自内部使用;此外,测试结果的差异以及Clef-flash的上下文窗口限制,仍是将模型用于敏感流程前需要评估的因素。

新闻来源
Cloudflare Blog
查看原始来源 ↗
c
作者

certi.news Editorial Team

同一分类

你可能还喜欢

查看所有新闻