Cloudflare推出了Clef和Clef-flash两款人工智能模型。这两款模型是开源决策模型,旨在生成分类结果、结构化输出以及可供程序使用的概率,而不是像大型语言模型通常那样生成开放式文本。该公司将这两款模型托管在Workers AI平台上,并根据Apache 2.0许可证在Hugging Face上开放提供。
与此同时,Cloudflare公布了一项使用强化学习对Clef进行微调的新服务。该服务最初将通过一支由现场部署工程师组成的团队提供,之后将发展为自助式平台,使客户能够收集数据、调整模型,然后在Cloudflare基础设施上重新部署模型。
决策模型能做什么?
决策模型面向这样的场景:系统需要在工作流中作出明确选择,例如确定一条支持消息是否紧急,将其分配给计费团队或技术团队,或者评估其影响严重程度。模型会按照预定义的类型返回答案,例如选项、分数或布尔值,同时提供概率,应用程序可以利用这些概率来引导请求、升级请求,或将其转交给人工员工。
Cloudflare表示,它曾在威胁情报团队中测试Clef,用于对网络域名进行分类。在一项使用Browser Run抓取、呈现并分类网站的测试中,Clef耗时2.2秒,而Cloudflare在同一工作流中速度最快的gpt-oss-120b模型耗时4.7秒。Clef还返回了带有概率的多项分类结果,包括该域名可能是时尚网站或电子商务网站的概率,以及其为钓鱼网站的概率低于1%。
技术差异与性能
Cloudflare表示,Clef包含用于处理图像的视觉编码器,而据该材料介绍,Jev侧重于文本分类。该模型还提供长度为64,000个令牌的上下文窗口,而Jev为32,000个令牌。Clef和Clef-flash在决策阶段采用非自回归架构,即并行评估正确的模式选项,而不是逐个令牌生成中间文本。
在公布的测试结果中,Clef在BFCL基准测试中的准确率为98.47%,在API-Bank中为91.93%,在BANKING77中为94.20%;Clef-flash在这些基准测试中的准确率分别为98.76%、93.11%和90.93%。两款模型并未在所有测试中胜出:在When2Call基准测试中,Jev达到80.97%,高于Clef的72.37%和Clef-flash的65.58%;此外,Jev在BRIGHT基准测试中仍然领先。
通过强化学习进行定制
Cloudflare在训练Clef时采用Qwen作为基础模型,使用Qwen3.8-27B构建Clef,使用Qwen3.5-9B构建Clef-flash,然后针对决策任务和概率校准对两者进行优化。该微调服务面向支持请求分流、信任与安全举报评估以及机器人分类等场景。
拟议的系统将AI Gateway用于捕获请求数据,将Workers AI用于生成结果,将Cloudflare Containers用于强化学习环境,并通过训练器更新模型权重,随后在Workers AI上重新部署模型。该公司说明,定制模型可能提升其在特定领域的准确率,但也可能以整体性能为代价。
为什么这一发布值得关注?
Cloudflare将决策模型定位为输入与代理行为之间的专业化层:一个相对较小的模型快速返回结构化决策,随后由更大的语言模型执行所生成的操作。这种设计可能缩短支持、安全和自动路由流程中的响应时间,但并不能免除针对每种使用场景测试校准性和可靠性的必要,尤其是在分类概率会触发自动化操作或敏感决策时。此外,所展示的结果来自Cloudflare选定的评估,并不能证明Clef在所有模型或领域中都具备优势。