Cloudflare가 AI 모델 Clef와 Clef-flash를 출시했다. 두 모델은 일반적으로 대규모 언어 모델이 수행하는 개방형 텍스트 생성 대신, 프로그래밍 방식으로 사용할 수 있는 분류, 구조화된 출력, 확률을 생성하도록 설계된 오픈 소스 의사결정 모델이다. 회사는 두 모델을 Workers AI 플랫폼에서 호스팅하며, Apache 2.0 라이선스에 따라 Hugging Face에도 공개했다.
이와 동시에 Cloudflare는 강화학습을 사용해 Clef를 조정하는 새로운 서비스를 공개했다. 이 서비스는 현장 배포 엔지니어 팀을 통해 시작되며, 이후 고객이 데이터를 수집하고 모델을 조정한 다음 Cloudflare 인프라에 다시 배포할 수 있는 셀프서비스 플랫폼으로 발전할 예정이다.
의사결정 모델은 무엇을 하는가?
의사결정 모델은 시스템이 워크플로 내에서 특정한 선택을 해야 하는 상황을 대상으로 한다. 예를 들어 지원 메시지가 긴급한지 판단하거나, 청구 팀 또는 기술 팀에 배정하거나, 영향의 심각도를 추정하는 경우다. 모델은 선택, 점수, 부울값과 같은 특정 유형에 맞춰 작성된 답변과 확률을 반환하며, 애플리케이션은 이를 사용해 요청을 안내하거나 상위 단계로 에스컬레이션하거나 사람 직원에게 전달할 수 있다.
Cloudflare는 위협 인텔리전스 팀에서 웹 도메인을 분류하기 위해 Clef를 테스트했다고 밝혔다. Browser Run을 사용해 사이트를 가져오고 표시한 뒤 분류한 실험에서 Clef는 2.2초가 걸렸으며, 같은 워크플로에서 회사의 가장 빠른 모델인 gpt-oss-120b는 4.7초가 걸렸다. Clef는 또한 여러 분류와 확률을 반환했다. 여기에는 해당 도메인이 패션 사이트일 가능성, 전자상거래 사이트일 가능성, 피싱 사이트일 가능성이 1% 미만이라는 내용이 포함됐다.
기술적 차이와 성능
Cloudflare에 따르면 Clef에는 이미지 처리를 위한 비전 인코더가 포함되어 있으며, 기사에 따르면 Jev는 텍스트 분류에 집중했다. 또한 Clef는 Jev의 32,000개에 비해 64,000토큰 길이의 컨텍스트 창을 제공한다. Clef와 Clef-flash는 의사결정 단계에서 비자기회귀 구조를 사용한다. 즉, 중간 텍스트를 토큰 단위로 하나씩 생성하는 대신 유효한 스키마 선택지를 병렬로 평가한다.
공개된 테스트 결과에서 Clef는 BFCL 벤치마크에서 98.47%, API-Bank에서 91.93%, BANKING77에서 94.20%의 정확도를 기록했다. 반면 Clef-flash는 이 벤치마크에서 각각 98.76%, 93.11%, 90.93%를 기록했다. 두 모델이 모든 테스트에서 앞선 것은 아니다. When2Call 벤치마크에서 Jev는 80.97%를 기록한 반면 Clef는 72.37%, Clef-flash는 65.58%를 기록했으며, BRIGHT 벤치마크에서도 Jev가 계속 앞섰다.
강화학습을 통한 맞춤화
Cloudflare는 Clef를 학습할 때 Qwen을 기본 모델로 사용하며, Clef에는 Qwen3.8-27B를, Clef-flash에는 Qwen3.5-9B를 사용한 뒤 의사결정 작업과 확률 보정을 위해 두 모델을 개선한다. 조정 서비스는 지원 요청 분류, 신뢰 및 안전 신고 평가, 봇 분류와 같은 사례를 대상으로 한다.
제안된 시스템은 요청 데이터를 수집하는 AI Gateway, 결과를 생성하는 Workers AI, 강화학습 환경을 위한 Cloudflare Containers, 모델 가중치를 업데이트하는 트레이너를 결합한 뒤 모델을 Workers AI에 다시 배포한다. 회사는 모델 맞춤화가 특정 분야의 정확도를 높일 수 있지만, 전체적인 성능을 희생할 수도 있다고 설명했다.
이번 출시가 중요한 이유
Cloudflare는 의사결정 모델을 입력과 에이전트 행동 사이의 특화된 계층으로 제시한다. 비교적 작은 모델이 구조화된 결정을 신속하게 반환하면, 이후 더 큰 언어 모델이 해당 결과에 따른 작업을 실행할 수 있다. 이러한 설계는 지원, 보안, 자동 라우팅 경로에서 응답 시간을 줄일 수 있지만, 특히 분류 확률이 자동화된 조치나 민감한 결정으로 이어지는 경우에는 각 사용 사례에 대한 보정과 신뢰성 테스트의 필요성을 없애지 않는다. 또한 제시된 결과는 Cloudflare가 선택한 평가에서 나온 것이며, 모든 모델이나 분야에서 Clef가 우월하다는 것을 입증하지는 않는다.