인공지능

Cloudflare, 하나의 모델로 텍스트·이미지·오디오·비디오를 처리하는 Clef-omni 출시

Cloudflare가 개방형 가중치 의사결정 모델 제품군에 Clef-omni를 추가하고, 단일 API 요청에서 텍스트·이미지·오디오·비디오를 기본적으로 지원한다. 또한 Clef-flash의 가격을 인하하고 Clef의 속도를 최대 2배 높였지만, Clef-flash 호스팅 버전의 컨텍스트 윈도우는 64,000토큰에서 24,000토큰으로 축소했다.

2026-10-09
3 분 읽기
6 조회수
certi.news Editorial Team
Cloudflare, 하나의 모델로 텍스트·이미지·오디오·비디오를 처리하는 Clef-omni 출시

Cloudflare가 하나의 처리 경로에서 텍스트·이미지·오디오·비디오를 분석할 수 있는 개방형 가중치 의사결정 모델인 Clef-omni를 출시했다. 이번 발표는 지난주 Clef와 Clef-flash를 출시한 데 이은 것으로, 음성을 텍스트로 변환하거나 비디오에서 시각 채널을 분리하기 위해 여러 모델을 연속으로 사용하는 대신, 특정 스키마에 제한된 의사결정 추출이 필요한 사용 사례를 겨냥한다.

멀티모달 입력을 위한 하나의 모델

Clef-omni는 WAV 및 MP3 형식의 오디오 파일과 MP4 및 WebM 형식의 비디오를 텍스트와 이미지와 함께 지원한다. Cloudflare는 제품 장치의 이미지, 장치 작동 중 녹음된 오디오, 팬을 촬영한 비디오를 사용해 장치를 검사한 뒤, 모델 번호가 보이는지, 오디오가 정상인지, 팬이 작동하는지에 관해 구조화된 질문을 제시하는 예시를 보여준다.

이 모델은 Mixture of Experts(MoE) 기술을 적용한 Qwen3-Omni-30B-A3B-Instruct를 기반으로 구축됐으며, 기본 이해 구성 요소를 사용하고 텍스트 음성 변환 구성 요소는 제외했다. 대규모 언어 모델처럼 출력 토큰을 생성하는 대신, Clef는 특정 스키마 안에서 후보 옵션의 점수를 직접 계산하며, 2단계 어텐션 라우팅 메커니즘과 통합된 문법 규칙을 통해 옵션의 의미를 유지한다.

Cloudflare에 따르면 텍스트 의사결정은 약 130밀리초의 중앙값으로 반환되며, 이미지 입력은 약 150밀리초, 오디오 입력은 수백 밀리초가 걸린다. 오디오가 포함된 21초 길이의 비디오는 단일 API 요청을 통해 약 1.5초 만에 평가된다. 회사는 개발자 문서와 함께 Clef-omni의 가중치를 Hugging Face에 공개했다.

실제로 무엇이 달라지는가?

새로운 설계는 의사결정을 내리기 전에 음성을 변환하거나 비디오를 분해하기 위한 순차 처리 파이프라인을 구축할 필요를 줄인다. 이는 송장 처리, 고객 서비스, 보안 사고 모니터링처럼 구조화된 답변이 필요한 검사 및 분류 작업에 적합하지만, 특정 분야에서 모델 품질이 충분해야 한다.

그러나 모든 작업에서 다른 모델보다 테스트 결과가 우수한 것은 아니다. Clef-omni는 BFCL의 일치 사례 테스트에서 98.2%, API-Bank에서 92.7%, BANKING77에서 94.8%를 기록했지만, 가정용 기기, When2Call, PhishNChips와 같은 일부 테스트에서는 Clef와 Clef-flash보다 낮은 성적을 보였다. 따라서 새로운 멀티모달 기능의 추가가 모든 시나리오에서 전반적인 우위를 의미하지는 않는다.

Clef-flash 가격 인하 및 Clef 속도 향상

Cloudflare는 Clef-flash의 가격을 입력 토큰 100만 개당 0.09달러에서 0.038달러로 인하했으며, Clef의 가격은 0.24달러로 유지했다. Clef-omni는 입력 토큰 100만 개당 0.15달러에 출시됐다. 반면 호스팅 버전 Clef-flash의 컨텍스트 윈도우는 64,000토큰에서 24,000토큰으로 축소됐다. 회사는 요청의 0.24%만 새로운 한도를 초과한다고 밝혔으며, Hugging Face 가중치는 자체 호스팅 시 최대 256,000토큰의 윈도우를 지원하도록 학습된 상태로 유지된다.

Cloudflare는 Workers AI에서 호스팅되는 Clef의 속도도 개선했다. 약 800토큰 입력의 중앙값 지연 시간은 262밀리초에서 152밀리초로, 약 3,400토큰 입력은 616밀리초에서 305밀리초로 줄어 최대 2.0배 빨라졌다. 회사는 개선의 일부를 SGLang 사용에 기인한 것으로 설명했으며, 관련 기여 사항은 버전 0.5.22에 포함될 예정이다.

이 발표가 중요한 이유

이번 발표는 긴 텍스트를 생성하는 대신 다양한 입력을 처리하고 구조화된 옵션을 추출하는 의사결정 모델의 실용적인 방향을 제시한다. Cloudflare 내부 팀은 GitHub의 스팸 메시지 탐지, 피싱 여부를 확인하기 위한 EmDash 시스템 확장 기능 검사, 개인 식별 메타데이터 모니터링, 악성 도메인 탐지에 이 모델들을 사용해 왔다. 그러나 이러한 사례는 내부 사용에 해당하며, Clef-flash의 컨텍스트 윈도우 제한과 엇갈리는 테스트 결과는 민감한 운영에 모델을 도입하기 전에 평가해야 할 요소로 남아 있다.

뉴스 출처
Cloudflare Blog
원문 보기 ↗
c
작성자

certi.news Editorial Team

같은 카테고리

추천 기사

모든 뉴스 보기