Искусственный интеллект

Cloudflare запускает Clef-omni для обработки текста, изображений, аудио и видео в рамках одной модели

Cloudflare добавила модель Clef-omni в семейство моделей принятия решений с открытыми весами, обеспечив нативную поддержку текста, изображений, аудио и видео в рамках одного API-запроса. Компания также снизила цену Clef-flash и увеличила скорость Clef до двукратного уровня, сократив при этом размер размещаемого контекстного окна Clef-flash с 64 тысяч до 24 тысяч токенов.

2026-10-09
4 мин. чтения
6 просмотров
certi.news Editorial Team
Cloudflare запускает Clef-omni для обработки текста, изображений, аудио и видео в рамках одной модели

Cloudflare запустила модель Clef-omni — модель принятия решений с открытыми весами, способную анализировать текст, изображения, аудио и видео в рамках единого конвейера обработки. Объявление последовало за запуском Clef и Clef-flash на прошлой неделе и ориентировано на сценарии, требующие извлечения решений, ограниченных заданной схемой, вместо использования цепочки отдельных моделей для преобразования аудио в текст или отделения визуальных каналов от видео.

Одна модель для мультимодальных входных данных

Clef-omni поддерживает аудиофайлы в форматах WAV и MP3, видео в форматах MP4 и WebM, а также текст и изображения. Cloudflare приводит пример проверки устройства с использованием изображения блока продукта, аудиозаписи во время его работы и видео вентилятора, после чего задаются структурированные вопросы о наличии номера модели, исправности звука и работе вентилятора.

Модель построена на базе Qwen3-Omni-30B-A3B-Instruct с использованием технологии смеси экспертов (MoE), при этом задействован базовый компонент понимания, а компоненты преобразования текста в речь исключены. Вместо генерации выходных токенов, как это делают большие языковые модели, Clef напрямую вычисляет оценки для вариантов ответа, предложенных в рамках заданной схемы, используя двухэтапный механизм направления внимания и встроенные грамматические правила для сохранения смысла вариантов.

Cloudflare утверждает, что решения для текста возвращаются с медианным временем около 130 миллисекунд, входные изображения обрабатываются примерно за 150 миллисекунд, а аудиофрагменты требуют нескольких сотен миллисекунд. Видео продолжительностью 21 секунда со звуком оценивается примерно за 1,5 секунды в рамках одного API-запроса. Компания опубликовала веса Clef-omni на Hugging Face, а также документацию для разработчиков.

Что меняется на практике?

Новая архитектура уменьшает необходимость создания последовательных конвейеров обработки для преобразования речи или разбора видео перед принятием решения. Это подходит для задач проверки и классификации, требующих структурированных ответов, например обработки счетов, обслуживания клиентов и мониторинга инцидентов безопасности, при условии, что качество модели достаточно для конкретной области.

Однако результаты тестов не превосходят показатели других моделей во всех задачах. Clef-omni набрала 98,2% в тесте BFCL для совпадающих случаев, 92,7% в API-Bank и 94,8% в BANKING77, но уступила Clef и Clef-flash в некоторых тестах, например в задачах, связанных с бытовыми устройствами, When2Call и PhishNChips. Поэтому добавление новых мультимодальных возможностей не означает общего превосходства во всех сценариях.

Снижение цены Clef-flash и ускорение Clef

Cloudflare снизила цену Clef-flash с 0,09 доллара до 0,038 доллара за миллион входных токенов, тогда как цена Clef осталась на уровне 0,24 доллара, а Clef-omni был запущен по цене 0,15 доллара за миллион входных токенов. Одновременно контекстное окно размещаемой версии Clef-flash сократилось с 64 тысяч до 24 тысяч токенов. Компания утверждает, что лишь 0,24% запросов превышают новый лимит, а веса на Hugging Face по-прежнему обучены для поддержки окна объёмом до 256 тысяч токенов при самостоятельном размещении.

Cloudflare также повысила скорость размещаемой версии Clef на Workers AI. Медианное время для входных данных объёмом около 800 токенов снизилось с 262 до 152 миллисекунд, а для примерно 3400 токенов — с 616 до 305 миллисекунд, что означает ускорение до 2,0 раза. Компания связывает часть улучшения с использованием SGLang; соответствующие изменения появятся в версии 0.5.22.

Почему это объявление важно?

Объявление демонстрирует практическое направление развития моделей принятия решений: обработка различных типов входных данных и извлечение структурированных вариантов вместо генерации длинного текста. Команды внутри Cloudflare использовали эти модели для обнаружения спама в GitHub, проверки расширений системы EmDash на наличие фишинга, мониторинга персональных метаданных и выявления вредоносных доменов. Однако эти примеры являются внутренними, а неоднозначные результаты тестов и ограничения контекстного окна Clef-flash остаются факторами, которые следует оценить перед внедрением модели в критически важные процессы.

Источник новости
c
Автор

certi.news Editorial Team

Изучить сюжет

Связанные темы и сущности

В той же категории

Вам также может понравиться

Все новости