Inteligencia artificial

Cloudflare lanza Clef-omni para procesar texto, imágenes, audio y vídeo mediante un único modelo

Cloudflare añadió el modelo Clef-omni a su familia de modelos de decisión con pesos abiertos, con compatibilidad nativa para texto, imágenes, audio y vídeo dentro de una única solicitud de API. También redujo el precio de Clef-flash y aumentó la velocidad de Clef hasta el doble, a cambio de reducir la ventana de contexto alojada de Clef-flash de 64.000 a 24.000 tokens.

2026-10-09
5 min de lectura
6 visitas
certi.news Editorial Team
Cloudflare lanza Clef-omni para procesar texto, imágenes, audio y vídeo mediante un único modelo

Cloudflare lanzó el modelo Clef-omni, un modelo de decisión con pesos abiertos capaz de analizar texto, imágenes, audio y vídeo dentro de un único flujo de procesamiento. El anuncio llega después del lanzamiento de Clef y Clef-flash la semana pasada, y está dirigido a casos de uso que requieren extraer decisiones restringidas a un esquema específico, en lugar de depender de una cadena de modelos independientes para convertir audio en texto o separar los canales visuales del vídeo.

Un único modelo para entradas multimodales

Clef-omni admite archivos de audio en formatos WAV y MP3, y vídeo en formatos MP4 y WebM, además de texto e imágenes. Cloudflare presenta el ejemplo de inspeccionar un dispositivo mediante una imagen de la unidad del producto, una grabación de audio mientras está funcionando y un vídeo del ventilador, para después plantear preguntas estructuradas sobre la visibilidad del número de modelo, la integridad del sonido y el funcionamiento del ventilador.

El modelo se basa en Qwen3-Omni-30B-A3B-Instruct mediante la técnica de mezcla de expertos (MoE), utilizando el componente principal de comprensión y prescindiendo de los componentes de texto a voz. En lugar de generar tokens de salida como los modelos de lenguaje de gran tamaño, Clef calcula directamente las puntuaciones de las opciones candidatas dentro de un esquema específico, con un mecanismo de enrutamiento de la atención en dos etapas y gramáticas integradas para preservar el significado de las opciones.

Cloudflare afirma que las decisiones de texto se devuelven con una latencia mediana de aproximadamente 130 milisegundos y las entradas de imagen en unos 150 milisegundos, mientras que los clips de audio requieren unos cientos de milisegundos. Un vídeo de 21 segundos con audio se evalúa en aproximadamente 1,5 segundos mediante una única solicitud de API. La empresa puso a disposición los pesos de Clef-omni en Hugging Face, junto con la documentación para desarrolladores.

¿Qué cambia en la práctica?

El nuevo diseño reduce la necesidad de construir flujos de procesamiento secuenciales para convertir el habla o descomponer el vídeo antes de tomar una decisión. Esto resulta adecuado para tareas de inspección y clasificación que requieren respuestas estructuradas, como el procesamiento de facturas, la atención al cliente y la supervisión de incidentes de seguridad, siempre que la calidad del modelo sea suficiente para el ámbito específico.

Sin embargo, los resultados de las pruebas no superan a los de otros modelos en todas las tareas. Clef-omni obtuvo un 98,2 % en la prueba BFCL para casos de coincidencia, un 92,7 % en API-Bank y un 94,8 % en BANKING77, pero quedó por debajo de Clef y Clef-flash en algunas pruebas, como dispositivos domésticos, When2Call y PhishNChips. Por tanto, la incorporación de nuevos tipos de medios no implica una superioridad general en todos los escenarios.

Reducción del precio de Clef-flash y aceleración de Clef

Cloudflare redujo el precio de Clef-flash de 0,09 dólares a 0,038 dólares por cada millón de tokens de entrada, mientras que el precio de Clef se mantuvo en 0,24 dólares, y Clef-omni se lanzó a un precio de 0,15 dólares por cada millón de tokens de entrada. A cambio, la ventana de contexto de la versión alojada de Clef-flash se redujo de 64.000 a 24.000 tokens. La empresa afirma que solo el 0,24 % de las solicitudes supera el nuevo límite, mientras que los pesos de Hugging Face siguen entrenados para admitir una ventana de hasta 256.000 tokens en el alojamiento propio.

Cloudflare también mejoró la velocidad de Clef alojado en Workers AI. La latencia mediana para entradas de aproximadamente 800 tokens bajó de 262 a 152 milisegundos, y para unas 3.400 tokens, de 616 a 305 milisegundos, lo que supone una aceleración de hasta 2,0 veces. La empresa atribuye parte de la mejora al uso de SGLang, con contribuciones que aparecerán en la versión 0.5.22.

¿Por qué importa este anuncio?

El anuncio presenta una dirección práctica para los modelos de decisión: procesar entradas diferentes y extraer opciones estructuradas en lugar de producir texto extenso. Equipos de Cloudflare han utilizado estos modelos para detectar mensajes no deseados en GitHub, inspeccionar extensiones del sistema EmDash en busca de phishing, supervisar datos personales identificables y detectar dominios maliciosos. No obstante, estos ejemplos son internos, y los resultados dispares de las pruebas y las limitaciones de la ventana de contexto de Clef-flash siguen siendo factores que deben evaluarse antes de adoptar el modelo en operaciones sensibles.

Fuente de la noticia
Cloudflare Blog
Abrir fuente original ↗
c
Autor

certi.news Editorial Team

De la misma categoría

También te puede interesar

Ver todas las noticias