Inteligência artificial

Cloudflare lança o Clef-omni para processar texto, imagens, áudio e vídeo com um único modelo

A Cloudflare adicionou o modelo Clef-omni à família de modelos de decisão de pesos abertos, com suporte nativo a texto, imagens, áudio e vídeo em uma única solicitação de API. A empresa também reduziu o preço do Clef-flash e aumentou a velocidade do Clef em até duas vezes, em troca da redução da janela de contexto hospedada do Clef-flash de 64 mil para 24 mil tokens.

2026-10-09
5 min de leitura
6 visualizações
certi.news Editorial Team
Cloudflare lança o Clef-omni para processar texto, imagens, áudio e vídeo com um único modelo

A Cloudflare lançou o modelo Clef-omni, um modelo de decisão de pesos abertos capaz de analisar texto, imagens, áudio e vídeo em um único fluxo de processamento. O anúncio ocorre após o lançamento do Clef e do Clef-flash na semana passada e tem como alvo casos de uso que exigem a extração de decisões restritas por um esquema específico, em vez da dependência de uma cadeia de modelos separados para converter áudio em texto ou separar os canais visuais do vídeo.

Um único modelo para entradas multimodais

O Clef-omni é compatível com arquivos de áudio nos formatos WAV e MP3 e com vídeos nos formatos MP4 e WebM, além de texto e imagens. A Cloudflare apresenta um exemplo de inspeção de um dispositivo usando uma imagem da unidade do produto, uma gravação de áudio durante seu funcionamento e um vídeo do ventilador, seguido de perguntas estruturadas sobre a presença do número do modelo, a integridade do áudio e o funcionamento do ventilador.

O modelo foi desenvolvido com base no Qwen3-Omni-30B-A3B-Instruct, usando a técnica de mistura de especialistas (MoE), com a utilização do componente principal de compreensão e a remoção dos componentes de conversão de texto em fala. Em vez de gerar tokens de saída como os grandes modelos de linguagem, o Clef calcula diretamente as pontuações das opções candidatas dentro de um esquema específico, com um mecanismo de direcionamento da atenção em duas etapas e regras linguísticas incorporadas para preservar o significado das opções.

A Cloudflare afirma que as decisões de texto são retornadas com uma latência mediana de aproximadamente 130 milissegundos, e as entradas de imagem em cerca de 150 milissegundos, enquanto os clipes de áudio exigem algumas centenas de milissegundos. Já um vídeo de 21 segundos com áudio é avaliado em aproximadamente 1,5 segundo por meio de uma única solicitação de API. A empresa disponibilizou os pesos do Clef-omni no Hugging Face, juntamente com a documentação para desenvolvedores.

O que muda na prática?

O novo design reduz a necessidade de construir pipelines de processamento sequenciais para converter fala ou decompor vídeos antes de tomar uma decisão. Isso é adequado para tarefas de inspeção e classificação que exigem respostas estruturadas, como processamento de faturas, atendimento ao cliente e monitoramento de incidentes de segurança, desde que a qualidade do modelo seja suficiente para o campo específico.

No entanto, os resultados dos testes não superam os de outros modelos em todas as tarefas. O Clef-omni registrou 98,2% no teste BFCL para casos de correspondência, 92,7% no API-Bank e 94,8% no BANKING77, mas ficou abaixo do Clef e do Clef-flash em alguns testes, como os de eletrodomésticos, When2Call e PhishNChips. Portanto, a adição de novas modalidades não significa superioridade geral em todos os cenários.

Redução do preço do Clef-flash e aceleração do Clef

A Cloudflare reduziu o preço do Clef-flash de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada, enquanto o preço do Clef permaneceu em US$ 0,24; o Clef-omni foi lançado a US$ 0,15 por milhão de tokens de entrada. Em contrapartida, a janela de contexto da versão hospedada do Clef-flash foi reduzida de 64 mil para 24 mil tokens. A empresa afirma que apenas 0,24% das solicitações ultrapassam o novo limite, enquanto os pesos do Hugging Face continuam treinados para oferecer suporte a uma janela de até 256 mil tokens em hospedagem própria.

A Cloudflare também melhorou a velocidade do Clef hospedado no Workers AI. A latência mediana caiu de 262 para 152 milissegundos para entradas de aproximadamente 800 tokens e de 616 para 305 milissegundos para cerca de 3.400 tokens, o que representa uma aceleração de até 2,0 vezes. A empresa atribui parte da melhoria ao uso do SGLang, com contribuições que aparecerão na versão 0.5.22.

Por que este anúncio é importante?

O anúncio apresenta uma direção prática para modelos de decisão: processar diferentes tipos de entrada e extrair opções estruturadas, em vez de produzir textos longos. Equipes dentro da Cloudflare usaram esses modelos para detectar spam no GitHub, verificar extensões do sistema EmDash em busca de phishing, monitorar dados pessoais de identificação e detectar domínios maliciosos. No entanto, esses exemplos são internos, e os resultados variados dos testes e as limitações da janela de contexto do Clef-flash continuam sendo fatores que devem ser avaliados antes da adoção do modelo em operações sensíveis.

Fonte da notícia
Cloudflare Blog
Abrir fonte original ↗
c
Autor

certi.news Editorial Team

Na mesma categoria

Você também pode gostar

Ver todas as notícias