Clef-omni: classificar multimídia não elimina a necessidade de avaliar decisões
O novo Clef recebe áudio e vídeo; o Flash reduz preço e contexto. Escolher o modelo exige medir erro, custo e tamanho de entrada juntos.
A Cloudflare apresentou o Clef-omni, um modelo de decisão que recebe texto, imagens, áudio e vídeo numa chamada e pontua alternativas definidas por um esquema de perguntas.[8] Os pesos foram disponibilizados no Hugging Face, com acesso hospedado em Workers AI.[8] No mesmo anúncio, o Clef-flash ficou mais barato e perdeu capacidade de contexto no serviço hospedado.[8] A escolha não se resume ao nome mais novo da família.
O que muda para quem desenvolve
O Omni parte do Qwen3-Omni-30B-A3B-Instruct, preserva compreensão multimodal e descarta os componentes de geração de fala.[8] Sua proposta é calcular pontuações para opções permitidas, sem gerar uma sequência de tokens de resposta.[8]
Minha leitura: isso combina com etapas delimitadas de uma automação, como classificar um documento ou selecionar uma rota. Não é motivo para entregar ao classificador autorização automática para executar qualquer consequência da escolha. Recomendo separar decisão probabilística e regras de ação.
Nos números publicados pela Cloudflare, o Omni registra aproximadamente 130 ms de mediana em decisões de texto e pontua um vídeo de 21 segundos com som em cerca de 1,5 segundo.[8] São medições do fornecedor, não resultados garantidos para o seu tráfego.
Há perdas em tarefas específicas: em faturas, o Omni alcançou 82,0 na ação principal e 60,2 no conjunto exato de ações, abaixo do Clef original nas duas medidas.[8] Para engenharia, isso reforça uma escolha de métrica: acertar a primeira opção não significa acertar todas as ações exigidas pelo processo.
Como aplicar
Escolha uma etapa com opções claras e monte um conjunto de exemplos rotulados. Inclua entradas fáceis, ambíguas, incompletas e fora do domínio. Compare Omni e a alternativa atual sob o mesmo esquema, sem mudar simultaneamente as regras de avaliação.
Registre acerto por classe, erros de maior consequência, latência e custo por entrada. Se uma decisão tiver múltiplos campos, avalie tanto os campos isolados quanto a combinação inteira. Defina também quando encaminhar o caso para revisão em vez de forçar uma resposta.
No caso de áudio e vídeo, compare o processamento direto com o pipeline que você já utiliza. Não conte apenas chamadas removidas; considere a qualidade final e a dificuldade de investigar um erro.
O Flash hospedado passa de US$ 0,09 para US$ 0,038 por milhão de tokens de entrada, enquanto o contexto cai de 64 mil para 24 mil tokens.[8] Antes de trocar o modelo, inspecione a distribuição do tamanho das requisições e defina o tratamento das que não cabem.
Cuidados e limites
Os pesos abertos do Flash não mudaram e foram treinados para contexto de 256 mil tokens em hospedagem própria; esse limite não deve ser confundido com o do serviço hospedado.[8] O Omni estreia a US$ 0,15 por milhão de tokens, e o custo da mídia depende da conversão em tokens.[8]
A Cloudflare informou que apenas 0,24% das requisições observadas excediam o novo limite do Flash.[8] Esse retrato não descreve necessariamente o seu conjunto de documentos. Preço menor, contexto suficiente e qualidade aceitável precisam ser verificados juntos.
Fonte
[8] Fonte: Cloudflare Blog