Cloudflare 发布开放权重模型 Clef-omni:一次 API 调用处理文本、图像、音频和视频

Cloudflare 在 10 月 9 日发布公告,推出开放权重的决策模型 Clef-omni。和之前的 Clef 相比,这次最大的变化是输入端:除了文本和图像,现在直接支持 wav、mp3 音频和 mp4、webm 视频,一次 API 调用就能把混合素材丢给模型处理。
「决策模型」是干什么的
Clef 系列不是聊天模型,它不生成常规文本,而是面向结构化决策任务:判断该调用哪个工具、这个请求属于哪一类、这次操作打几分。典型场景包括工具选择、意图分类、内容审核打分、钓鱼识别——都是系统后台需要毫秒级给出判断的活。
之前的 Clef 处理视频的方式比较绕:把视频按时间抽成一帧帧静态图片,再按顺序喂给模型。Clef-omni 把音频和完整视频变成了原生输入,开发者不用再自己搭语音转写和音视频拆分的预处理流程,一个模型搞定多种输入。
底子和速度
Cloudflare 称 Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,保留了它的主要理解能力,模型权重已在 Hugging Face 开放。官方公布的响应速度:
- 纯文本请求:中位响应约 130 毫秒
- 图像请求:约 150 毫秒
- 带声音的 21 秒视频:约 1.5 秒完成评分
基准测试上,Clef-omni 在 BFCL 工具调用精确匹配率拿到 98.2,BANKING77 意图分类宏平均 F1 为 94.8,CLINC150+OOS 达 97.7。对比自家 Clef 和 Clef-flash,它并不是全项领先——比如家用电器场景 Clef-flash 的 97.73 远高于它的 69.3,When2Call 上 Jev 的 80.97 也更高——选型时得按具体任务看表,不能只看旗舰名字。
顺手还降了价
同一份公告里,Cloudflare 把 Clef-flash 的输入价从每百万 Token 0.09 美元降到 0.038 美元,降幅约 58%,代价是托管版上下文窗口从 64k 缩到 24k。三个模型的最新定价:
- Clef-flash:输入 0.038 / 输出 0.12(美元/百万 Token)
- Clef:输入 0.24 / 输出 0.72
- Clef-omni:输入 0.15 / 输出 0.60
对开发者意味着什么
如果你在做内容审核、智能路由、Agent 工具选择这类「判断型」功能,Clef-omni 的价值在于两点:一是多模态输入合并成一次调用,省掉转写和拆帧的流水线;二是开放权重,可以自己部署、自己微调,不必绑定 Cloudflare 的托管服务。响应在百毫秒级,放进实时链路里没有压力。
要注意的是它不做生成,别指望拿它写文案——它是给你系统里那些「是/否/选哪个」的环节用的。需要生成能力的场景,还是得搭配通用模型。
更多 AI 工具与教程见 AI 智库。
智库妙影 AI数字人
智库创课 AI课件
智库GEO AI搜索优化
智库妙鉴 AI命理文化
Agent社区 智能体交流
智影新媒体OS 新媒体创作
智库爆单宝 AI电商出单
辽公网安备21021102001760号