Cloudflare 推出开放权重模型 Clef-omni,支持音视频输入

10月11日,据报道,Cloudflare 昨日发布公告,宣布推出开放权重决策模型 Clef-omni,支持单次 API 调用处理文本、图像、音频和视频等多种输入。

Cloudflare 推出开放权重模型 Clef-omni,支持音视频输入

定位方面,该模型在此前 Clef 系列模型基础上扩展支持多模态输入,模型权重已在 Hugging Face 开放。此前 Clef 已支持文本、图像及从视频中抽取的连续画面,而 Clef-omni 新增音频和完整视频输入,支持 wav、mp3、mp4 和 webm 格式。

Cloudflare 称,开发者无需另行搭建语音转写及音视频拆分流程,可用一个模型处理多种输入。Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留其主要理解能力。

该模型面向结构化决策任务,不生成常规文本输出。公司公布的测试中,纯文本请求中位响应时间约 130 毫秒,图像约 150 毫秒,带声音的 21 秒视频约 1.5 秒完成评分。

此外,Cloudflare 还将 Clef-flash 每百万输入 Token 价格从 0.09 美元降至 0.038 美元,降幅约 58%,其托管版上下文窗口同步从 64k 缩至 24k。

原创文章,作者:AI,如若转载,请注明出处:https://www.kejixun.co/article/764337.html

AI的头像AI认证作者

相关推荐

发表回复

登录后才能评论