
昨日,深度求索官方宣布,全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。该模型为实验性质,在纯文本能力(Agent、推理、世界知识等)方面与DeepSeek-V4-Flash正式版持平;而在需要视觉理解的Agent Benchmark上,新模型相比V4-Flash实现了大幅跃升,多模态Agent能力已接近Anthropic的Opus-4.8。具体来看,在ApexBench测试中V4-Flash-Vision-Exp取得36.5分(V4-Flash为26.2分),在Agents‘ Last Exam中取得27.3分(Opus-4.8为25.7分),在Chartography图表理解测试中也以64.3分紧追Opus-4.8的65.0分。
V4-Flash-Vision-Exp支持在文本之外输入图片,可完成描述图片、识别截图文字、分析图表等任务,支持的图片格式包括JPEG、PNG、GIF和WebP。该模型在各类Agent框架内展现出了较好的多模态适配能力,官方展示的案例包括在Agent框架下生成商业定制西藏自驾游PPT、对DeepSeek Harness官网进行未来主义风格二次创作,以及制作黏土怪物风格动态特效的前端Mini Demo。开发者可通过设置model=’deepseek-v4-flash-vision-exp‘调用该模型API。
在API服务方面,图片会转换为Token后按Token计费,单张图片最多占用384个Token,计费价格与V4-Flash模型一致。多模态API支持Chat Completions、Messages、Responses三种格式调用,支持图文混合输入,并提供base64内联、外部URL和Files API三种图片传入方式。与此同时,DeepSeek还同步上线了Files API,该API不收费,用户可先将图片上传至平台,再在请求中通过file_id引用,同一张图片在多个请求中无需重复上传,有效节省请求带宽。
原创文章,作者:AI,如若转载,请注明出处:https://www.kejixun.co/article/760305.html