DeepSeek上线V4-Flash-Vision-Exp:实验性多模态API开放
DeepSeek在官方API平台推出实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,兼容OpenAI格式接口,支持通过Base64、外部URL或Files API上传图片并与文本混合输入。官方公布的基准显示视觉Agent能力提升且在部分项目上接近Opus-4.8,但具体表现仍需第三方复测,图像按Token计费并可通过Files API减少重复上传成本。
DeepSeek在官方API平台推出实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,兼容OpenAI格式接口,支持通过Base64、外部URL或Files API上传图片并与文本混合输入。官方公布的基准显示视觉Agent能力提升且在部分项目上接近Opus-4.8,但具体表现仍需第三方复测,图像按Token计费并可通过Files API减少重复上传成本。
DeepSeek于8月21日在官方API平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型在保留V4-Flash文本能力的基础上加入图像理解,可通过兼容OpenAI格式的 Chat Completions、Messages 和 Responses 接口处理图文混合输入。
DeepSeek在官方发布说明中称,V4-Flash-Vision-Exp在Agent、推理和世界知识等文本能力上与DeepSeek-V4-Flash相当;在需要视觉理解的多模态Agent基准测试中,相比V4-Flash有明显提升,整体表现接近Anthropic的Opus-4.8。不过,这一比较目前仍属于DeepSeek公布的测试结果,尚未成为独立第三方复测结论。
模型已接入三类API接口
开发者可以将模型名称设置为 deepseek-v4-flash-vision-exp,并通过Base64编码、外部图片URL或Files API传入图像。官方Vision指南显示,模型支持JPEG、PNG、GIF和WebP格式,能够用于图片描述、截图文字读取、图表分析等任务。
在Responses API中,图像以 input_image 内容部分传入;在兼容OpenAI的Chat Completions接口中,则使用包含文本和图片的内容数组。DeepSeek同时保留了Anthropic兼容接口,开发者可以通过相应的 image 内容块发送图片。
这意味着,视觉能力并不是一个独立的聊天入口,而是被放进了已有的Agent工具链。对于需要读取网页截图、分析图表、理解软件界面或根据视觉信息调用工具的应用来说,模型可以在同一请求中接收文字和图像,再继续执行后续任务。
图像按Token计费,Files API降低重复上传成本
DeepSeek表示,图像按照Token计费,每张图像最多计入384个Token,并沿用V4-Flash的价格。官方文档说明,图片在推理前会根据尺寸自动缩放,因此高分辨率图片并不会无限增加图像部分的Token成本;但文本输入、上下文和输出Token仍会单独计费。
官方定价页面显示,V4-Flash目前采用峰谷时段定价:缓存未命中的输入Token在非高峰时段为每百万Token 0.22美元,高峰时段为0.44美元;输出Token在非高峰时段为0.66美元,高峰时段为1.32美元。视觉模型的图像部分沿用V4-Flash价格,但模型总体调用费用仍取决于请求中的文本、图片数量、上下文和输出长度。
DeepSeek这次还开放了免费的Files API。用户可以上传图片并获得 file_id,之后在多次请求中重复引用同一文件,避免反复上传。按照Files API文档,单个通过文件引用的图片最大可达64 MiB,而内联或外部URL图片的单张大小限制为32 MiB。文件也可以设置保存期限,或者在不填写过期字段时长期保留。
官方基准显示视觉Agent能力上升,但仍需外部验证
DeepSeek在API更新日志中列出了此次模型的部分基准结果,包括Terminal Bench 2.1为83.9、NL2Repo为57.7、DeepSWE为59.3、DSBench-Hard为63.6、AutomationBench(Public)为25.7、ApexBench(Pass@1)为36.5、Agents’ Last Exam为27.3,以及Chartography为64.3。
官方特别说明,部分公开基准主要测试文本能力,测试时使用的是DeepSeek-V4-Flash文本模型;在ApexBench和Agents’ Last Exam中,文本模型会忽略其中的多模态元素。因此,这些分数不能全部用来证明视觉能力的提升。真正与此次发布直接相关的,是需要视觉理解的多模态Agent测试,但DeepSeek在当前公告中没有完整公开所有对比设置、提示词和复测条件。
The Next Web的报道指出,DeepSeek公布的表格覆盖多个基准,V4-Flash-Vision-Exp在其中部分项目上与Opus-4.8形成竞争。但这仍然是对官方测试表的整理,而不是独立实验室在统一条件下完成的全面评估。对于“接近Opus-4.8”的说法,较稳妥的理解是:它描述了DeepSeek在自有或披露的多模态Agent评测中的相对位置,而不是宣布模型已经全面达到同等水平。
从文本模型向视觉Agent扩展
此次发布延续了DeepSeek近期快速扩充V4模型家族的节奏。7月31日,DeepSeek将V4-Flash API更新为公开测试版本;8月13日,V4-Pro正式版在App、Web和API上线。V4-Flash-Vision-Exp则没有被定位为新的正式旗舰,而是在现有Flash路线上的实验性视觉扩展。
DeepSeek Harness也在同日加入了对新模型的支持。其GitHub发布记录显示,0.1.1-rc.1新增DeepSeek-V4-Flash-Vision-Exp适配器;随后发布的0.1.1-rc.2进一步优化了通过Files API上传和重复引用图像的流程。这种同步表明,DeepSeek希望把视觉模型直接放入代码Agent和工具调用环境,而不只是作为图像问答模型提供服务。
这种产品方向也与行业整体变化相呼应:视觉模型正在从单纯识别图片,转向理解界面、文档和工作流。此前,阿里巴巴Qwen团队发布的Qwen-Image-3.0也把重点放在复杂版面和实际创作任务上。两者虽然分别面向图像生成和视觉理解,但都反映出多模态竞争正在从“能否处理图片”转向“能否嵌入真实工作”。
对开发者而言,V4-Flash-Vision-Exp的短期价值在于API兼容、图像输入方式灵活,以及图像Token上限相对可控;对模型评测而言,它的关键问题则是视觉Agent能力能否在第三方统一条件下稳定复现。由于该模型仍处于实验阶段,DeepSeek尚未将其描述为V4-Flash的全面替代品,实际可用性、稳定性和长期定价仍需继续观察。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

