ITCOW牛新网 8月22日消息,深度求索昨日在其API平台推出实验性多模态视觉模型DeepSeek‑V4‑Flash‑Vision‑Exp,支持图文混合输入,可完成图片描述、截图文字识别、图表分析,兼容JPEG、PNG、GIF、WebP图片格式,适配各类Agent开发框架。

DeepSeek V4‑Flash‑Vision‑Exp实验模型上线

该模型纯文本能力与V4‑Flash正式版持平,在视觉Agent基准测试中性能大幅提升,多模态Agent能力接近Opus‑4.8。开发者设置model=’deepseek‑v4‑flash‑vision‑exp’即可调用API,图片会转换为token计费,单张图片最高占用384 tokens,计费标准和V4‑Flash保持一致。接口支持Chat Completions、Messages、Responses三种调用格式,图片支持base64内联、外部URL、Files API三种传入方式。

同步上线免费Files API,用户预先上传图片获取file_id,后续请求直接引用,避免重复上传,节约请求带宽。需要注意该版本属于实验性质模型。