光速网讯,8月21日,DeepSeek在自家API平台上新推出多模态视觉理解模型DeepSeek‑V4‑Flash‑Vision‑Exp,补齐了平台的图片解析能力。该版本定位为实验模型,面向广大开发者开放测试使用,开发者只需在接口调用时指定model参数为'deepseek‑v4‑flash‑vision‑exp',就可以启用这套带视觉能力的大模型。

据官方披露信息,这款实验模型保留了V4‑Flash原有的文本推理能力,在此基础之上新增图片输入识别,支持图文混合输入,能够完成截图解读、图表分析、图像问答等多模态任务。不过官方也做出提示,因为属于实验版本,模型效果还在持续打磨,不建议直接用于生产业务。

从调用方式来看,模型沿用平台现有的对话接口规范,图片可以通过URL、Base64编码等多种形式传入,适配开发者现有的开发流程,不用大规模改动原有代码即可接入视觉能力。同步更新之后,DeepSeek Harness框架也完成适配,开发者可以把图像理解能力嵌入Agent自动化工作流当中。

不少开发者已经第一时间进行测试。有业内人士表示,在此之前DeepSeek API以文本模型见长,缺少公开可用的视觉能力,本次上新,也意味着开发者不用切换外部服务,在同一个平台内就能同时搞定文本生成与图片解析,降低多模态应用的搭建门槛。

实验模型上线主要用于收集真实场景下的调用反馈,方便研发团队迭代优化。后续正式版本的能力、稳定性以及发布时间,还需要等待DeepSeek进一步对外官宣。现阶段有接入需求的企业和开发者,需要留意实验版本存在的不确定性,做好风险评估。