DeepSeek 主力模型线首次支持视觉:V4-Flash-Vision-Exp 上线 API
2026 年 8 月 21 日,DeepSeek 在官方 API 更新日志宣布实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线,开发者可直接调用。它构建在 284B 总参数/13B 激活、1M token 上下文的 V4-Flash 之上,新增对图片与屏幕截图的理解能力,官方自报 Chartography 得分 64.3、多模态智能体能力接近 Opus-4.8。本文拆解事实、技术意义,以及「接近 Opus-4.8」该打几折。
2026 年 8 月 21 日,DeepSeek 在官方 API 更新日志(api-docs.deepseek.com/updates/)宣布,实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 在 DeepSeek API 平台上线。开发者只要把模型参数设为 model='deepseek-v4-flash-vision-exp',即可直接调用;同一时间,该模型也在 DeepSeek 的 Hugging Face 官方账号上可见(但官方未说明权重是否释出)。这是 DeepSeek 的主力对话与智能体模型线首次支持视觉输入。
官方披露的重点如下:
- 底座:构建在既有的 V4-Flash 之上——284B 总参数、13B 激活参数的 MoE 架构,1M token 上下文窗口。
- 新增能力:可读取图片、屏幕截图等视觉输入,并在其上延续原有的文本、推理与智能体(agent)能力。
- 自报成绩:在「需要视觉理解的智能体基准测试」上,相对 V4-Flash 显著跃升,多模态智能体能力已接近 Opus-4.8;公布的 Chartography 得分为 64.3。
- 版本状态:明确标注为 experimental(实验性),并非稳定版。
技术意义:从「读得懂文字」到「看得懂画面」
过去一年 DeepSeek 的路线非常清晰——把文本模型的推理与智能体能力推到极致,把成本压到最低。8 月 13 日 V4-Pro 转入生产版(仅更新定价页版本字符串、权重未开源)、同日开源 Harness v0.1 智能体框架,都是这条线的延伸。但只要模型看不见画面,智能体就只能操作 API 与纯文本界面,碰到报表、图表、后台截图、扫描文件就断线。官方特意点名的是「需要视觉理解的智能体基准」而不是普通的图片问答,这个选择本身就是信号:DeepSeek 想要的不是「会看图的聊天机器人」,而是「看得懂屏幕、然后动手做事的智能体」。
「接近 Opus-4.8」该打几折
这是新闻里最吸引眼球的一句话,但它需要三层折扣:
- 对标的是上一代:Opus 4.8 发布于 2026 年 5 月 28 日,而 Anthropic 已在 7 月 24 日推出 Claude Opus 5。拿三个月前、且已被取代的型号当标杆,跟「逼近现行前沿」是两回事。
- 数字是厂商自报:目前尚无第三方独立评测给出对照数据,外界也未见独立复现。
- Exp 就是 Exp:官方自己标注实验性,接口、定价甚至能力都可能随时变动,不承诺稳定的服务水平。
更务实的读法是:DeepSeek 在多模态上补上了「有」这一格,而且起手就瞄准智能体场景;至于「好不好用」,要等稳定版与第三方复现。
对管理者的意义
不必急着把实验性模型放进正式流程,但值得现在就盘点一件事:公司里哪些工作卡在「数据只存在于画面上」——出货单照片、产线检验画面、对账报表。这些过去只能靠人眼加人手的环节,正在变成模型可以直接吃进去的输入。等稳定版到位时,领先的不是技术,而是「已经知道要它做什么」的人。