DeepSeek 主力模型線首度支援視覺:V4-Flash-Vision-Exp 上線 API
2026 年 8 月 21 日,DeepSeek 在官方 API 變更日誌宣布實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 上線,開發者可直接呼叫。它建立在 284B 總參數/13B active、1M token 上下文的 V4-Flash 之上,新增對圖片與螢幕截圖的理解能力,官方自報 Chartography 得分 64.3、多模態代理能力接近 Opus-4.8。本文拆解事實、技術意義,以及「接近 Opus-4.8」該打幾折。
2026 年 8 月 21 日,DeepSeek 在官方 API 變更日誌(api-docs.deepseek.com/updates/)宣布,實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 於 DeepSeek API 平台上線。開發者只要把模型參數設為 model='deepseek-v4-flash-vision-exp' 即可直接呼叫;同一時間,該模型也在 DeepSeek 的 Hugging Face 官方帳號上可見(惟官方未說明權重是否釋出)。這是 DeepSeek 的主力對話與代理模型線首度支援視覺輸入。
官方揭露的重點如下:
- 基座:建立在既有的 V4-Flash 之上——284B 總參數、13B active 的 MoE 架構,1M token 上下文窗口。
- 新增能力:可讀取圖片、螢幕截圖等視覺輸入,並在其上延續原有的文字、推理與代理(agent)能力。
- 自報成績:在「需要視覺理解的代理基準測試」上,相對 V4-Flash 顯著躍升,多模態代理能力已接近 Opus-4.8;公布的 Chartography 得分為 64.3。
- 版本狀態:明確標示為 experimental(實驗性),不是穩定版。
技術意義:從「讀得懂文字」到「看得懂畫面」
過去一年 DeepSeek 的路線非常清楚——把文字模型的推理與代理能力推到極致,成本壓到最低。8 月 13 日 V4-Pro 轉入生產版(僅更新定價頁版本字串、權重未開源)、同日開源 Harness v0.1 代理框架,都是這條線的延伸。但只要模型看不見畫面,代理就只能操作 API 與純文字介面,碰到報表、圖表、後台截圖、掃描文件就斷線。官方特別點名的是「需要視覺理解的代理基準」而不是一般圖片問答,這個選擇本身就是訊號:DeepSeek 想要的不是「會看圖的聊天機器人」,而是「看得懂螢幕、然後動手做事的代理」。
「接近 Opus-4.8」該打幾折
這是新聞裡最抓眼球的一句話,但它需要三層折扣:
- 對標的是上一代:Opus 4.8 發布於 2026 年 5 月 28 日,而 Anthropic 已在 7 月 24 日推出 Claude Opus 5。拿三個月前、且已被取代的型號當標竿,跟「逼近現行前沿」是兩回事。
- 數字是廠商自報:目前尚無第三方獨立評測給出對照數據,外界也未見獨立複現。
- Exp 就是 Exp:官方自己標示實驗性,介面、定價甚至能力都可能隨時變動,不承諾穩定服務水準。
比較務實的讀法是:DeepSeek 在多模態上補上了「有」這一格,而且起手就對準代理場景;至於「好不好用」,要等穩定版與第三方複現。
對管理者的意義
不必急著把實驗性模型放進正式流程,但值得現在就盤點一件事:公司裡哪些工作卡在「資料只存在於畫面上」——出貨單照片、產線檢驗畫面、對帳報表。這些過去只能靠人眼加人手的環節,正在變成模型可以直接吃進去的輸入。等穩定版到位時,領先的不是技術,而是「已經知道要它做什麼」的人。