專欄 AI 管理編年史 第 245/303 講 查看課程目錄

DeepSeek 主力模型線首度支援視覺:V4-Flash-Vision-Exp 上線 API

28/08/2026 160
4:09
DeepSeek 主力模型線首度支援視覺:V4-Flash-Vision-Exp 上線 API
圖/Photo by Sumaid pal Singh Bakshi on Unsplash

2026 年 8 月 21 日,DeepSeek 在官方 API 變更日誌宣布實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 上線,開發者可直接呼叫。它建立在 284B 總參數/13B active、1M token 上下文的 V4-Flash 之上,新增對圖片與螢幕截圖的理解能力,官方自報 Chartography 得分 64.3、多模態代理能力接近 Opus-4.8。本文拆解事實、技術意義,以及「接近 Opus-4.8」該打幾折。

2026 年 8 月 21 日,DeepSeek 在官方 API 變更日誌(api-docs.deepseek.com/updates/)宣布,實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 於 DeepSeek API 平台上線。開發者只要把模型參數設為 model='deepseek-v4-flash-vision-exp' 即可直接呼叫;同一時間,該模型也在 DeepSeek 的 Hugging Face 官方帳號上可見(惟官方未說明權重是否釋出)。這是 DeepSeek 的主力對話與代理模型線首度支援視覺輸入。

官方揭露的重點如下:

  • 基座:建立在既有的 V4-Flash 之上——284B 總參數、13B active 的 MoE 架構,1M token 上下文窗口。
  • 新增能力:可讀取圖片、螢幕截圖等視覺輸入,並在其上延續原有的文字、推理與代理(agent)能力。
  • 自報成績:在「需要視覺理解的代理基準測試」上,相對 V4-Flash 顯著躍升,多模態代理能力已接近 Opus-4.8;公布的 Chartography 得分為 64.3。
  • 版本狀態:明確標示為 experimental(實驗性),不是穩定版。

技術意義:從「讀得懂文字」到「看得懂畫面」

過去一年 DeepSeek 的路線非常清楚——把文字模型的推理與代理能力推到極致,成本壓到最低。8 月 13 日 V4-Pro 轉入生產版(僅更新定價頁版本字串、權重未開源)、同日開源 Harness v0.1 代理框架,都是這條線的延伸。但只要模型看不見畫面,代理就只能操作 API 與純文字介面,碰到報表、圖表、後台截圖、掃描文件就斷線。官方特別點名的是「需要視覺理解的代理基準」而不是一般圖片問答,這個選擇本身就是訊號:DeepSeek 想要的不是「會看圖的聊天機器人」,而是「看得懂螢幕、然後動手做事的代理」。

「接近 Opus-4.8」該打幾折

這是新聞裡最抓眼球的一句話,但它需要三層折扣:

  1. 對標的是上一代:Opus 4.8 發布於 2026 年 5 月 28 日,而 Anthropic 已在 7 月 24 日推出 Claude Opus 5。拿三個月前、且已被取代的型號當標竿,跟「逼近現行前沿」是兩回事。
  2. 數字是廠商自報:目前尚無第三方獨立評測給出對照數據,外界也未見獨立複現。
  3. Exp 就是 Exp:官方自己標示實驗性,介面、定價甚至能力都可能隨時變動,不承諾穩定服務水準。

比較務實的讀法是:DeepSeek 在多模態上補上了「有」這一格,而且起手就對準代理場景;至於「好不好用」,要等穩定版與第三方複現。

對管理者的意義

不必急著把實驗性模型放進正式流程,但值得現在就盤點一件事:公司裡哪些工作卡在「資料只存在於畫面上」——出貨單照片、產線檢驗畫面、對帳報表。這些過去只能靠人眼加人手的環節,正在變成模型可以直接吃進去的輸入。等穩定版到位時,領先的不是技術,而是「已經知道要它做什麼」的人。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 NVIDIA Groq 3 LPX 全面量產:每秒 3,400 token 的即時吐字,代理式 AI 的等待被重寫

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策