DeepSeek V4.1 Flash 正式版上線:V4 系列首個原生多模態,價格重訂、舊模型被靜默改道
2026 年 9 月 10 日北京時間中午 12 時,DeepSeek V4.1 Flash 正式版上線,是 V4 系列首個把文字、圖像、語音整合進基礎架構層的原生多模態模型。新價格同日生效,離峰輸出每百萬 token 僅 ¥4;第三方實測吞吐與延遲較 V4-Pro 有約 6 倍與 4 倍改善。同時,所有 deepseek-v4-pro 的 API 請求被靜默路由到新模型並改按 Flash 單價計費。
北京時間 2026 年 9 月 10 日中午 12 時(04:00 UTC),DeepSeek 讓 V4.1 Flash 正式版上線。這是 V4 系列第一個「原生多模態」模型——文字、圖像、語音不是以外掛模組接上去,而是在基礎架構層就整合在一起。官方把它定位為採用全新架構的「中間版本」,並稱其在效能、費用、速度、總用時四個面向全面超越既有的 V4-Pro。
價格同日 12 時生效。離峰時段:輸入快取命中每百萬 token ¥0.02、快取未命中 ¥1、輸出 ¥4;尖峰時段為離峰的兩倍。以匯率粗估,離峰約當 $0.003/$0.15/$0.60 每百萬 token。官方並未同步公布 V4-Pro 的對照單價,「更便宜」目前是官方說法,實務上可確定的是:原本呼叫 v4-pro 的請求,此後改按 Flash 單價計費。
速度不是微調,是換級距
第三方實測數據顯示,V4.1 Flash 吞吐落在 355~427 tokens/s、首個 token 延遲 178ms;對照 V4-Pro 的 63 tokens/s 與 766ms,約是 6 倍吞吐、4 倍延遲改善。這個量級的差距通常不會來自參數微調,而是架構本身換了做法——這也呼應官方「全新架構」的說法。
把價格放進同一張表更能看出張力。9 月 3 日發表、9 月 4 日全面開放的 OpenAI GPT-6 Astra,API 標價為每百萬 token 輸入 $10、輸出 $50。兩者定位與能力上限不同,不宜直接對打,但對於「大量、重複、即時」的任務,兩者的單位成本已經不在同一個數量級。
更值得注意的是版本治理
這次公告真正引起討論的,是模型切換的方式。在 V4.1 Pro 上線之前,所有指向 deepseek-v4-pro 的 API 請求會被全部靜默路由到 V4.1 Flash,並按 Flash 單價計費。社群公告距離生效不到 48 小時,且沒有正式的棄用(deprecation)公告。同時,9 月 8 日起開放的測試版 model id deepseek-v4.1-flash-expires-on-0910,也於 9 月 10 日同步下線。
需要誠實標註的一點是:截至本文撰稿,api-docs.deepseek.com 的 updates changelog 尚未補上 9 月條目。DeepSeek 過去慣常延遲數日回填,因此上述細節目前主要來自官網與官方社群公告,以及 TechNode(9 月 9 日)、byteiota(9 月 10 日)等第三方報導與實測,並非引自官方 changelog。
對管理者的意義
價格重訂與提速固然是好消息,但這則新聞真正的提醒有三點:
- 第一,供應商可以在 48 小時內改變你正在呼叫的模型,帳單會照新價走,行為卻可能不同。
- 第二,凡是把某個 model id 寫死在系統裡的整合,都應該被視為有版本風險的相依,值得列入盤點。
- 第三,官方文件不一定是最快的真相來源;驗收 AI 供應商時,除了看規格,也要看它「怎麼處理變更」。
今天可以做的一件小事:把系統裡寫死的 model id 撈成一張清單,各自標上替代方案與回退路徑。