专栏 AI 管理编年史 第 274/303 讲 查看课程目录

DeepSeek V4.1 Flash 正式版上线:V4 系列首个原生多模态,价格重订、旧模型被静默改道

10/09/2026 164
3:49
DeepSeek V4.1 Flash 正式版上线:V4 系列首个原生多模态,价格重订、旧模型被静默改道
图/Photo by Roman Budnikov on Unsplash

2026 年 9 月 10 日北京时间中午 12 点,DeepSeek V4.1 Flash 正式版上线,是 V4 系列首个把文本、图像、语音整合进底层架构的原生多模态模型。新价格同日生效,非高峰输出每百万 token 仅 ¥4;第三方实测吞吐与延迟相比 V4-Pro 约有 6 倍与 4 倍改善。同时,所有 deepseek-v4-pro 的 API 请求被静默路由到新模型并改按 Flash 单价计费。

北京时间 2026 年 9 月 10 日中午 12 点(04:00 UTC),DeepSeek 让 V4.1 Flash 正式版上线。这是 V4 系列第一个「原生多模态」模型——文本、图像、语音不是以插件模块外挂上去,而是在底层架构就整合在一起。官方把它定位为采用全新架构的「中间版本」,并称其在性能、费用、速度、总用时四个方面全面超越现有的 V4-Pro。

价格同日 12 点生效。非高峰时段:输入缓存命中每百万 token ¥0.02、缓存未命中 ¥1、输出 ¥4;高峰时段为非高峰的两倍。按汇率粗估,非高峰约合 $0.003/$0.15/$0.60 每百万 token。官方并未同步公布 V4-Pro 的对照单价,「更便宜」目前是官方说法;实务上可确定的是:原本调用 v4-pro 的请求,此后改按 Flash 单价计费。

速度不是微调,是换了量级

第三方实测数据显示,V4.1 Flash 吞吐落在 355~427 tokens/s、首个 token 延迟 178ms;对照 V4-Pro 的 63 tokens/s 与 766ms,约是 6 倍吞吐、4 倍延迟改善。这个量级的差距通常不会来自参数微调,而是架构本身换了做法——这也印证了官方「全新架构」的说法。

把价格放进同一张表更能看出张力。9 月 3 日发布、9 月 4 日全面开放的 OpenAI GPT-6 Astra,API 标价为每百万 token 输入 $10、输出 $50。两者定位与能力上限不同,不宜直接对打,但对于「大量、重复、实时」的任务,两者的单位成本已经不在同一个数量级。

更值得注意的是版本治理

这次公告真正引起讨论的,是模型切换的方式。在 V4.1 Pro 上线之前,所有指向 deepseek-v4-pro 的 API 请求会被全部静默路由到 V4.1 Flash,并按 Flash 单价计费。社区公告距离生效不到 48 小时,且没有正式的弃用(deprecation)公告。同时,9 月 8 日起开放的测试版 model id deepseek-v4.1-flash-expires-on-0910,也于 9 月 10 日同步下线。

需要如实标注的一点是:截至本文撰稿,api-docs.deepseek.com 的 updates changelog 尚未补上 9 月条目。DeepSeek 过去惯常延迟数日回填,因此上述细节目前主要来自官网与官方社区公告,以及 TechNode(9 月 9 日)、byteiota(9 月 10 日)等第三方报道与实测,并非引自官方 changelog。

对管理者的意义

价格重订与提速固然是好消息,但这则新闻真正的提醒有三点:

  • 第一,供应商可以在 48 小时内改变你正在调用的模型,账单会照新价走,行为却可能不同。
  • 第二,凡是把某个 model id 写死在系统里的集成,都应被视为带版本风险的依赖,值得列入盘点。
  • 第三,官方文档不一定是最快的真相来源;评估 AI 供应商时,除了看规格,也要看它「怎么处理变更」。

今天可以做的一件小事:把系统里写死的 model id 捞成一张清单,各自标上替代方案与回退路径。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Anthropic 推出 Claude for Financial Advisors:11 个连接器与 8 项技能瞄准投资顾问

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策