DeepSeek-V4-Flash-0731:架构一字未改,只换后训练就领先自家旗舰
2026-07-31 DeepSeek 发布 V4-Flash-0731 新检查点——这是 7 月 20 日 V4 家族进入 GA 之后,Flash 产品线的首次版本更新。架构与 4 月 preview 完全一致(284B 总参数、13B active MoE、1M token 上下文),仅重跑整条后训练管线;官方自报的智能体与代码基准全部领先自家旗舰 V4-Pro Preview。新权重以 MIT 许可非门控上架 Hugging Face,补上了 GA 当时悬而未决的开源问题。
2026 年 7 月 31 日,DeepSeek 发布新检查点 DeepSeek-V4-Flash-0731。这是继 7 月 20 日 V4 家族(含 deepseek-v4-flash)由预览转入正式可用(GA)之后,Flash 这条产品线的首次版本更新。最值得注意的地方,不在于模型变大,而在于模型完全没有变大——架构与规格一字未改:284B 总参数、13B active 的 MoE 设计、1M token 上下文长度,全部维持原样。官方明言,改的只有一件事:整条后训练(post-training)管线重写、模型重新训练。
这次同时补上了 GA 当时悬而未决的一项信息——权重发布。新版权重以 MIT 许可、非门控(no gating)上架 Hugging Face,下载无需申请审批;这是延续 4 月 preview 的开源做法,也让「GA 之后是否继续开源」的悬念落地。定价则沿用 GA 时的结构:输入 $0.14、输出 $0.28 per M tokens 为基准(离峰)费率,每日 9 至 12 时、14 至 18 时的高峰时段仍为 2 倍计价,估算账单时不能只看基准价。
基准测试领先自家旗舰,但这是厂商自报数字
官方公布的智能体(agentic)与代码基准测试中,V4-Flash-0731 全部胜过售价更高的旗舰线。三组代表性数字为:
- Terminal Bench 2.1:82.7 vs 72.1
- NL2Repo:54.2 vs 38.5
- Cybergym:76.7 vs 52.7
有两点必须诚实标注。第一,须注意官方此次对照的是 V4-Pro Preview,而非 7 月 20 日 GA 的 V4-Pro 正式版,两者并非同一批后训练成果,领先幅度不宜直接套用到现行旗舰。第二,以上全部是厂商自报成绩,且跑在尚未公开的评测 harness 上,并非第三方独立验证;基准名称相同不代表跑法相同,harness 未公开就无从复现。官方另列有一项 DeepSWE 的对照数字,但旗舰端数值异常偏低,在原始评测设定公开前,本文不予引用。
能力增益的主战场,正在从堆参数转向后训练
把架构固定、只换后训练,等于做了一次近似的对照实验:参数规模、上下文长度、稀疏设计都是常量,唯一变量是训练后段的数据配方与强化流程。若官方数字成立,说明在智能体与代码这类需要长链条决策的任务上,后训练带来的增益已足以压过参数规模的差距。
这也解释了为什么便宜的 Flash 线能反超昂贵的 Pro 线:对照组的 Pro Preview 是较早期的后训练成果,Flash-0731 用的是新管线。同一家公司内部就出现「便宜的比贵的强」,对整个行业的定价逻辑是一记提醒——参数量与价格已不再是能力的可靠代理指标。
MIT 非门控许可则是另一条信号。GA 之后新权重仍可自由下载、商用无需审批,等于把「自建部署」的门槛压到只剩硬件成本,对数据不能出境、或需要在自有机房处理敏感数据的企业尤其有意义。
对管理者的意义
最实际的一课是:旧评测结论的保鲜期正在快速缩短。半年前做的模型选型比较,很可能因为供应商换一次后训练管线就整个翻盘,而外观(参数、价格、版本号)几乎看不出差异。因此选型不该是一次性决策,而该有固定的复验节奏。若团队已在用 AI 处理代码或多步骤智能体任务,可以拿自家真实工单各跑一轮新旧检查点,用自己的验收标准比对——供应商的 harness 不公开,你自己的 harness 才是能复现的那一个。