DeepSeek发布V3.2-Exp实验版:稀疏注意力机制把运算成本砍半
DeepSeek于2025年9月30日发布V3.2-Exp实验版,首次引入DSA稀疏注意力机制,长文档处理能力提升、运算成本降低近半,性能与前代V3.1-Terminus相当,定位为下一代架构的过渡步骤。
2025年9月30日,中国AI实验室DeepSeek发布最新实验版模型DeepSeek-V3.2-Exp。这是在9月早些时候发布的DeepSeek-V3.1-Terminus基础上推出的过渡版本,官方在技术文档中明确将其定位为“迈向下一代模型架构的中间步骤”,而非一次正式的大改版。
此次发布的最大技术亮点,是首次在DeepSeek模型上引入DSA(DeepSeek Sparse Attention,稀疏注意力机制)。根据官方公布的资料,DSA的作用是让模型在处理长文档、长对话时,不需要对输入的每一段文字都做同样份量的运算,而是有选择性地聚焦在真正相关的部分。结果是模型处理长内容的能力提升,同时运算成本降低了将近一半。
技术意义:注意力机制的效率转型
Transformer架构的标准注意力机制,运算量会随输入长度呈平方成长——文档越长,运算负担越重,这也是长文档、长对话一直是大型语言模型的痛点所在。稀疏注意力机制的思路,是让模型学会“该看哪里”而非“每个字都同样力道地看”,借此用更少的运算资源达到接近的效果。DeepSeek这次把这个技术方向实际落地到可用模型上,是效率工程上的一步,而非单纯堆更大参数量。
与前代比较:性能持平、成本减半
官方数据显示,V3.2-Exp的整体性能表现与V3.1-Terminus相当,并没有明显跃进。这点很关键——这次发布的重点不是“更聪明”,而是“用一半的运算成本做到差不多聪明”。对于需要大量调用模型处理长内容(如大量文档摘要、长对话客服记录)的应用场景,这种性能持平但成本降低的版本,实际使用价值可能比性能小幅提升的版本更高。
业界反应:过渡版本释放的信号
DeepSeek官方自己将V3.2-Exp定调为“实验版”与“过渡步骤”,而非正式旗舰版本,这种谨慎的命名与定位方式,也被视为释放一个信号:稀疏注意力机制未来很可能会成为DeepSeek下一代主力模型的核心架构之一,此次发布更像是先在社区与开发者间验证技术可行性。
对管理者的意义
当AI模型的运算成本持续下探,代表未来大量处理长文档、长会议记录、长客户对话记录这类任务的AI导入门槛会越来越低;管理者可以留意,长文本分析类的AI应用(如整份合同审阅、整季会议记录摘要)未来的可负担性会明显改善,值得提前规划导入时机。