专栏 AI 管理编年史 第 146/217 讲 查看课程目录

DeepSeek发布V3.2正式版与Speciale推理特化版:稀疏注意力机制成本效率再升级

01/12/2025 201
3:31
DeepSeek发布V3.2正式版与Speciale推理特化版:稀疏注意力机制成本效率再升级

DeepSeek于2025年12月1日发布DeepSeek-V3.2正式版,取代9月的实验版本,同步上架App、网页与API;另发布仅供API访问的DeepSeek-V3.2-Speciale推理特化变体,两者皆延续DSA稀疏注意力机制,推理深度与成本效率同步提升。

DeepSeek于2025年12月1日正式发布DeepSeek-V3.2,这是9月推出的实验版本DeepSeek-V3.2-Exp的正式继任者,已同步上架DeepSeek App、官方网页与API三个渠道,普通用户与开发者均可即时使用。同一天,DeepSeek另外发布了DeepSeek-V3.2-Speciale,这是一款专攻推理能力深化的变体模型,目前仅开放API访问,尚未进入App或网页界面。

根据DeepSeek官方文档,V3.2正式版与Speciale变体均延续了V3.2-Exp首次引入的DSA(DeepSeek Sparse Attention,稀疏注意力)机制。这项机制的核心概念,是让模型在处理长文本或复杂推理链时,不必对每一个token都进行完整的注意力运算,而是有选择性地聚焦于关键信息,借此降低运算量。官方指出,两款新模型在推理深度、自主代理(agentic)任务表现,以及成本效率上,较此前版本进一步提升。

从实验版到正式版:三个月的验证周期

V3.2-Exp在9月以“实验版”姿态问世时,市场普遍将其视为DeepSeek测试稀疏注意力机制可行性的试金石。经过约三个月的实际使用与内部调校,DeepSeek选择在12月将其转正为V3.2,并同步铺开至全通路,显示这套稀疏注意力架构已通过稳定性验证,而非停留在实验室阶段。这种“先实验版小范围测试、再正式版全面上架”的节奏,也是近期主要模型厂商共通的发布模式。

Speciale的定位:窄而深的推理专攻线

与同步发布的正式版V3.2不同,Speciale变体目前仅限API访问,没有走进消费端的App或网页界面,这意味着它的目标受众是开发者与企业客户,而非普通终端用户。这种“主线模型顾全面、专攻变体仅供API”的产品策略,与其他厂商将高阶推理能力优先开放给付费开发者的做法相近,反映出推理能力的强化目前仍属于较昂贵、需要精细调用的能力,厂商倾向先在B端场景验证应用价值。

对管理者的意义

稀疏注意力机制带来的成本效率提升,意味着企业导入AI进行长文档分析、复杂报告生成等高运算量任务时,有望用更低成本取得同等甚至更好的推理品质;管理者评估AI供应商时,除了看模型能力排行,也值得留意这类底层架构优化如何转化为实际的运营成本差异。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Mistral AI发布Mistral 3系列:675B参数旗舰模型全面开源

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策