專欄 AI 管理編年史 第 130/217 講 查看課程目錄

DeepSeek 發表 V3.2-Exp 實驗版:稀疏注意力機制把運算成本砍半

30/09/2025 214
3:15
DeepSeek 發表 V3.2-Exp 實驗版:稀疏注意力機制把運算成本砍半

DeepSeek於2025年9月30日發表V3.2-Exp實驗版,首度導入DSA稀疏注意力機制,長文件處理能力提升、運算成本降近半,效能與前代V3.1-Terminus相當,定位為下一代架構的過渡步驟。

2025年9月30日,中國AI實驗室DeepSeek發表最新實驗版模型DeepSeek-V3.2-Exp。這是在9月稍早發表的DeepSeek-V3.1-Terminus基礎上推出的過渡版本,官方在技術文件中明確將其定位為「邁向下一代模型架構的中間步驟」,而非一次正式的大改版。

此次發表的最大技術亮點,是首度在DeepSeek模型上導入DSA(DeepSeek Sparse Attention,稀疏注意力機制)。根據官方公布的資料,DSA的作用是讓模型在處理長文件、長對話時,不需要對輸入的每一段文字都做同樣份量的運算,而是有選擇性地聚焦在真正相關的部分。結果是模型處理長內容的能力提升,同時運算成本降低了將近一半。

技術意義:注意力機制的效率轉型

Transformer架構的標準注意力機制,運算量會隨輸入長度呈平方成長——文件越長,運算負擔越重,這也是長文件、長對話一直是大型語言模型的痛點所在。稀疏注意力機制的思路,是讓模型學會「該看哪裡」而非「每個字都同樣力道地看」,藉此用更少的運算資源達到接近的效果。DeepSeek這次把這個技術方向實際落地到可用模型上,是效率工程上的一步,而非單純堆更大參數量。

與前代比較:效能持平、成本減半

官方數據顯示,V3.2-Exp的整體效能表現與V3.1-Terminus相當,並沒有明顯躍進。這點很關鍵——這次發表的重點不是「更聰明」,而是「用一半的運算成本做到差不多聰明」。對於需要大量呼叫模型處理長內容(如大量文件摘要、長對話客服紀錄)的應用場景,這種效能持平但成本降低的版本,實際使用價值可能比效能小幅提升的版本更高。

業界反應:過渡版本釋放的訊號

DeepSeek官方自己將V3.2-Exp定調為「實驗版」與「過渡步驟」,而非正式旗艦版本,這種謹慎的命名與定位方式,也被視為釋放一個訊號:稀疏注意力機制未來很可能會成為DeepSeek下一代主力模型的核心架構之一,此次發表更像是先在社群與開發者間驗證技術可行性。

對管理者的意義

當AI模型的運算成本持續下探,代表未來大量處理長文件、長會議記錄、長客戶對話紀錄這類任務的AI導入門檻會愈來愈低;管理者可以留意,長文本分析類的AI應用(如整份合約審閱、整季會議紀錄摘要)未來的可負擔性會明顯改善,值得提前規劃導入時機。

適用產業: 製造業
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Grok Imagine v0.9測試版上線——xAI用Aurora引擎打通圖片到短片生成

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策