DeepSeek 開源昇騰工具鏈:TileLang 編譯器正面挑戰 CUDA 護城河
DeepSeek 於 9 月 30 日開源華為昇騰基礎軟體套件,包括 TileLang 編譯器,以及 DeepGEMM、DeepEP、FlashMLA 等核心元件的昇騰版,並與華為聯合優化 128 卡 Ascend 950 超節點方案。這一步直接挑戰 NVIDIA CUDA 的軟體生態優勢。
2026 年 9 月 30 日,DeepSeek 透過官方微信公眾號宣布開源一套針對華為昇騰(Ascend)晶片的基礎軟體套件。Bloomberg、SCMP、Reuters、Techzine 等媒體隨後報導證實了這個消息。這次開源的內容有三大部分:
- TileLang 編譯器(昇騰版):把昇騰晶片底層的 Ascend C 指令封裝起來,定位是「比 CUDA 更簡單的 AI 晶片程式語言」。TileLang 先前已經在 NVIDIA 平台上驗證過,能支援 DeepSeek V4 系列訓練時所需的大多數運算子。
- 核心元件昇騰版:DeepGEMM(矩陣運算)、DeepEP(專家並行通訊)、TileKernels、FlashMLA(注意力運算)、DeepSelect,五項元件推出昇騰版本。
- 超節點方案:華為全程支援,與 DeepSeek 聯合優化 128 卡 Ascend 950 超節點方案。
技術意義:把「換晶片」的門檻降下來
NVIDIA 能在 AI 晶片市場稱霸,真正的關鍵不只是硬體效能,還有經營了近二十年的 CUDA 軟體生態。工程師的程式碼、函式庫、優化經驗全都綁在 CUDA 上,換一家晶片就等於重寫一次,這個轉換成本就是 NVIDIA 的護城河。
TileLang 的做法是在晶片上方多加一層較簡單的語言,先在 NVIDIA 平台驗證,這次補上昇騰後端,讓開發者可以沿用同一套寫法轉向昇騰,大幅降低移植門檻(各晶片後端實務上仍需各自調校)。再加上 DeepSeek 把訓練 V4 所用的多項關鍵元件——DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect——推出昇騰版,外界開發者等於拿到一套已經被大型模型實戰驗證過的工具,而不只是一顆晶片。
與過去比較:從「能跑」到「好用」
過去中國本土 AI 晶片最常被批評的是「硬體能跑,但軟體難用」。華為雖然有自家的 CANN 軟體堆疊,但開發者生態遠不如 CUDA。這次的差別在於,由頂尖模型公司親自提供工具鏈,並與晶片廠聯合調校超節點規模的部署方案,補上的正是生態系最缺的那一塊。
背景方面,據報導 DeepSeek 另外下單約 16 萬顆 Ascend 950DT,用來建設內蒙古 1GW 級資料中心,顯示這不是一次性的技術展示,而是長期押注昇騰的戰略選擇。
業界解讀:算力供應鏈走向多元
多家外媒將此視為中國 AI 產業降低對 NVIDIA 依賴、挑戰 CUDA 護城河的重要一步。在美國出口管制下,中國業者取得高階 NVIDIA 晶片的管道受限,自建軟硬體生態成了必要選項。對全球市場來說,這也代表 AI 算力可能逐漸形成「CUDA 陣營」與「昇騰陣營」兩套並行的供應鏈。
對管理者的意義
這則新聞提醒管理者,真正的護城河往往在軟體與生態,不在硬體本身;而競爭者要突破,也常從「降低轉換成本」下手。對導入 AI 的企業來說,未來算力與模型的供應來源會更多元,採購與系統規劃時不宜把自己鎖死在單一供應商。特別是在泰國這類同時接觸中美兩方技術的市場,保留彈性、定期檢視供應鏈風險,會比押注單一陣營更穩健。