DeepSeek 开源昇腾工具链:TileLang 编译器正面挑战 CUDA 护城河
DeepSeek 于 9 月 30 日开源华为昇腾基础软件套件,包括 TileLang 编译器,以及 DeepGEMM、DeepEP、FlashMLA 等核心组件的昇腾版,并与华为联合优化 128 卡 Ascend 950 超节点方案。这一步直接挑战 NVIDIA CUDA 的软件生态优势。
2026 年 9 月 30 日,DeepSeek 通过官方微信公众号宣布开源一套面向华为昇腾(Ascend)芯片的基础软件套件。Bloomberg、SCMP、Reuters、Techzine 等媒体随后报道证实了这一消息。此次开源的内容包括三大部分:
- TileLang 编译器(昇腾版):把昇腾芯片底层的 Ascend C 指令封装起来,定位为“比 CUDA 更简单的 AI 芯片编程语言”。TileLang 此前已在 NVIDIA 平台上完成验证,可支持 DeepSeek V4 系列训练所需的大多数算子。
- 核心组件昇腾版:DeepGEMM(矩阵运算)、DeepEP(专家并行通信)、TileKernels、FlashMLA(注意力运算)、DeepSelect,五项组件推出昇腾版本。
- 超节点方案:华为全程支持,与 DeepSeek 联合优化 128 卡 Ascend 950 超节点方案。
技术意义:把“换芯片”的门槛降下来
NVIDIA 能在 AI 芯片市场称霸,真正的关键不只是硬件性能,还有经营了近二十年的 CUDA 软件生态。工程师的代码、函数库、优化经验全都绑定在 CUDA 上,换一家芯片就等于重写一遍,这种迁移成本就是 NVIDIA 的护城河。
TileLang 的思路是在芯片之上再加一层更简单的语言,先在 NVIDIA 平台验证,这次补上昇腾后端,让开发者可以沿用同一套写法转向昇腾,大幅降低迁移门槛(实际上各芯片后端仍需分别调优)。再加上 DeepSeek 把训练 V4 所用的多项关键组件——DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect——推出昇腾版,外部开发者相当于拿到一套已被大模型实战验证过的工具,而不只是一颗芯片。
与过去相比:从“能跑”到“好用”
过去国产 AI 芯片最常被诟病的是“硬件能跑,但软件难用”。华为虽然有自己的 CANN 软件栈,但开发者生态远不如 CUDA。这次的不同在于,由顶尖大模型公司亲自提供工具链,并与芯片厂商联合调优超节点规模的部署方案,补上的正是生态中最缺的那一块。
背景方面,据报道 DeepSeek 另外下单约 16 万颗 Ascend 950DT,用于建设内蒙古 1GW 级数据中心,说明这不是一次性的技术展示,而是长期押注昇腾的战略选择。
业界解读:算力供应链走向多元
多家外媒将此视为中国 AI 产业降低对 NVIDIA 依赖、挑战 CUDA 护城河的重要一步。在美国出口管制下,中国企业获取高端 NVIDIA 芯片的渠道受限,自建软硬件生态成为必选项。对全球市场而言,这也意味着 AI 算力可能逐步形成“CUDA 阵营”与“昇腾阵营”两套并行的供应链。
对管理者的意义
这则新闻提醒管理者,真正的护城河往往在软件与生态,而不在硬件本身;竞争者要突破,也常从“降低迁移成本”入手。对引入 AI 的企业来说,未来算力与模型的供应来源会更加多元,采购与系统规划时不宜把自己锁死在单一供应商上。尤其在泰国这类同时接触中美两方技术的市场,保留弹性、定期评估供应链风险,会比押注单一阵营更稳健。