DeepSeek 在 2026 年 9 月 30 日通过官方微信公众号宣布,开源面向华为昇腾算力平台的六个基础设施组件:TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect。这套组件与 DeepSeek 此前为英伟达平台开源的工具一一对应——在国产 NPU 上做大模型推理,第一次有了 DeepSeek 官方出品的高性能工具链。
这次开源了什么
六个组件各管一摊:DeepGEMM 负责矩阵乘法算子,DeepEP 负责训练和推理中的集合通信,FlashMLA 和 DeepSelect 分别对应多头潜在注意力与稀疏注意力的高效实现,TileKernels 是基于 TileLang 的算子库,TileLang 则是写这些算子的编译工具。它们都是 DeepSeek 自家模型在生产环境里真实在用的东西,不是演示性质的代码。
GitHub 上 deepseek-ai 组织已经建仓,DeepGEMM-Ascend 和 DeepEP-Ascend 两个仓库分别在 9 月 29 日和 30 日创建。DeepGEMM-Ascend 的 README 写明这是 DeepGEMM 向昇腾平台的移植,API 与原版完全兼容,支持 BF16、FP8、FP4 精度的 GEMM,以及 MQA logits、MegaMoE 等算子,首批在昇腾 950 上开发验证,需要 CANN 9.20 工具链和 torch_npu。News 栏第一条就是"2026.09.30:DeepGEMM Ascend 初始版本发布"。
和英伟达版本是什么关系
最关键的一句是"完全 API 兼容"。开发者原来在英伟达卡上用 DeepGEMM 写的代码,换到昇腾上基本不用改,装个包、沿用原来的开发流程就行。移植层把昇腾 MAD(矩阵乘加)原语的分形布局、对齐约束、地址计算这些脏活包了起来,同时用上了稀疏数据加载、基于协程的流水线这类昇腾特有的优化手段,目标是让算子跑到接近硬件极限的性能。README 里也直言,这些实现可以作为昇腾平台极致性能优化的参考。
对开发者和行业意味着什么
国产算力这几年补硬件补得快,缺的一直是软件生态,尤其是这种能把硬件吃干抹净的底层库。之前想在非英伟达卡上把推理成本打下来,开发者往往要自己造轮子。现在 DeepSeek 把自家吃饭的家伙直接开源,等于把"国产 NPU 跑大模型"的工程门槛砍掉一大截。
放在出口管制的大背景下看,这一步的信号意义很明确:国产算力的替代故事,正在从"有卡可用"进入"好用、便宜"的阶段。接下来值得盯的三件事:社区在昇腾 950 上的实测性能能不能兑现 README 里"接近硬件极限"的说法;vLLM、SGLang 这类主流推理框架跟进适配的速度;以及 TileLang 在昇腾上的成熟度,它决定了第三方开发者能不能自己写出同样快的算子。