AI导航

DeepSeek 开源昇腾版推理组件:国产算力补上关键一环

AI资讯
3 min read
4 次阅读

DeepSeek 在 2026 年 9 月 30 日通过官方微信公众号宣布,开源面向华为昇腾算力平台的六个基础设施组件:TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect。这套组件与 DeepSeek 此前为英伟达平台开源的工具一一对应——在国产 NPU 上做大模型推理,第一次有了 DeepSeek 官方出品的高性能工具链。

这次开源了什么

六个组件各管一摊:DeepGEMM 负责矩阵乘法算子,DeepEP 负责训练和推理中的集合通信,FlashMLA 和 DeepSelect 分别对应多头潜在注意力与稀疏注意力的高效实现,TileKernels 是基于 TileLang 的算子库,TileLang 则是写这些算子的编译工具。它们都是 DeepSeek 自家模型在生产环境里真实在用的东西,不是演示性质的代码。

GitHub 上 deepseek-ai 组织已经建仓,DeepGEMM-Ascend 和 DeepEP-Ascend 两个仓库分别在 9 月 29 日和 30 日创建。DeepGEMM-Ascend 的 README 写明这是 DeepGEMM 向昇腾平台的移植,API 与原版完全兼容,支持 BF16、FP8、FP4 精度的 GEMM,以及 MQA logits、MegaMoE 等算子,首批在昇腾 950 上开发验证,需要 CANN 9.20 工具链和 torch_npu。News 栏第一条就是"2026.09.30:DeepGEMM Ascend 初始版本发布"。

和英伟达版本是什么关系

最关键的一句是"完全 API 兼容"。开发者原来在英伟达卡上用 DeepGEMM 写的代码,换到昇腾上基本不用改,装个包、沿用原来的开发流程就行。移植层把昇腾 MAD(矩阵乘加)原语的分形布局、对齐约束、地址计算这些脏活包了起来,同时用上了稀疏数据加载、基于协程的流水线这类昇腾特有的优化手段,目标是让算子跑到接近硬件极限的性能。README 里也直言,这些实现可以作为昇腾平台极致性能优化的参考。

对开发者和行业意味着什么

国产算力这几年补硬件补得快,缺的一直是软件生态,尤其是这种能把硬件吃干抹净的底层库。之前想在非英伟达卡上把推理成本打下来,开发者往往要自己造轮子。现在 DeepSeek 把自家吃饭的家伙直接开源,等于把"国产 NPU 跑大模型"的工程门槛砍掉一大截。

放在出口管制的大背景下看,这一步的信号意义很明确:国产算力的替代故事,正在从"有卡可用"进入"好用、便宜"的阶段。接下来值得盯的三件事:社区在昇腾 950 上的实测性能能不能兑现 README 里"接近硬件极限"的说法;vLLM、SGLang 这类主流推理框架跟进适配的速度;以及 TileLang 在昇腾上的成熟度,它决定了第三方开发者能不能自己写出同样快的算子。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。