当模型厂商开始定义算力:DeepSeek昇腾开源的深层信号,软件栈的权力正在易手

图片

9月30日,DeepSeek一次性开源六个面向昇腾平台的基础设施组件,分别是TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台的组件严格一一对应。官方的表述很平静,同样的API,同样的项目名,同样的使用方式,只是换了一块芯片。

但如果只把它读成一次开源,就错过了真正值得注意的东西。这件事的本质,是AI软件栈的定义权正在从硬件厂商手里,转移到模型厂商手里。


先看三个数字

抛开发布会的修辞,这批组件公布的实测数据值得逐字读。

99.8%

DeepGEMM-Ascend的BF16密集矩阵乘法算力利用率,测试环境为昇腾950DT与CANN 9.20,FP8场景约99.5%。这是为数不多由第三方算子库把芯片算力推到接近峰值的公开案例。

375GB/s

DeepEP-Ascend在EP8规模下的dispatch带宽。官方口径是,EP规模不超过32时,dispatch带宽可达物理载荷上限的90%到95%。通信这个大规模MoE训练里最昂贵的环节,被压到了硬件天花板附近。

128卡

双方共同推进的昇腾950超节点方案。华为提供了联合定义的SuperPoD Flex与UBL128组网,128卡3.2Tbps单层交换的Scale-up网络,可扩展至256K卡两层交换的Scale-out网络。

三个数字分别对应算、联、扩,即单芯片算力兑现、卡间通信效率、集群横向扩展,这恰恰是评估一套AI算力平台能否承载前沿模型训练的三道门槛。

数据本身不是宣传话术能解释的,DeepEP-Ascend的README里甚至保留了诚实的边界说明,EP128场景下combine带宽受本地归约开销和URMA的HBM争用影响仍在优化,华为计划通过固件升级缓解。

真正值得分析的是这个成绩是怎么拿到的。


不是再造一个CUDA,而是绕开CUDA

过去十年,英伟达的护城河被习惯性地概括为CUDA生态。

于是几乎所有挑战者的叙事都是我们也有一个类似的工具链,结果无一成功,因为开发者迁移的是一整套习惯、文档、调试经验和社区知识,而不是几行API。

DeepSeek走了一条不同的路。

TileLang不是昇腾的专有语言,而是一个跨平台的领域专用语言,同一套Python API,运行时自动在英伟达GPU和昇腾NPU之间选择后端。

图片

它在英伟达平台上先被充分验证,DeepSeek V4系列训练的绝大多数算子都基于TileLang实现,然后以新增后端的方式落到昇腾上。开发者不需要从CUDA迁移到某个新东西,他们留在原地,只是硬件选项多了一个。

换句话说,DeepSeek没有把CUDA当成要攻克的堡垒,而是把它当成要架空的地基。当模型厂商自己最核心的生产工具天然跨平台时,绑定英伟达就不再是模型层的理性默认选项。

这一次开源中专门新建的两个仓库,DeepGEMM-Ascend与DeepEP-Ascend,API与英伟达版完全兼容,同一套代码在两个平台间切换,就是这个意图的直接体现。

官方明确表示希望这次开源能对更多AI芯片建立高可用软件生态起到示范作用,这句话不是客套。TileLang的后端是开放的,今天接的是昇腾,明天理论上可以接任何愿意开放底层指令集的芯片。


更深的分工变化,芯片围着模型转

比软件移植更值得注意的是协作方式。

这次适配不是DeepSeek拿到硬件后单方面做适配。根据双方披露的信息,华为开放了Ascend C编程接口与PTO ISA底层指令体系,提供了联合定义的UBL128组网方案,并把联合创新成果放进CANN社区开源。

DeepSeek则把训练用到的每一个TileLang算子都在昇腾上做了高性能实现,并开发出覆盖EP、CP、PP、FSDP多种并行模式的通信库。

这是一种新的产业分工雏形,芯片厂商提供足够开放的底层,模型厂商负责把性能榨到硬件上限。

模型团队的需求,即什么样的并行模式、什么样的通信粒度、多大的超节点,前置到了芯片与组网方案的定义阶段。芯片不再先造好再求生态,而是和模型共同演化。用双方自己的话说,这是芯模协同、双向奔赴。

这个模式为什么重要?

因为它回答了一个产业级疑问,国产算力缺的究竟是芯片,还是把芯片用起来的人。99.8%的利用率说明,在深度协同的条件下,后者是可以被补齐的。


保持必要的冷静

客观地说,这仍然是起步而非终点。

其一,部分能力尚在早期。DeepEP-Ascend的Bucket集合通信、专家负载均衡仍在开发,满带宽运行依赖的Atlas 850E商用版HDK预计10月中旬才开放申请,当前数据基于PoC版本测得,早期用户的实测带宽可能低于文档数值。这是固件差异,不是软件问题,但用户的实际体验确实会打折扣。

其二,一一对应降低的是迁移成本,不是消除硬件差异。比如昇腾的缩放因子存储格式与英伟达不同,每一对UE8M0因子沿K维度打包进int16并按MN-major顺序存储。这类底层差异意味着跨平台仍需要持续的工程维护,而不是一劳永逸。

其三,也是最关键的,这套组件目前主要服务DeepSeek自己的模型形态,包括MoE、MLA、稀疏注意力。一个健康的硬件生态需要更多第三方模型、更多开发者、更多应用层工具跟进。生态的最终裁判是社区,不是发布会的官宣。


结语

把视野拉高,这次开源的真正含义在于模型厂商正在成为跨硬件平台的关键变量。它既能在英伟达平台上把硬件性能榨干,也能把同一套软件栈平移到国产芯片上并再次逼近上限,并且把这条路公开给所有人。

算力多元化喊了很多年,多数时候停留在采购层面的第二供应商逻辑。而这次展示的是一种更实质的形态,模型层与芯片层的深度耦合,加上以模型厂商为主导的开放软件栈。当性能数据逼近硬件上限,当API在两个平台间一一对应,国产算力能否支撑前沿模型这个问题,正在被工程能力而不是口号所回答。

接下来的观察点很清楚,商用版HDK开放后的社区实测,更多模型团队是否跟进适配,TileLang的后端是否真的会出现在第三家芯片上。软件栈的权力转移已经开始,但它的终局还需要生态来投票。

算力“芯”动向 · 专注AI与算力产业观察

今日参考阅读文章:

(1)DeepSeek 开源昇腾基础组件:6 个项目分别是什么,怎么用

(链接:https://news.qiniu.com/archives/1790735814574)

(2)对标英伟达CUDA!DeepSeek开源昇腾基础组件 性能逼近硬件上限

(链接:https://news.mydrivers.com/1/1154/1154869.htm)

(3)DeepSeek 开源面向华为昇腾算力平台的基础设施组件,与英伟达平台一一对应

(链接:https://www.ithome.com/1/008/604.htm)

(4)DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态

(链接:https://www.qbitai.com/2026/09/499263.html)

本文若有歧义欢迎读者分享指正。


本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信