DeepSeek开源昇腾全套基础设施:这不是适配,是一次“搬家”

4次阅读
没有评论

共计 1237 个字符,预计需要花费 4 分钟才能阅读完成。

「观察视角」
围绕事件本身、节奏变化与潜在影响展开。

国庆假期前夕,DeepSeek 开源了面向华为昇腾算力平台的一整套基础设施组件:TileLang 高级语言编译工具、高性能计算库与分布式通信库 , 与此前英伟达平台的开源组件基本一一对应。 这不是一次“能跑起来”的适配, 更像一次成体系的搬家。

📌 算力焦虑之下, 选择并不复杂

梁文锋在 7 月的一场闭门投资者会议上,把中美 AI 差距归结为一个变量——算力资源。他透露,DeepSeek 目前运营着约 2 万块英伟达 H 系列同等算力芯片, 而训练顶级前沿模型可能需要约 5 万颗 GB300; 若走昇腾 950 路线, 则约需 20 万颗。他甚至直言, 今年能花出去 200 亿元采购预算, 就算采购团队表现出色。

  • 现有算力: 约 2 万块英伟达 H 系列同等算力芯片
  • 前沿训练需求: 约 5 万颗 GB300, 或约 20 万颗昇腾 950
  • 现实困境: 芯片买不到, 价格还高

成本压力同样直接。DeepSeek V4-Pro 的 API 输入价格低至 0.25 元 / 百万词元, 与 GPT-5.5 Pro 的加权平均价相差超过 700 倍, 这种定价要求基础设施成本被压到极限。而昇腾新款推理芯片的采购价约为英伟达的四分之一, 单卡算力比其对华特供版提升 2.87 倍。

梁文锋对昇腾 950 超节点的评价是: 在性能和价格上完全可以平替 GB200 和 GB300。

🔍 TileLang 才是真正的底牌

从训练 V3 开始,DeepSeek 就在用自研的 TileLang 高级语言写算子, 而不是直接调用 CUDA,V4 系列大部分算子已基于 TileLang 实现。这层抽象上承模型训练逻辑, 下接芯片底层指令, 移植到昇腾时只需封装 Ascend C 指令, 开发者的代码逻辑几乎不必重写。

💡 不止一家公司在下注

  • 智谱 GLM-Image 成为首个完全基于昇腾与 MindSpore 全流程训练的 SOTA 多模态模型,GLM- 5 则全程使用昇腾 910C 训练
  • 阿里通义、字节豆包、百川智能等同步推进国产算力适配
  • 彭博行业研究调查显示, 中国企业计划未来 12 个月把 46% 的 AI 加速芯片预算投向国内芯片
  • 深圳基于昇腾 910C 的 1 万卡集群, 预约率已达 92%

📊 观察: 变量是生态, 不是单卡性能

一个值得注意的判断是: 软件工具链的可移植性,可能比芯片本身的性能差距更重要。CUDA 的护城河并不只在硬件, 而在十余年积累的开发者与代码库。如果 TileLang 能被足够多开发者接受, 迁移就可能简化成换一条安装命令, 这条绕开 CUDA 的通道才真正有意义。

但风险同样明确。昇腾 950DT 年产量仅几十万颗,DeepSeek 那笔 16 万颗的订单, 交付周期可能长达一年; 华为也承认产能受限, 下一代 900 系列将主要面向国内市场。产能跟不上, 生态的雪球就滚不起来。

🚀 结语

与其说这是一个“去英伟达化”的故事,不如说是一个关于选择权的故事。TileLang 能否成为国产算力生态的通用入口、超节点在真实训练中的稳定性如何, 都需要时间验证。但顶尖模型公司愿意把核心工具链成体系地搬到新平台, 本身就说明这条路已不再是备选方案。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码