共计 1275 个字符,预计需要花费 4 分钟才能阅读完成。
对话徐直军: 被低估的灵衢, 重新理解 AI 算力
当外界把目光聚焦在昇腾芯片路线图时,华为轮值董事长徐直军却提醒: 同场发布的灵衢互联协议被严重低估了。“去年我讲了互联协议, 但大家都关注芯片去了, 没人关注灵衢, 但灵衢是关键。”
📌 背景: 芯片之后, 连接成为新瓶颈
一年前, 华为公布昇腾 950 到 970 的路线图,回应了外界对 AI 芯片供给的担忧。如今昇腾 950 已上市,Atlas 950 超节点开始交付,25.6 万卡集群正在部署, 下一代 Atlas 960 进入测试。但徐直军认为, 芯片能否做出来只是第一步, 当处理器从几颗增加到数万颗, 如何让它们像一台计算机一样工作, 才是更根本的挑战。
大模型训练需要大量芯片频繁交换数据,一颗芯片算得再快, 也要等其它芯片完成工作。链路短暂异常就可能拖垮长时间运行的任务。买到多少峰值算力, 与最终能用上多少有效算力, 中间隔着整个系统。
🔍 核心信息: 灵衢与 Peerium 架构
本次全联接大会上,华为发布 Peerium 计算架构 , 通过嵌套并行、统一内存寻址和平等互联, 支撑百万级处理器协同。灵衢(UnifiedBus) 是实现该架构的关键互联技术, 全球首个采用 NPO 技术的昇腾 960 超节点也正式发布。
徐直军强调,不同厂家做的超节点区别巨大。处理器增加带来的收益, 往往被通信和协议转换开销抵消。华为的答案是把柜内、柜间、数据中心之间甚至一个 zone 之间的连接, 统一到一套高速总线协议下, 减少跨边界时的性能损失。
灵衢并非临时起意。2019 年互联被确立为计算系统架构战略方向,2020 年 7 月 Unified Bus 项目立项, 随后经历协议冻结、芯片投片、套片测试和系统验证。昇腾 910C 超节点采用 UB 1.0,950 采用 UB 2.0,960 将采用 UB 2.1。
💡 影响与看点:NPO 路线与生态开放
当速率提升,传统电连接面临距离和信号质量约束。华为选择 NPO(近封装光学), 将光引擎放在主芯片附近,Hi-ONE 模组与昇腾芯片间保留约五厘米铜连接, 其余转向光连接。徐直军称,NPO 是工程、成本、产业链分工与维护的平衡选择, 换来接近 40% 的成本下降和光引擎独立维护空间。
华为没有争论 NPO 与 CPO 的路线对错,而是基于自身在光器件、光模块和芯片上的积累, 很早达成共识。光向芯片靠近, 机柜之间反而可以拉开距离, 实现“疏朗地站, 紧密地算”。
- 可用性优先:华为通过近故障位置检错重传、替代路径和光源冗余, 减少底层问题对训练的影响。
- MFU 成为关键指标:徐直军反复提到模型浮点算力利用率, 称基于 UB 和 Peerium 的超节点可大幅提升 MFU, 已被验证。
- 供给节奏:950PR 已上市面向推理,950DT 预计年底或明年规模供货, 用于训练。
- 生态开放:华为开放 UB 协议, 希望产业界共同朝这条路线走, 为 AI 走向 AGI 共同努力。
📊 总结: 连接的价值正在被重新看见
围绕“对话徐直军: 被低估的灵衢, 重新理解 AI 算力”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。