AI数据中心新瓶颈:网络拥堵成算力释放关键

80次阅读
没有评论

共计 1129 个字符,预计需要花费 3 分钟才能阅读完成。

看点
重点阅读

AI 时代的数据中心, 正在被网络“卡脖子”丨 ToB 产业观察

📌 GPU 在等数据: 算力空转的真相

  • 重点: 芯片算力的增长速度, 已经远远超过了数据在芯片之间搬运的速度。
  • 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
  • 重点: 后续仍需关注官方更新、落地范围以及实际反馈。

更严重的是, 在资源最密集的大语言模型训练任务中 , 因网络问题导致的训练失败率高达 21%。每五次训练就有一次因网络中断而失败, 一次中断可能意味着数小时甚至数天的计算成果付诸东流。中科曙光高级副总裁李斌算过一笔账: 传统 CPU 计算节点一台机器配一张网卡即可, 但如今以 GPU 为中心的计算节点需要配置八张甚至更多网卡, 数据中心高速网络用量相比原来提升了 10 到 20 倍。

🔍 传统网络架构的局限

今天的 AI 大模型训练集群, 单端口流量已逼近 400G, 但传统网络的负载均衡算法依然停留在“逐流 ECMP”时代。这种模式将每条数据流通过哈希算法分配到某条链路, 而 AI 训练的流量模式需要成千上万个 GPU 同时发起通信, 流量如潮水般涌来, 哈希算法根本来不及反应, 结果就是部分端口满载、部分端口闲置的资源错配。

面对这一矛盾, 一个本能反应是堆硬件: 堆更高速的光模块、更大端口的交换机、更粗的铜缆 。从 400G 到 800G 再到 1.6T, 接口速率每隔一两年翻一倍, 但这条看似直接的路正越走越窄。是德科技网络应用安全部门技术经理杨益锋表示, 带宽翻倍的速度远远追不上模型规模翻倍的速度, 而带宽提升带来的成本、功耗和散热压力是指数级增长的。不少企业在落地 AI 网络时踩过同一个坑: 买了最先进的高速交换机和高性能光模块, 一跑大模型训练, 算力利用率远未达标。一位互联网大厂的基础设施负责人透露, 设备采购花了几个亿, 实际跑起来发现三分之一的算力都损耗在网络等待上。

💡 新方向: 从堆硬件到优化调度

在此背景下,LLR 与 CBFC 这两项技术开始被 AIDC 运营方关注 。LLR 把重传机制下沉到链路层, 让交换机自己发现丢包、自己重传, 把恢复时间从毫秒压到微秒级;CBFC 则可以理解为“网络红绿灯”系统, 发送端在发数据之前先确认接收端有足够的缓存空间, 避免数据发过去被丢弃。今年 3 月, 是德科技与 Broadcom 在 OFC 2026 上完成了业界首个基于超以太网联盟规范、在 800GE 线速下实现 LLR 和 CBFC 的公开互操作性演示, 标志着这两项技术从实验室走向互联互通。但从协议到大规模现网部署, 仍需精细化的参数调优。

📊 验证是关键: 测通非真通

围绕“AI 时代的数据中心, 正在被网络“卡脖子”丨 ToB 产业观察”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0