GPU利用率成AI Infra新战场:推理需求爆发下,软件优化比买卡更关键

87次阅读
没有评论

共计 1092 个字符,预计需要花费 3 分钟才能阅读完成。

Analysis

“榨”出硅的极限: 怎么让 GPU 不“闲着”?

当 AI 应用越跑越多, 行业开始意识到: 真正稀缺的不只是 GPU, 还有让 GPU 少“空转”的能力。 在训练大模型之外, 推理正在成为算力消耗的长期主场, 也把 AI Infra 推到了更核心的位置。

📌 推理需求上升, 算力压力从一次性训练转向持续服务

大模型训练往往是阶段性投入, 而推理不同 。聊天机器人、代码助手、智能体和企业级 AI 应用一旦上线, 就会持续产生请求。应用越多、调用越频繁,GPU 要处理的推理任务也越密集。

因此, 许多公司一边增加数据中心和 GPU 采购, 一边也在寻找更现实的办法: 在既有硬件上提升利用率 。相比重新设计芯片或扩建机房, 软件层面的优化周期更短, 也更容易直接体现在成本和吞吐上。

🔍 GPU 看似繁忙, 实际可能在等待

一个容易被忽略的问题是,GPU 并不等于一直在计算 。从用户请求进入系统, 到模型加载、网络传输、内存管理、任务调度和结果返回, 任何环节卡住,GPU 都可能处于等待状态。

公开研究曾对大规模 AI 集群进行细粒度观测, 发现部分 GPU 执行时间和能耗消耗在等待上 。尤其在推理场景中, 空转问题更容易放大, 因为请求形态复杂、上下文长短不一, 并发变化也更频繁。

💡 AI Infra 四层架构决定 GPU 能跑多满

  • 能源基础设施: 电力与散热决定 GPU 能否稳定持续运行。
  • 计算硬件:GPU、HBM、高速互联和 CPU 共同决定理论算力上限。
  • 系统软件:CUDA、编译器、通信库、内存管理和算子库影响计算效率。
  • 服务编排: 推理引擎、请求调度、资源管理决定任务如何被组织和执行。

其中, 电力、散热和硬件互联属于改造周期较长的“硬问题”; 系统软件和服务编排则更偏工程与算法优化 , 往往能在相对短的时间内带来明显提升。这也是 vLLM、SGLang 等推理框架受到关注的重要原因。

📊 缓存复用与调度优化, 正在减少“重复计算”

在大模型推理中, 一个典型浪费来自重复计算 。相同的系统提示词、工具描述或上下文片段, 可能在智能体工作流中被反复输入。如果每次都从头计算, 就会产生额外成本。

KV Cache 复用正是为了解决这个问题。 它把模型已经计算过的 Key/Value 张量缓存下来 , 后续生成新 token 时尽量复用历史结果, 从而降低解码计算量, 并改善首 token 延迟。不过,KV Cache 也会占用显存, 在长上下文和高并发场景下可能成为新的瓶颈。

🚀 行业观察:AI Infra 正在变成商业竞争力

  • 提升同等 GPU 数量下的吞吐能力, 缓解“缺卡”压力;
  • 降低单次推理成本, 让 AI 应用更容易规模化;
  • 改善请求延迟, 提升用户体验;
  • 让中小模型团队不必完全依赖自研底层系统。
以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0