共计 1227 个字符,预计需要花费 4 分钟才能阅读完成。
推理成本砍掉一半以上,OpenAI 摸着 DeepSeek 过河
核心摘要: 在大模型竞争从“参数与能力”转向“成本与效率”的阶段 ,OpenAI 被曝正在推进一套新的推理优化方案。据报道, 该方案有望显著降低模型服务成本, 外界关注的焦点集中在 KV Cache 等内存效率优化上。
📌 推理成本成为 OpenAI 的新压力点
过去几年, 大模型公司持续追求更强能力、更长上下文和更复杂的 Agent 应用 , 但这些能力背后对应的是更高的推理账单。对于拥有庞大用户规模的 OpenAI 来说, 每一次模型响应都意味着 GPU、显存带宽和云计算资源的消耗。
材料显示,OpenAI 近年财务压力并不轻 。其 2025 年全年收入被披露为 130.7 亿美元, 而总成本和费用高达 340 亿美元, 运营亏损约 209 亿美元, 其中云计算相关支出占据重要部分。在这种背景下, 降低推理成本不只是技术优化, 更直接关系到商业模型能否持续。
🔍 KV Cache 为什么会成为优化重点
所谓 KV Cache, 可以理解为大模型在阅读上下文后保存下来的“中间笔记”。模型生成内容时通常是逐个 token 输出, 如果每生成一个 token 都重新计算前文, 成本会急剧上升。KV Cache 的作用, 就是让模型复用此前计算过的信息。
不过,KV Cache 通常需要放在 GPU 附近的高带宽显存中, 尤其是 HBM。它读写频繁、对延迟敏感, 不能像普通冷数据那样轻松转移到慢速存储。因此, 在长上下文、高并发场景下,KV Cache 会迅速占用宝贵显存资源。
💡 从提示词缓存到更深层系统优化
OpenAI 此前已经在开发者文档中引入 Prompt Caching 机制 。其思路是: 当多个请求使用相同前缀内容时, 系统可以复用已经计算出的中间结果, 而不必反复执行相同的 prefill 过程。官方曾提到, 这类机制可在特定场景下降低延迟和输入 token 成本。
此次被报道的新方案尚未公布完整技术细节, 但外界普遍将其与 KV Cache 压缩、复用、分页或内存调度优化联系起来。类似方向在行业内并非首次出现,DeepSeek 此前技术报告中的 MLA 机制就强调过通过压缩 KV Cache 提升推理效率。
- 长上下文: 缓存优化可降低大段文本反复计算带来的开销。
- 高并发: 同样显存容量下, 理论上可服务更多请求。
- Agent 应用: 多轮调用和长链路任务对推理成本更加敏感。
📊 硬件与软件两条线同时降本
除了软件层面的缓存优化,OpenAI 也在尝试通过硬件路线降低推理成本 。材料提到,OpenAI 与博通合作推出面向 LLM 推理的 AI 芯片 Jalapeño, 并与 Cerebras 签署了大规模推理算力协议。这些动作都指向同一个目标: 摆脱单纯依赖通用 GPU 带来的成本压力。
🚀 行业观察:AI 竞争进入“省钱能力”阶段
围绕“推理成本砍掉一半以上,OpenAI 摸着 DeepSeek 过”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。