共计 1106 个字符,预计需要花费 3 分钟才能阅读完成。
推理芯片赛道正在变得拥挤。Groq 达成技术授权协议并吸纳创始人 Jonathan Ross 团队, 被外界视为一次变相收购;Cerebras 以晶圆级“大芯片”登陆资本市场;OpenAI 联手博通推出首款自研推理芯片, 从设计到流片仅用 9 个月。加上谷歌 TPU, 推理芯片的牌桌上已坐满玩家。
📌 训练与推理: 两种截然不同的算账逻辑
- 重点: 想跳出局部最优, 就得先想好放弃什么。
- 重点: 当前公开信息主要集中在产品、策略或节奏变化上。
- 重点: 后续仍需关注官方更新、落地范围以及实际反馈。
训练芯片追求极致算力, 因为训练本身没有直接回报 , 本质是赌一个最强模型, 再靠未来推理收回投入。推理则不同, 用户为每百万 token 付费, 成本涵盖芯片采购与电力消耗, 因此推理芯片的核心指标是性价比。
更关键的是计算密度的差异。 训练阶段有海量数据与充足并行度 , 可以充分利用算力; 而推理的解码阶段必须逐 token 生成, 每产出一个词都要把整个模型权重从存储介质读入计算单元。这意味着推理对内存带宽的需求远超训练。
🔍 三条路径:Groq、Cerebras 与 OpenAI 的取舍
Groq 与 Cerebras 都预见到 Transformer 之前,AI 系统对带宽的巨大需求 , 并共同选择 SRAM 作为存储介质。SRAM 可直接做在计算芯片内部, 带宽极高, 但代价是容量极小——同样数据量,SRAM 所需芯片面积是 DRAM 的数十倍。
面对容量瓶颈, 两家公司走向不同方向 。Groq 把调度放在编译阶段, 提前排布所有计算与通信, 运行时不再调度;Cerebras 则把数百颗芯片塞进一块晶圆, 用物理距离的缩短换取通信效率。OpenAI 联手博通则代表第三条路: 从模型需求反推芯片设计, 追求软硬一体。
💡 行业观察: 异构与带宽是长期命题
推理芯片并非单一品类。prefill 阶段适合 GPU 的大算力并行 ,decode 阶段则需要更高性价比的带宽方案。理想系统可能是异构组合:GPU 处理算力密集部分, 专用芯片处理解码。Groq 被英伟达吸纳后, 这种异构协同反而更被看好。
想跳出局部最优, 就得先想好放弃什么。SRAM 路线放弃的是单芯片容量, 换来的是带宽数量级的提升。
从谷歌 TPU 到亚马逊 Trainium, 每一代芯片的 SRAM 都在变大 , 行业正朝同一方向收敛。但端侧推理受物理空间与功耗限制, 可能催生 3D DRAM 等新思路。
📊 总结
推理芯片之争, 表面是架构路线之别 , 本质是对未来工作负载的判断之争。Groq 押注编译期调度,Cerebras 押注晶圆级集成,OpenAI 押注软硬协同。谁能在带宽、容量与成本之间找到最优解, 谁就能在推理时代占据关键位置。