共计 1210 个字符,预计需要花费 4 分钟才能阅读完成。
在加州圣克拉拉举行的 AI 基础设施峰会上 ,AI 内存的未来成为焦点话题。三星电子抛出了一项颇具野心的目标: 借助下一代 AI 内存 zHBM, 把 AI 加速器的响应速度提升到现有水平的十倍。
📌 从每秒 100 词元到 1000 词元
三星电子美国公司负责存储产品规划的高管金仁东在峰会上给出了具体参照。他提到, 当前对话式 AI 系统大约每秒为每位用户处理 100 个词元, 而三星希望把这一数字推到每秒 1000 个词元, 从而为智能体类应用提供支撑。
从已披露信息看, 这一变化更值得关注的, 不只是表面动作本身, 还包括其对后续行业节奏、用户预期和市场竞争的连锁影响。
实现这一跃升的关键, 是三星上个月发布的 zHBM。按照金仁东的比喻, 这项技术相当于“在酒店客房里安装一部直达一楼大堂的专用电梯”——把 HBM 直接垂直堆叠在 AI 加速器之上, 缩短数据往返路径。
🔍 zHBM 与 zNAND-O 的路线图
三星公布的数据显示,zHBM 的性能最高可达到 HBM5 的 8 倍, 能效则可达其 3 倍。这一指标如果落地, 将直接关系到 AI 加速器在推理和智能体场景下的吞吐表现。
💡 CXL 的定位为何遭到质疑
与三星的高调目标形成对照, 常被视为 HBM 补充方案的 CXL 技术在会上受到一些与会者的质疑。CXL 是一种下一代内存互连标准, 可让计算设备连接更多内存、为服务器扩容, 也能让不同服务器共享内存,AI 加速器则通过 CPU 访问这些内存。
但 OpenAI 负责 AI 加速器设计的研究员丹尼尔·莫里斯对此持保留态度 。他表示, 就 AI 模型的实际运行而言, 找不到 CXL 能用在哪里; 如果一定要找用途, 那就是存放大型 AI 模型中很少用到的冷数据。他承认外界对 CXL 抱有期待, 但至今没有看到专门面向模型运行的实际应用。
英特尔 AI 片上系统架构负责人维迪娅·蒂亚加拉詹也指出, 用 CXL 整合内存确实有益 , 但它补充的是辅助存储, 无法替代 HBM;GPU 之间通过 CXL 传输数据, 速度远远比不上 HBM。
📊 观察:HBM 主导者或继续受益
从这场讨论可以看出,AI 内存的竞争正在从“堆容量”转向“缩短路径、提高能效”。三星把 zHBM 直接堆叠在加速器上的思路, 押注的是极致带宽与响应速度; 而 CXL 即便能降低扩容成本, 短期内也难以撼动 HBM 在模型运行中的核心位置。
如果 CXL 难以取代 HBM, 那么主导 HBM 市场的三星电子和 SK 海力士, 有望继续保持良好的发展势头。对行业而言, 真正的看点在于:zHBM 能否按计划兑现 10 倍响应的承诺, 以及 zNAND-O 在 2028 年的样品会带来怎样的存储层级变化。
- 核心目标: 三星希望把 AI 系统响应速度提升 10 倍, 从每秒 100 词元迈向 1000 词元。
- 技术抓手:zHBM 将 HBM 垂直堆叠在 AI 加速器上, 性能最高达 HBM5 的 8 倍、能效达 3 倍。
- 路线图: 三星计划自 2028 年起提供 zNAND-O 样品。
- 争议焦点:CXL 被视为 HBM 补充方案, 但被质疑难以替代 HBM。