DeepSeek V4未纳入Engram:条件记忆为何仍被视为下一代关键模块

106次阅读
没有评论

共计 1211 个字符,预计需要花费 4 分钟才能阅读完成。

看点

Engram 去哪了?

重点阅读

DeepSeek V4 最大的遗憾

DeepSeek V4 发布后 , 一个意外的“缺席者”引发了技术圈关注:Engram。 在 V4 技术报告中,mHC、CSA、HCA、Muon、FP4 等关键词都能找到, 唯独没有此前被不少人寄予厚望的条件记忆模块 Engram。

📌 为什么 Engram 的缺席被放大

Engram 最早在今年 1 月由 DeepSeek 与北京大学联合开源,论文聚焦大模型的“记忆”与“效率”问题。它的核心思路并不复杂: 对于一些相对静态、可检索的知识, 模型不必每次都动用深层网络重新计算, 而是可以通过查表方式快速取用。

这也是外界将它与 DeepSeek V4 联系起来的原因。若模型能够把“事实记忆”和“复杂推理”分开处理, 深层网络就有机会把更多能力留给推理、代码、数学等更高阶任务。

🔍 Engram 到底解决什么问题

传统 Transformer 在处理实体、短语或固定知识时,往往需要多层网络逐步抽取特征。Engram 尝试将 N -gram 式的局部依赖捕获能力嵌入模型, 在特定层之间加入记忆模块, 通过哈希查找从大规模嵌入表中取回向量。

同时, 门控机制会判断取回的信息是否适合当前上下文,避免把不相关记忆强行注入。它与 MoE 的关系也值得注意:MoE 更偏向“计算稀疏化”, 而 Engram 更像“存储稀疏化”, 两者理论上可以互补。

  • 目标:减少静态知识重复计算。
  • 方式:用哈希查表调用条件记忆。
  • 潜在收益:节省显存与计算, 把深层网络释放给复杂任务。
  • 工程特点:索引具有确定性, 适合提前计算和异步预取。

💡 没有进入 V4, 但研究仍在推进

虽然 V4 报告中没有出现 Engram,但相关路线并未停止。材料显示, 过去数月已经出现多项围绕 Engram 的后续探索, 方向覆盖系统部署、哈希冲突优化验证以及视觉模态扩展。

其中,CXL 内存池化方向尝试回答一个现实问题: 如果 Engram 这类超大记忆表成为模型组件,应该放在哪里。相关研究将 GPU HBM、本地 DRAM 与 CXL 共享内存池分层使用, 并在多机环境下验证了可行性。

另一个工作则更偏实验反证: 研究者尝试为高频 N -gram 构建无冲突“热层”,但在严格参数控制下并未得到稳定收益。这意味着, 直觉上“消除冲突一定更好”的优化方向, 至少还不能被简单成立。

📊 值得关注的几个看点

  • 看点一:条件记忆能否在更大规模模型中稳定带来收益。
  • 看点二:超大记忆表的存储、带宽和预取机制能否被工程化解决。
  • 看点三:它是否会与 MoE、长上下文、低精度训练等技术形成组合。
  • 看点四:从文本扩展到视觉等多模态场景后, 收益是否依然成立。

🚀 总结:V4 的遗憾, 也可能是下一代的伏笔

但从后续研究看,Engram 的价值并未停留在概念层面: 有人在解决内存池化, 有人在验证优化假设, 也有人在尝试跨模态迁移。它是否会出现在后续版本中, 目前没有确定答案; 但围绕“让模型少算静态知识、多做复杂推理”的方向, 已经成为值得持续观察的架构线索。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0