ARTICLE · 人工智能
参数化 Memory 漫谈(纯干货)
一语总结本文系统梳理了参数化 Memory 的概念脉络,从自迭代视角出发,讲解 MAML、FFN 结构、知识神经元以及 ROME/MEMIT 等参数编辑方法,探讨其在 LLM 中的实现与限制。
文章首先从 LLM 自迭代的角度定义 Memory 为经验压缩后的更新方向,接着介绍 MAML 如何通过双层记忆机制将历史任务经验压缩成便于快速适应的参数初始状态,并对比其与普通预训练的区别。随后探讨 Transformer 参数中 FFN 层的 key-value 结构、知识神经元的定位实验,以及 ROME、MEMIT 等基于低秩更新的事实编辑方法,分析它们在泛化、局部性、多次编辑干扰等方面的挑战。全文结合理论推导与实验证据,系统阐述了参数化 Memory 的形成、存储与写入途径,指出当前技术仍受事实关联形式、计算成本和模型结构的限制。
- 自迭代的核心问题是把海量经验压缩成可执行的更新方向。
LLM 需要先理解错误、归因错误、聚类错误,再将分散经验压缩为可复用的更新方向,这正是 Memory 的核心功能。
- MAML 通过双层记忆系统将历史任务经验压缩成便于快速适应的参数初始状态。
慢记忆保存跨任务共性,快记忆来自新任务少量样本;MAML 学到的不是最终答案,而是一个容易学会新任务的参数初始状态。
- Transformer 的 FFN 层在形式上接近未归一化的 key-value memory,可作为参数化 Memory 的结构入口。
第一层线性矩阵可理解为 keys,第二层为 values,输出是多个 value 的加权组合,高层 value 更易对应语义模式并影响输出词表分布。
- ROME 通过低秩更新将单个事实关联写入参数,MEMIT 进一步实现批量事实写入但暴露了泛化与局部性的权衡。
ROME 实现高效单点编辑;MEMIT 将写入分散到多个关键 MLP 层,提升规模却仍受事实关联形式、计算成本和模型结构的限制。
参数化 Memory 漫谈(纯干货)
文章首先从 LLM 自迭代的角度定义 Memory 为经验压缩后的更新方向,接着介绍 MAML 如何通过双层记忆机制将历史任务经验压缩成便于快速适应的参数初始状态,并对比其与普通预训练的区别。随后探讨 Transformer 参数中 FFN 层的 key-value 结构、知识神经元的定位实验,以及 ROME、MEMIT 等基于低秩更新的事实编辑方法,分析它们在泛化、局部性、多次编辑干扰等方面的挑战。全文结合理论推导与实验证据,系统阐述了参数化 Memory 的形成、存储与写入途径,指出当前技术仍受事实关联形式、计算成本和模型结构的限制。
文章金句
"自迭代的核心问题,是如何把海量经验压缩成可执行的更新方向。
"MAML 学到的不是一个最终答案,而是一个“容易学会新任务”的参数初始状态。(或者也可以说是中间状态)
"FFN 层在形式上接近一个未归一化的 key-value memory。
"ROME 把参数化 Memory 的问题推进到‘可写入’层面。
"MEMIT 证明了参数写入可以从单点编辑扩展到批量编辑,但也暴露了参数化 Memory 的边界。