解码现代大语言模型中的Engram机制:超越传统嵌入的记忆增强技术

0 阅读

在当代大语言模型(Large Language Models, LLMs)的架构演进中,一种被称为“Engram”的机制正逐渐引起研究者与工程师的关注。尽管其名称带有神经科学色彩——在生物学中,“engram”指代记忆的物理痕迹——但在人工智能语境下,它并非神秘的黑箱,而是一种高度工程化的嵌入增强技术。理解Engram的关键在于跳出“记忆”这一模糊隐喻,转而将其视为对传统token嵌入系统的结构性扩展,旨在解决标准Transformer架构在处理局部序列信息时所面临的固有瓶颈。

image

现代LLM的核心通常由两大部分构成:注意力机制(Attention)与前馈网络(Feed-Forward Networks,常以MoE或稠密层形式存在)。注意力负责整合序列中的长距离依赖关系,而前馈网络则承担了绝大部分的语义建模任务——从语法结构到世界知识,再到抽象推理。然而,这种分工也带来了显著负担:前馈网络必须在有限的参数空间内编码海量的语言现象。尤其当输入被分词器(Tokenizer)切分为多个子词单元(subword tokens)时,一个完整语义单元的概念会被分散到多个不相关的token嵌入中。例如,“demonize”可能被拆分为["De", "mon", "ize"],每个部分拥有独立的嵌入向量。模型必须依赖注意力机制将这些碎片重新关联,并通过前馈网络“推断”出整体含义。这一过程不仅低效,且对模型的学习能力提出了极高要求。

image

Engram机制正是为缓解这一问题而生。其核心思想极为简洁:不再仅对单个token进行嵌入,而是对连续的token序列(如bigram、trigram等)进行联合嵌入。具体而言,系统会为输入序列中的每一个位置生成一个或多个n-gram(n≥2),并通过哈希函数将其映射到一个预定义大小的嵌入表中。例如,在句子“The cat ran fast”中,若采用trigram Engram,则会在位置0生成“The cat ran”,在位置1生成“cat ran fast”,并分别查询对应的嵌入向量。这些向量随后与原始token嵌入及注意力输出融合,共同构成该位置的最终表示。

image

从形式上看,Engram嵌入表与标准词汇嵌入表并无本质区别——它们都是查找表(lookup table),将离散标识符映射为稠密向量。但关键差异在于规模与索引方式。标准嵌入表的行数等于词汇表大小(V),而一个完整的bigram嵌入表理论上需要V²行,trigram则需V³行。以当前主流模型动辄10万以上的词汇量计算,V²即达百亿级别,这在存储与计算上完全不可行。因此,实际实现中必须引入哈希技巧(hashing trick):将n-gram序列通过哈希函数压缩到一个远小于理论最大值的固定维度表中。这意味着不同n-gram可能映射到同一行,即发生“哈希碰撞”(hash collision)。

image

为降低碰撞带来的信息混淆风险,现代Engram方案普遍采用多重哈希策略。例如,使用多个独立的嵌入表,每个表配备不同的哈希函数。虽然单个表内碰撞不可避免,但多个表的联合输出在统计上更可能保持唯一性。此外,如DeepSeek和Meituan等团队提出的方案倾向于构建层级化Engram结构,同时包含bigram与trigram(甚至更高阶),但赋予不同阶数不同的权重或容量。这种设计基于一个经验观察:自然语言遵循Zipf分布——极少数高频序列占据大部分出现次数,而绝大多数n-gram组合极为罕见。因此,模型无需为所有可能的组合分配参数,只需重点覆盖高频模式即可获得显著收益。

然而,稀有序列的存在也带来了新的挑战。对于几乎从未在训练数据中出现的n-gram(如“Doomed Buffalo Explosion”),其对应的Engram嵌入行可能从未被有效更新,或被其他高频但语义无关的序列所“污染”。若强行使用此类低质量嵌入,反而会干扰模型判断。为此,Engram机制通常配备“置信度门控”(confidence gating)模块。该模块通过某种可学习的机制(如轻量级神经网络或统计指标)评估当前n-gram嵌入的可靠性。当置信度低于阈值时,系统会自动抑制或完全忽略该Engram信号,转而依赖传统的token嵌入与注意力机制进行推理。反之,对于高频且稳定的序列(如“She looked at”),Engram则能提供强而一致的语义先验,显著减轻前馈网络的建模负担。

这种“高频固化、低频回退”的策略,使得Engram本质上成为一种条件性记忆(Conditional Memory)——它并非通用记忆库,而是专门用于存储和检索典型语言模式的高效缓存。值得注意的是,这种记忆是“冻结的”(frozen):一旦训练完成,Engram嵌入表通常不再更新(或仅微调),其内容代表了模型在训练阶段学到的稳定语言规律。这与人类记忆的动态重构特性截然不同,也解释了为何将其称为“记忆”容易引发误解。

从系统角度看,Engram的引入带来了一系列工程权衡。一方面,它通过将部分语义建模任务从计算密集型的前馈网络转移到查表操作,提升了推理效率——尤其是在处理常见短语时。另一方面,额外的嵌入表增加了模型体积,且哈希碰撞与门控机制引入了新的超参数与复杂性。更重要的是,Engram的有效性高度依赖于训练数据的分布。若目标任务涉及大量领域特定或低频表达(如法律文书、古籍文献),Engram的收益可能大打折扣,甚至产生负面影响。

尽管如此,Engram代表了一种重要的架构创新方向:通过显式建模局部序列结构来释放主干网络的抽象能力。传统Transformer将所有语义整合任务交由统一的前馈网络处理,而Engram则在输入端就对高频组合进行“预编译”,使主干网络能更专注于高阶推理与泛化。这与计算机体系结构中的缓存(Cache)设计理念异曲同工——用空间换时间,用冗余换效率。

近期研究进一步验证了这一思路的价值。例如,《Scaling Embeddings Outperforms Scaling Experts in Language Models》一文指出,在同等计算预算下,扩大嵌入层(包括Engram)比增加专家数量(MoE中的experts)更能提升模型性能。这暗示了在LLM扩展过程中,表示能力的增强可能比计算路径的多样化更具边际效益。而《Conditional Memory via Scalable Lookup》则系统性地论证了Engram作为新型稀疏性轴(axis of sparsity)的潜力——它允许模型在不显著增加激活参数的情况下,扩展其对语言模式的覆盖范围。

展望未来,Engram机制可能与其他技术深度融合。例如,与动态稀疏注意力结合,形成“局部固化+全局灵活”的混合表示;或与检索增强生成(RAG)协同,将外部知识库的高频事实以Engram形式注入模型。此外,如何自适应地调整n-gram阶数、哈希表大小及门控策略,也将成为自动化机器学习(AutoML)在LLM架构搜索中的新课题。

总而言之,Engram并非魔法,而是一种务实的工程解决方案。它直面Transformer在局部上下文建模中的短板,以可控的复杂度代价换取显著的效率与性能提升。在追求更大、更强语言模型的竞赛中,这类“微架构”层面的创新,或许比单纯堆叠层数或参数更具可持续性。理解Engram,就是理解现代LLM如何在抽象推理与具体模式之间寻找精妙平衡——这不仅是技术细节,更是智能系统设计哲学的体现。