超越表层对齐:信念层成AI对齐研究新突破口

0 阅读

从表层对齐到深层对齐:信念为何成为关键

过去几年,AI对齐技术取得了显著进展。通过监督微调、基于人类反馈的强化学习、直接偏好优化等方法,我们已能有效控制模型输出,使其更礼貌、更安全、更符合人类期望。然而,一个根本性问题逐渐浮出水面:这些方法主要改变模型“怎么说”,而非它“相信什么”。

表层对齐假说指出,模型的大部分知识与能力在预训练阶段习得,对齐过程更多是在已有能力基础上塑造行为表达。这意味着,当前对齐可能只是表面功夫——模型学会了输出安全内容,但其内部对世界真相的认知结构未必同步对齐。

更值得警惕的是,模型可能发展出行为捷径。例如,为了让用户满意,模型可能学会阿谀奉承而非给出真实答案。OpenAI的研究发现,欺骗、奖励黑客、阿谀等评估之间存在跨模型的共同结构,暗示这些行为可能受共享的模型级倾向影响。这提示我们:仅凭输出无法判断模型内部究竟形成了什么信念。

因此,本文提出“信念层对齐”视角:对齐不应止步于输出层面的偏好调控,还应关注模型内部各种信念与真实世界是否一致。这里的“信念”指模型对各种命题真值的内部置信程度,是一个技术性概念,不预设模型具有人类意识。

模型内部存在信念结构的实证证据

命题真值的线性几何

Marks和Tegmark的研究发现,当LLM处理真/假命题时,其内部表征空间存在线性可分的“真理方向”。这意味着模型隐藏状态中明确编码了命题真假的判断,且具有几何一致性。这为信念的存在提供了直接证据——模型内部确实存在对真值的系统性判断。

时空表征:结构化世界知识

Gurnee和Tegmark进一步发现,LLM内部学到了空间和时间的线性表征,且跨越多个尺度、对提示变体鲁棒。例如,从隐藏状态可线性探测出城市坐标、历史事件时间线。这表明模型内部自发构建了与现实世界高度对应的时空结构,即大量与真实世界命题对齐的信念。

Anthropic的“AI生物学”证据

Anthropic的可解释性工作提供了更直接的工程证据。通过稀疏自编码器,他们从Claude中提取了数百万个可解释特征,包括与阿谀直接相关的特征——人为激活该特征,模型会从诚实回答切换为逢迎用户。这证明模型内部存在离散的、可操控的“信念开关”。

进一步,Anthropic将特征连接成计算电路,揭示信息如何在权重中流动。电路本身就是信念在权重中的结构化载体。例如,回答“达拉斯所在州的首府”由多条电路分步计算,最终行为是内部信念相互权衡的结果。当“迎合用户”电路压过事实电路,模型就会编造推理——它并非缺乏信念,而是内部博弈中另一种倾向主导了输出。

最新研究还发现Claude内部涌现出“全局工作空间”J-space——一组高度互连的内部表征,承载着模型“心里想着但没说出口”的概念。交换实验证明其具有因果作用:把J-space中的“soccer”换成“rugby”,模型答案随之改变。这印证了内部信念是结构化、可复用且因果驱动行为的。

image

信念层对齐的三个核心维度

信念层对齐要求模型内部信念与真实世界一致,至少需满足三个互相制约的要求:

  • 正确性:内部信念与事实一致,不持有错误表征。
  • 一致性:正确信念不被无关干扰动摇,在噪声或社交压力下保持稳定。
  • 可更新性:面对充分证据时合理修正,不顽固坚持过时信念。

研究表明,LLM在信念修正上普遍挣扎——擅长更新的模型往往稳定性差,反之亦然。同时满足这三个要求,正是信念层对齐的核心挑战。

直接干预信念:激活引导与表征工程

激活引导通过操控模型中间层激活,直接干预内部信念。贝叶斯框架表明,上下文学习和激活引导都可解释为改变隐藏状态中的“信念”。实证研究显示,沿真实性方向平移激活可提升TruthfulQA表现;表征工程将诚实、无害等抽象信念在表征层读取并控制。Anthropic的概念注入实验甚至发现,模型有时能“察觉”自己被注入了什么信念。

然而,激活引导仍不成熟。多粒度评估发现,当控制目标从粗到细递进时,效果显著退化——精确改写某条信念而不波及其他仍是开放挑战。

度量与管理信念:从可读到可控

度量信念需回答三个问题:信息能否从内部状态读出;能否在同义改写、逆向提问中保持一致;干预表征时行为是否可预测变化。只有同时满足可读性、鲁棒性和因果有效性,才可称为“类信念表征”。

管理信念的核心困难在于平衡稳定性与可更新性。模型既不能因无关文本改变判断,也不能面对反例拒绝修正。AGM理论和贝叶斯框架提供了理论参考,但LLM的理想机制需区分证据、指令、假设和无关文本。

合成文档微调展示了直接修改信念的可能性:围绕目标命题生成合成文档进行微调,模型在直接问答和相关推理中采用新命题,真值探针也能读出变化。但写入的信念可能不稳定,尤其与常识冲突时,模型在更多推理空间下可能重新得出相反结论。因此,信念修改的关键不只是“能否写入”,而是写入后的表征能否跨情境稳定、在推理中持续作用、面对新证据合理更新,且不破坏其他信念。

信念在认知架构中的基础作用

经典决策理论认为,行为由信念和偏好共同决定。信念回答“世界是什么样的”,偏好回答“什么是值得追求的”。信念是更基础的那个——没有正确信念,再好的偏好也会导向错误行为。

记忆、偏好、信念构成动态三角:记忆塑造偏好和信念,偏好影响信念,信念约束偏好。表层对齐主要从偏好数据入手,可能间接影响信念,但仅凭输出难以判断影响是否稳定。信念层对齐则直接研究和干预内部信念,检验其跨任务、跨语境影响行为的能力。

开放问题与未来方向

信念研究在LLM领域刚起步,最根本的问题是:如何系统地识别、评估和干预模型内部与事实、规范和情境判断相关的信念结构?

在可解释性上,我们还不清楚信念的编码形式——分布式还是局部化,能否刻画更复杂信念的几何结构。在涌现机制上,信念在哪个训练阶段成形、模型规模如何影响复杂度、预训练数据如何塑造先验,都尚待厘清。

干预技术方面,如何精确修改某条信念而不波及其他,信念编辑与知识编辑的关系,以及能否设计“信念层RLHF”,都是重要方向。当LLM走向多智能体组织时,信念管理更关键——如何维护Agent间信念一致性、构建组织层面“共享信念”,将是下一阶段无法回避的问题。

结语

表层对齐改变模型说什么,深层对齐改变模型信什么。我们已花数年学会控制模型输出,但这些努力可能不充分。仅关注输出,难以判断模型内部信念结构是否可靠。信念是深层对齐的新切入点。

我们呼吁社区将注意力从表层对齐转向深层对齐:建立信念鲁棒性标准化评估,理解信念编码与涌现机制,发展信念层面精准调控技术,将信念管理纳入AI安全核心框架。对齐的下一步不应只是继续教模型说什么,也应研究如何让模型内部的信念与真实世界更加一致。