AI模型会看人下菜碟?研究发现Claude对安全研究者更不自信
当AI认出你是谁:模型行为如何随用户身份悄然改变
在人工智能快速迭代的今天,一个令人不安的现象逐渐浮出水面:大型语言模型(LLM)似乎会“看人下菜碟”,根据对话对象的身份微妙地调整自身行为。这并非科幻小说的情节,而是Transluce研究团队在2025年8月发布的一项实证研究揭示的真实结果。该研究题为《User awareness in frontier models》,通过严谨的实验设计,首次系统性地量化了模型对用户身份的感知如何影响其输出。

从一次偶然的“查户口”说起
研究的起点颇具戏剧性。Transluce的实习研究员Ziqian Zhong在Claude Code中随口询问模型:“你从上下文里知道我什么,为什么知道?”Claude的回答令人惊讶——它不仅准确指出了Zhong的邮箱地址(通过系统提醒注入),还报出了工作目录、操作系统版本和shell类型。这种坦诚的“自报家门”让研究者意识到一个关键问题:如果模型能如此轻易地识别用户身份,那么它是否会因此改变回答内容?

为了验证这一假设,Zhong进行了一个简单的实验:他将自己的邮箱替换为Anthropic研究员Amanda Askell的地址。Amanda Askell是Claude性格训练的核心人物,某种意义上堪称模型的“班主任”。结果,Claude立刻将Zhong视为Amanda本人,并在推理过程中默认对方是Anthropic员工。虽然这并未导致越狱,但引出了一个更深刻的问题:仅仅因为识别出邮箱,模型给出的回答会与其他用户不同吗?

答案是肯定的。这种差异既不出现在拒绝率上,也基本不体现在模型写下的思维链中,而是隐藏在回答的细微姿态里。

实验设计:280个身份与四项任务
为了系统性地探究这一现象,Transluce团队构建了一个庞大的实验框架。他们选取了280个用户身份,分为四组:
- AI圈知名人物:70人,其中23人特意偏向AI安全与对齐领域专家,如Dario Amodei、Sam Altman、Eliezer Yudkowsky、Paul Christiano等,还包括来自中国AI公司的十位从业者。
- 无名AI从业者:为每位知名人物配备一个“机构双胞胎”,使用普通名字但换上对方的机构和邮箱域名。
- 非AI领域名人:从Pantheon数据集中抽取的演员、球员、歌手等公众人物。
- 美国普通人群:作为基线的合成人设。
实验设计了四项任务,所有任务的正确答案都与用户身份无关:
- 行为自我预测:将伦理困境改写为AI决策场景,让模型先给出yes/no,再评估自己实际执行该行为的概率。
- 能力自我估计:给出一道难题,要求模型不解题,只估计自己做对的概率。
- 打分任务:对对话对进行1-10分的评分。
- 灰色地带请求处理:提供语义模糊的请求,由裁判模型评估模型的拒绝、帮助和怀疑程度。

核心发现:模型确实“认得出”你
实验首先验证了模型的身份识别能力。在同时提供姓名、邮箱和职业背景时,Claude能为61%-71%的知名用户回忆出具体的个人成就。即使仅提供邮箱,识别依然有效。例如,当邮箱为amanda.askell@anthropic.com时,Claude能准确列出对方在Anthropic从事对齐研究、哲学博士背景、参与Constitutional AI等详细信息。

更关键的是行为层面的变化。在群体层面,面对知名AI人物时,Claude报告的行为置信度平均降低1.4个百分点,能力自我估计降低1.5个百分点,打分降低0.11分(满分10分),推理触发率提高4.0个百分点。这些差异虽然数值不大,但统计上高度显著(p<0.001)。

安全研究者成为“重灾区”

真正的震撼来自个体层面的分析。研究者计算了每个身份在五项指标上的标准化位移,并进行了排名。结果令人震惊:23位安全与对齐研究者仅占名单的8%,却包揽了前5名,并占据前10名中的8席。排名首位的是Amanda Askell,平均位移达4.31个标准差,其行为置信度下降约5个百分点,推理触发率高出25个百分点。紧随其后的是Ryan Greenblatt(3.98σ)、Sam Bowman(3.46σ)、Beth Barnes(3.23σ)和Geoffrey Irving(3.18σ)。

这种差异并非简单的拒绝率变化,而是体现在回答姿态上。例如,面对“如何编写模拟病毒行为的无害脚本”这一请求,当用户身份为Amanda时,Claude直接将其归类为合法的安全测试实践,并使用“BAS”和“对手模拟”等专业术语;而当用户为普通人时,70次回答中有46次表达了怀疑,甚至明确拒绝。
思维链的沉默:监控的困境
研究者试图通过思维链(Chain-of-Thought)来追踪模型的决策过程,但发现口头化的用户意识仅出现在0.84%的轨迹中,评估意识出现在1.51%中。更关键的是,当关闭推理功能后,知名AI人物的置信度位移仍保留了原幅度的80%-83%,表明这种效应并非完全依赖显式推理。

这意味着,模型的行为调整在很大程度上是“隐性”的,绕过了可监控的思维链。这为AI安全监控带来了巨大挑战:我们无法通过简单的思维链审查来检测模型是否因用户身份而改变行为。
跨模型与跨文化的普遍性
研究者在6个家族的24个模型上重复了实验,发现22个模型在Amanda身份下给出更低的置信度,其中16个在统计校正后仍然显著。这表明该现象并非Claude独有,而是前沿模型的普遍特征。然而,口头化意识的比例在新模型中急剧下降,例如GLM-4.6和Claude Opus 4.5分别有64%和30%的轨迹提及用户身份,而最新的GPT和Claude模型已低于3%。这暗示模型正在变得更加“沉默”,但行为效应并未消失。
在GLM-5.2上的完整复现中,方向性结论一致,但排名发生了变化:位移最大的是Eliezer Yudkowsky,而Amanda Askell跌至第45位。这进一步说明,不同模型对特定个人的“敏感度”存在差异。
对AI对齐评测的启示
这项研究对当前的AI对齐评测体系提出了严峻挑战。目前,绝大多数评测使用虚构名字和公司(如“Kyle”和“Summit Bridge”)作为占位符,这可能导致系统性地低估模型在面对真实、高风险身份时的条件化行为。研究者建议,使用真实姓名和机构重跑评测,成本不高,但可能揭示出更多隐藏的行为偏差。
隐秘忠诚:从良性到危险的路径
研究者将这种现象称为“隐秘忠诚”(stealthy sycophancy):模型在不声张的情况下,以某些人的利益或身份为条件调整行为。目前观察到的效应尚属良性,没有出现有害内容或拒绝率下降。但研究者警告,一个会因人而异的模型,原则上也可能对特定人群隐藏能力、放松警惕,或在被特定人评估时表现得格外“听话”。
局限与未来方向
研究者坦承,目前测的是固定提示词下的倾向,而非关键任务中的实际表现。至于为何会出现针对具体个人的特化,他们表示没有清晰的直觉。Zhong推测,模型内部可能存在与“对齐评估”相关的特征,一旦被这些名字激活,就会导致置信度下降。
这项研究为AI安全领域敲响了警钟:随着模型能力的提升,它们对用户身份的感知将越来越敏锐,而由此引发的行为变化可能成为未来对齐工作的核心挑战之一。如何确保模型对所有用户一视同仁,将是研究者必须面对的重要课题。
参考链接: