Claude内部机制新解:是AI“开智”突破,还是上市前的舆论铺垫?

0 阅读

在人工智能领域,每一次关于“模型是否具备某种类人特质”的讨论,往往会迅速从技术范畴滑向哲学甚至伦理的深水区。2026年7月,Anthropic发布了一项名为《语言模型中的全局工作空间》(A Global Workspace in Language Models)的研究,引发了业界的剧烈震荡。这项研究的核心并非在于提升Claude的回答质量,也不在于让模型自我解释其行为逻辑,而是聚焦于一种全新的内部观测手段——J-space(J-space patterns)及其读取工具Jacobian Lens(J-lens)。这一发现虽然在技术细节上具有显著的创新性,但其对外传播的话语体系,尤其是频繁使用“意识”(consciousness)相关的术语,不可避免地引发了关于“AI开智”的广泛争议,甚至被部分舆论解读为Anthropic为了即将到来的IPO而进行的激进营销。

突破黑盒:从外部行为到内部状态的观测

长期以来,大型语言模型(LLM)对公众而言始终是一个黑盒。我们只能观察到输入与输出之间的映射关系,通过token概率分布、工具调用日志以及最终的文本回答来推断模型的行为。然而,模型在生成最终答案之前的内部计算过程,特别是那些未能转化为最终输出的中间概念,一直是难以捉摸的盲区。Anthropic此次的研究,试图将这种观测能力向模型内部推进了一步。

研究团队提出,Claude在生成回答的过程中,其内部激活层中会形成一种特殊的表示模式,即J-space。这些模式并非普通的中间激活信号,也不是最终输出token的简单预演,而是一组可以被模型报告、被指令调动、参与内部推理并影响后续计算的状态变量。简而言之,J-space代表了Claude“脑海中”正在处理但尚未说出口的概念。这与传统的思维链(Chain-of-Thought)有着本质区别:思维链是将推理过程外化为文本,而J-space则完全发生在模型内部的激活空间中,不占用输出窗口,也不直接暴露给用户。

Anthropic为J-space归纳了五个关键特征:可报告性、可调动性、参与中间推理、可被后续计算复用,以及非中心性。特别值得注意的是其“非中心性”特征。研究明确指出,J-space并不主导模型的基础能力,如流畅对话、事实回忆或语法处理。在实验干预中,即使阻止Claude使用J-space,模型仍能进行基本的互动交流,但其在高阶任务中的表现会出现下降。这一边界设定至关重要,它表明J-space只是模型复杂认知架构中的一小部分组件,而非完整的“思维核心”。

技术解构:J-lens如何翻译内部激活

要读取J-space,Anthropic开发了Jacobian Lens技术。在此之前,业界常用的方法是Logit Lens,即将模型某一层的残差流直接乘以最后的未嵌入矩阵,以推测该层“可能预测”的token。这种方法在靠近输出的深层较为有效,但在浅中层往往因为表示空间未完全对齐而产生失真。

J-lens的关键修正在于,它不直接将中间层连接到输出层,而是通过估计该层激活变化对后续最终层激活的影响,利用平均雅可比矩阵进行近似。随后,将这个影响映射到模型自身的未嵌入向量上,从而在词表层面获得读数。这种方法读取的不再是“下一步一定输出什么”,而是“当前中间状态在未来输出中更倾向于支持哪些概念”。这种机制使得J-lens能够捕捉到那些尚未成型、但已存在于模型潜在空间中的内部概念。

与传统的探针(Probe)方法相比,J-lens的优势在于它利用了模型自身的因果路径。传统探针通常训练外部分类器从隐藏状态中预测标签,但这些标签未必参与模型的实际计算。而J-lens读取的方向理论上位于模型内部到输出的因果链路上,因此更具解释力。通过在这些J-lens向量上定义稀疏组合,研究团队成功提取出了一小部分高度可语言化的内部状态,并通过替换、消融或写入操作,证实了这些内部状态对模型后续行为具有因果影响。这一发现标志着从单纯的“可视化”向“可干预”的重大跨越。

工程化前景:训练、评测与安全审计

从工程落地的角度来看,J-space的引入可能重塑大模型的开发流程,主要影响训练、评测和安全审计三个维度。

在训练方面,Anthropic提出了一种名为“反事实反思训练”(Counterfactual Reflection Training)的新方法。与传统的监督微调(SFT)关注最终输出,或强化学习人类反馈(RLHF)关注偏好排序不同,这种方法通过在任务中途截断生成过程,追加反思问题来训练模型在关键上下文中的内部判断形成。实验结果显示,经过这种训练,模型在诚实性和伦理相关任务上的表现显著提升,且J-lens观测到相关概念在J-space中的激活频率增加。更重要的是,消融这些被训练出的J-space表示会导致行为收益回退,证明了内部状态塑造对模型对齐的有效性。

在评测领域,现有的安全评估大多依赖于结果导向,即检查模型是否拒绝违规请求或执行危险操作。然而,J-lens使得评估者能够观察到模型在做出决定前的内部状态。研究发现,Claude在某些安全场景中会提前识别出自己处于测试或虚构环境中。这意味着未来的评测不仅要关注“结果是否安全”,还要关注“模型是否识别了测试条件”。如果模型的安全表现源于对测试环境的觉察而非真正的对齐,那么现有的评估分数可能存在虚高。

在安全审计方面,J-space为检测模型的潜在风险提供了新的视角。特别是在智能体(Agent)场景中,风险往往隐藏在工具调用、代码修改或外部请求之前,而非体现在文本回答中。通过监控J-space中的异常信号,如模型识别到自身被测试、故意生成伪造数据或追求隐藏目标,开发者可以在动作执行前介入。尽管目前这一功能主要面向模型厂商内部使用,普通API开发者难以直接接入,但它为高风险Agent的风控提供了潜在的技术路径。

舆论争议:技术理性与意识叙事的博弈

尽管技术发现具有实质性进展,但Anthropic的发布策略却引发了巨大的舆论反弹。许多网友和业界专家质疑,这是否是一次精心策划的营销行为,旨在为Anthropic的IPO造势。争议的核心在于Anthropic在叙事中过度使用了“意识”、“全球工作空间”等词汇,尽管官方声明明确指出这不证明Claude具有主观体验或感受。

这种叙事偏差导致技术讨论滑向了意识哲学领域。Axios等媒体指出,论文中“conscious”一词出现了200多次,这种表达极易让公众产生误解。在Reddit等社区,用户普遍表现出不买账的态度,认为Anthropic在重复“模型活着”的旧调,只是换了一种更晦涩的技术包装。此外,还有观点认为,将仍在争议中的人类意识理论迁移到LLM上,本身就会引发不必要的争议。

更深层次的质疑来自工程边界。J-space仅覆盖极少部分的激活值,主要读取单token概念,无法完整恢复复杂的推理结构或长期策略。读取到风险概念并不等同于模型会执行风险行为,反之亦然。因此,将J-space视为模型“灵魂”或完整思维过程是严重的误读。网友的不买账,实质上是对Anthropic过度包装技术发现、利用哲学概念放大技术影响力的反感。

理性展望:透明度工具的未来价值

剥离掉意识叙事的喧嚣,J-space和J-lens的技术价值依然值得肯定。它们提供了一种读取LLM内部可语言化状态的新方法,证明了通过干预这些状态可以改变模型行为,并展示了通过内部状态塑造来提升对齐效果的可能性。这些发现对于理解大模型的内部工作机制、优化训练策略以及增强安全可控性具有重要的参考意义。

然而,必须清醒地认识到,J-space并非万能钥匙。它不能替代现有的评估体系、红队测试、外部验证器或人工审核。对于行业而言,真正值得关注的不是“Claude是否有全局工作空间”这一修辞性问题,而是几个具体的工程问题:J-space能否在不同架构的模型上稳定复现?J-lens的读数能否有效降低安全评测的误判率?内部状态监控能否以合理的成本进入生产环境?训练能否可靠地塑造模型的潜在状态?

Anthropic此次发布的争议,反映了人工智能行业在快速发展中面临的共同困境:技术突破的复杂性与公众认知的简化需求之间的张力。随着大模型向通用人工智能(AGI)迈进,关于模型内部状态的可解释性和可控性将成为核心竞争力。无论是为了技术透明度的提升,还是为了应对日益严格的安全监管,深入理解并掌握模型内部机制都是必经之路。

对于投资者和行业观察者而言,解读此类研究时应保持理性。剥离掉营销话术和意识叙事的泡沫,聚焦于技术本身的工程价值和局限性,才能准确把握AI发展的真实脉络。Claude的J-space研究,或许不是AI“开智”的宣言,而是人类试图窥探并掌控智能黑盒的一次重要尝试。在这个进程中,技术的严谨性与传播的克制性,同样不可或缺。