心智世界建模:AI预测人类决策的下一个突破口

1 阅读

从一杯咖啡看AI的认知盲区

想象一个日常场景:A将杯子放入柜子,B并未目睹。若问B下一步会去哪里找杯子,一个仅掌握物理规律的世界模型会预测:“杯子在柜子里,B应去柜子找。”然而,一个理解人类心智的模型则会正确推断:“B不知道杯子被移动,仍认为杯子在桌上,大概率会回到桌边寻找。”

这个简单的例子揭示了当前AI系统的一个关键缺陷:只追踪物体、位置和运动的世界模型,可能得到“物理上合理、但行为错误”的预测。因为人的行为决策并非仅由外部环境决定,而是由外部环境与内部心智-社会变量的交互作用共同产生。

图片

世界模型缺失的另一半

现有的大多数世界模型主要关注世界的物理层面:有哪些物体和智能体?它们在哪里?可见场景将如何演化?在这些模型中,人往往只是一个会移动、会执行动作的对象,其内心状态并未真正进入模型。然而,对于以人为中心的智能而言,这远远不够。

例如,服务机器人需要判断用户是否困惑、失去耐心或间接求助;医疗助手需考虑患者的认知、风险感知、恐惧和信任;协作智能体则必须识别某些行为虽物理可行,但因社会规范或角色关系而不合适。这些场景都要求智能系统持续追踪智能体的心智与社会状态:它们知道什么、相信什么、关注什么、想要什么、打算做什么、感受到什么,以及认为哪些行为在社会规范上被允许。即使两个场景物理上完全相同,只要人的信念、目标、情绪或人际关系不同,就可能产生截然不同的行为。

一句话总结:一个世界模型即使能准确重建物理场景,仍可能无法正确预测人的行为。认知科学已通过心智模型、心智理论、BDI智能体模型等研究了这些能力,但当前AI研究要么构建缺乏心智状态的物理世界模型,要么将心理推理简化为孤立的心智理论问答任务。这两种视角都不足以描述一个真正完整的世界——因为世界的下一状态并非仅由物理因素决定,而是由物理状态与心智状态共同演化产生。

心智世界建模:形式化框架

牛津大学和新加坡国立大学的研究团队在论文《Mental World Modeling》中提出了心智世界建模(MWM)框架,旨在构建能同时表征物理动态与心智动态的世界模型。MWM的目标并非模拟私人主观意识,而是构建一个外部的、近似的、与任务相关的世界模拟器,其全局状态同时包含物理变量和心智变量。

图片

该框架维护一个物理-心智耦合的世界状态,即同时表征物理环境与智能体的潜在心智状态。对于每个目标智能体,MWM生成针对该智能体的局部观测视角——即这个人实际能看到、听到、知道并推断出的信息。随后,目标智能体基于此观察采取行动,而世界模型则模拟该行动如何同时改变物理世界中的客观场景和心智-社会世界中的状态配置。

图片

MENTIS:无需训练的参考实现

图片

为使框架可验证,团队实现了模块化参考系统MENTIS,一个无需训练且完全可观测的基准系统,迫使基于大语言模型的系统以心智世界模型的方式推理。MENTIS将决策预测过程分解为六个明确阶段:状态解析、目标观测生成、行为分解、物理-心智耦合状态转移模拟、分支级评估和最终决策。

图片

具体而言,系统首先将场景解析为具有类型结构的物理-心智状态;随后生成目标智能体可获得的局部观测;接着将每个候选行为分解为物理和心智影响;然后对每种行为分支模拟耦合的下一状态;最后从物理合理性、心智一致性、社会规范性三个维度评分,并通过确定性规则选择最终行为。MENTIS无需训练,因此结果反映模型结构本身的推理能力,而非拟合参数。每个阶段输出可机器验证的中间产物,便于记录、比较或替换。

实验验证:必要性、有效性与瓶颈

研究者设计了一系列实验,测试框架可能失效的环节。首先,显式心智世界建模对预测人类决策是必要的。在测试的8个基于LLM的世界模型中,直接回答的平均F1为63.3,完整MWM配置达到87.9;移除心智通道导致性能下降约12.1点,移除物理通道下降16.5点,分开预测两种状态转移下降6.4点。性能提升最大的是人际互动场景,因为这些场景的决策主要依赖隐藏的心智变量。例如,对gpt-5.6-sol,完整MWM将最终动作F1从66.5提升至92.9,增加26.4点。

图片

其次,诊断实验通过Oracle干预(将中间步骤替换为正确信息)来归因模型与人类的差异。结果显示,对gpt-5.6-sol,完整MWM为90.7,使用真实标注的状态转移能提高到94.2,带来+3.5的提升,是单项干预中最大的增益,仅此一项即可弥补人类性能差距的45%。这表明当前最大的剩余瓶颈是状态转移模拟,即模型预测物理-心智耦合世界如何变化的能力不足,为未来改进提供了明确方向。

图片

心智世界建模何时发挥作用最大

图片

MWM的应用价值不应通过“能列举多少社会领域”来衡量,因为几乎所有面向人类的系统都具有某种社会性。更准确的判断标准是:当一个行为的有效性取决于那些无法仅从物理场景中推断出来、但会决定人类如何感知、选择、接受、抵抗或学习的变量时,MWM才具有真正的价值。

从决策理论角度看,心智状态信息的价值可定义为:在能获取物理-心智耦合状态时所选最优干预与仅基于物理状态所选最优干预之间的期望效用差距。当信念、目标、注意力、信任、责任、情绪或社会规范会改变“哪种行为有益”时,这一差距显著;而当下一步行为几乎完全由物理可行性决定时,差距很小。例如,机械抓取控制器不需要MWM来完成“伸手抓杯”,但家庭服务机器人在决定“是否递杯给主人”时,需理解背后的心智与社会状态——这个行为是帮助、打扰、失礼、风险还是错误信息。

总结与展望

这项工作提出了心智世界建模的形式化框架,核心贡献有三点:一是提出MWM,在统一视角下融合物理与心智动态;二是提出MENTIS,无需训练的基准实现;三是开展系统性实证研究,得出两个核心结论:显式心智世界建模对预测人类决策是必要的,尤其在社交互动场景;当前瓶颈在于状态转移模拟能力不足。

未来研究可聚焦于改进状态转移模拟,例如通过更精细的认知模型或学习动态。此外,MWM框架可扩展至多智能体场景,并应用于人机协作、教育、医疗等领域。随着AI系统日益融入人类生活,理解并预测人类行为将成为核心能力,而心智世界建模为此提供了重要基础。