文本世界模型的新目标:让智能体行为一致,而非文本相似

1 阅读

预测偏差不可避免时,什么才是“关键”幻觉?

大语言模型(LLM)智能体在网页导航、工具调用或文本冒险等任务中表现越来越强。但要在真实环境中测试它们,成本很高:访问电商网站慢、贵,还可能触发不可逆操作,比如误下单。于是有人想到:能不能用另一个LLM来“扮演”环境?

图片

比如,智能体在模拟电商网站点击“搜索毛衣”,世界模型就生成一个搜索结果页;智能体选中某件商品,它再给出商品详情。这样,智能体就能在纯文本的模拟环境中做离线评估或提前规划,不用真的去碰真实系统。

图片

这类“文本世界模型”的核心问题来了:怎么才算好?

图片

目前几乎所有方法都指向同一个答案:生成的文本越像真实环境越好。训练时,要么用监督学习在真实轨迹上做逐token最大似然(MLE),要么用强化学习把F1、ROUGE-L或BERTScore这类文本相似度当作奖励信号。评估时也依赖这些指标。背后的逻辑很朴素:文本越真,模型越好;所有偏离真实的“幻觉”都是坏的,应该一视同仁地压制。

图片

但现实没那么理想。在几十步的长序列交互中,自回归预测的误差会不断累积——漏掉商品、写错价格、编造不存在的按钮,几乎无法避免。既然幻觉短期内消除不了,一个更实际的问题浮现出来:不同类型的幻觉,对智能体决策的影响真的相同吗?

图片

文本越像,智能体未必做得更好

想象两种幻觉输出:

  • 输出1:遗漏了用户要买的那件毛衣,但其他内容高度还原,BERTScore高达0.974;
  • 输出2:只漏掉了两件无关商品(比如连衣裙和围巾),BERTScore降到0.859。

从文本保真度看,输出1显然“更好”。但对智能体来说,输出1是致命的——它根本找不到目标商品,任务直接失败;输出2却毫无影响,照样能完成购买。

这就是论文揭示的“指标反转”现象:主流文本相似度指标不仅没识别出关键错误,反而严厉惩罚了无害的偏差,放过了致命的遗漏。更糟的是,这种反转不是个例。作者用受控扰动实验证明,F1、BERTScore、ROUGE-L,甚至让GPT-4o当裁判,全部排反了。只有他们提出的新指标BehR能正确排序,并提供稠密的梯度信号。

这说明了一个根本问题:文本保真度不等于功能正确性。现有世界模型的训练目标,其实一直没对齐智能体真正在意的东西。

从“状态一致”转向“行为一致”

既然比文本相似度行不通,换个思路:如果智能体在预测状态和真实状态下做出一样的决策,这个预测就是好的

论文将这一目标定义为“功能一致性”(Functional Consistency)。形式化地说,给定历史轨迹 τ,真实状态 s 和预测状态 ŝ,若智能体 π 在两者下选择的动作分布相近,则认为 ŝ 是高质量的预测。

这就像翻译:逐字直译未必是好翻译,关键是读者能否从译文中做出和原文相同的判断。对世界模型而言,关键不是页面文字是否一字不差,而是智能体能否基于这个页面做出正确的下一步操作。

BehR:用行为差异替代文本相似度

基于上述思想,作者提出了行为一致性奖励(Behavior Consistency Reward, BehR)。

具体做法很简单:找一个冻结的参考智能体(比如Qwen3-8B),让它分别在真实状态 s 和预测状态 ŝ 下,对同一组候选动作打分(输出对数概率)。两个打分向量越接近,奖励越高。数学表达为:

$$ R_{\text{BehR}} = -| \log \pi(a|s, \tau) - \log \pi(a|\hat{s}, \tau) |_2 $$

这意味着:

  • 如果预测漏掉了目标商品,智能体在 ŝ 下对“点击该商品”的打分会暴跌,与真实状态下的高分形成巨大差距,导致奖励骤降;
  • 如果只是删掉无关商品,打分几乎不变,奖励不受影响。

训练时,世界模型对每个输入生成多个候选预测,分别计算BehR,再用组相对策略优化(GRPO)进行策略梯度更新。整个过程不需要人工标注偏好,只需一个本地冻结的参考智能体提供反馈。

实验:16组配置,一致性全面提升

实验在两个经典环境展开:

  • WebShop:模拟电商网站导航,任务如“买一件红色高领毛衣”;
  • TextWorld:基于文本的冒险游戏,需理解复杂指令并操作虚拟物品。

基座模型覆盖 Qwen2.5-7B 和 LLaMA3.1-8B,评测智能体包括 Qwen3-8B、Qwen3-32B、GPT-4o 和 GPT-5,共组成16种配置。

评估指标采用逐任务配对一致率($CR_{pw}$):让同一智能体分别在真实环境和世界模型中跑完整轨迹,看任务结果是否一致(成功/失败匹配)。越接近1.0越好。

结果非常清晰:BehR在13组配置中提升了一致性,其余3组持平,无一退化

在WebShop上提升最显著:

  • Qwen3-8B 的 $CR_{pw}$ 从 0.345 提升至 0.483(+13.8个百分点,约+40%);
  • GPT-4o 从 0.760 提升至 0.840(+8.0个百分点,约+10.5%)。

TextWorld上,强智能体基线已接近满分,BehR的作用更多是维持这种高一致性,防止因幻觉导致意外失败。

下游应用:离线评估更准,前瞻规划更有效

离线评估:大幅降低假阳性

弱智能体在简化环境中容易“蒙混过关”。例如,TextWorld上 Qwen3-0.6B 的真实成功率为0%,但用传统世界模型评估时,竟有42.5%的任务被判为成功——近一半是假阳性。

换成BehR训练的世界模型后,假阳性率骤降至9.5%,一致率从57.5%升至90.5%。这意味着离线评估终于能更真实地反映智能体能力,而不是被“友好”的幻觉欺骗。

前瞻规划:先想再动,效果更好

让智能体每步提出5个候选动作,用世界模型模拟后果,再选最优执行。这是典型的“前瞻规划”(lookahead planning)。

在WebShop上,BehR世界模型帮助 Qwen3-8B 将成功率从14.5%提升到25.5%(+11.0个百分点),优于基线的+9.0pp。而且智能体越弱,获益越大——因为它们更依赖“先想一下再行动”的机制来弥补决策能力的不足。

重新定义世界模型的价值

这项工作挑战了一个默认假设:世界模型的好坏取决于它生成的文本有多像真实环境。实际上,真正重要的是它能否引导智能体做出一致的行为

BehR通过冻结参考智能体的行为差异提供训练信号,无需额外标注,在多个环境、多种模型组合下验证了有效性。它不仅提升了轨迹级一致性,还在离线评估和前瞻规划等实际场景中带来明确收益。

未来,或许我们该少问“这段文本像不像真实页面”,多问“智能体会不会因此做出错误决定”。毕竟,世界模型不是为了写小说,而是为了让智能体在虚拟与现实之间无缝切换。