LLM 能否在真实社会中持续更新认知?UIUC 与 Astraculum 的 390 天实证

0 阅读

LLM 的认知能不能跟着社会一起变?

大语言模型(LLM)在训练完成后,通常就被“冻结”了。它知道的世界停留在训练截止那一刻。但现实社会每天都在变:突发新闻、政策调整、市场波动……人类会迅速调整判断,可 LLM 能不能也做到这一点?

图片

伊利诺伊大学厄巴纳-香槟分校(UIUC)和清华背景的初创团队 Astraculum 合作,用一个叫 Social World Model(SWM)的框架,把这个问题拉进了真实世界。他们没停留在理论,而是让模型直接面对预测市场的真金白银,在 390 天里持续观察、判断、学习、再判断。

图片

结果出人意料:一个只有 70 亿参数的模型,靠着不断更新自己的认知,跑赢了 GPT-5.6、DeepSeek V4 Pro 和 Claude Opus 5 这些前沿大模型。

图片

用预测市场当“社会认知”的标尺

图片

要让 AI 学习社会认知的变化,首先得有个能量化的指标。研究团队选中了 PolymarketKalshi 这类预测市场。

为什么是预测市场?因为这里的问题都还没答案——比如“美联储九月会不会降息”——而参与者用真钱下注,形成的价格直接反映了大众对这件事发生的集体信念概率。比起社交媒体的情绪或问卷调查的模糊回答,这种用钱投票的结果更真实、更连续、也更难操纵。

在这个设定下,SWM 把“社会认知”看作一个状态(State)。比如某个合约价格是 0.62,就代表当前社会系统认为这件事有 62% 的可能性发生。当一条突发新闻出现,它就像一个外部输入,会推动这个状态向新位置转移。模型的任务不是猜事件本身的结果,而是预测:这条新闻会让大众的集体信念往哪边偏多少

这本质上是在建模“信念如何被信息更新”,而不是在做事件预测。

静态模型 vs. 持续学习模型

大多数 LLM 在部署后参数就固定了。哪怕它今天看到市场因为某条新闻剧烈波动,这个经验也不会自动变成明天的能力。每一次预测都是同一个“老我”在答题,过去的对错跟未来无关。

但社会不是静态的。新闻的重要性会变,投资者的反应模式会变,宏观环境也在变。一个冻结在三个月前的模型,很可能已经看不懂今天的市场逻辑。

所以团队问了一个更硬核的问题:能不能让模型在部署过程中,把真实世界的反馈变成训练信号,持续改写自己的参数

他们设计了一个滚动实验:模型每天接收实时新闻和市场盘口,做出下一小时信念变动的预测;一小时后,真实结果揭晓,系统就用这个反馈来微调模型;第二天,用更新后的模型继续预测。整个过程持续了 390 天,严格按时间顺序推进,没有数据穿越。

不学价格,学推理:用 SDFT 避开噪声陷阱

最直觉的做法是让模型直接拟合价格变化——涨了就调高,跌了就调低。但这很容易被短期噪声带偏。价格变动只是结果,背后真正重要的是:哪些新闻驱动了变化?为什么这条新闻会影响人的判断

为了解决这个问题,团队引入了 SDFT(Self-Distillation Enables Continual Learning)机制。它的核心是利用“事后视角”的特权信息来指导学习,但不让模型在预测时作弊。

具体操作分两步:

  1. 事后推演:当真实市场结果出来后,让模型基于完整信息(包括结果)写一段推理,解释“为什么信念会这样变”。
  2. 师生蒸馏:同一个模型被拆成“老师”和“学生”。老师能看到这段事后推演(特权上下文),学生只能看到预测时的新闻和价格。训练时,老师逐 token 给学生的推理打分,引导它向更符合因果逻辑的方向靠拢。

这样学进去的不是某个价格数字,而是“事件 → 人群情绪 → 市场动作”这条推理链。模型学到的是理解力,不是记忆。

7B 模型跑赢 GPT-5.6,关键在稳定性

在 390 天的实测中,所有静态大模型——包括 GPT-5.6、DeepSeek V4 Pro、Claude Opus 5——的表现都低于一个简单基线:只看过去价格趋势、完全忽略新闻的模型。换句话说,它们从新闻里学到的“信号”还不如噪声多。

而那个持续自蒸馏的 7B 模型,是全场唯一显著优于价格基线的。更关键的是,它的优势来自稳定性

研究团队把全年数据按月切分成 12 个窗口。静态模型在某些月份(比如年初和年末的政策敏感期)会集体大幅失分,波动剧烈。但 7B 模型在十二个月里没有一个月出现明显崩盘,始终维持在一个可靠的水平线上。

团队还做了对照实验:每轮训练后冻结一个副本,在无关任务上测试推理能力。十二轮下来,模型的输出长度、逻辑连贯性都没有退化,说明持续学习没有引发灾难性遗忘。

支撑这一切的,是一套叫 TrajOps 的基础设施

让 LLM 在真实世界持续学习,听起来很美,但工程上全是坑。团队总结了三个必须解决的问题:

  • 判断时什么是可知的? 必须确保模型在做预测那一刻,只能看到“当时”已公开的信息,绝不能提前看到未来数据。
  • 结果什么时候变得可知? 现实反馈往往延迟、碎片化。系统得精确判定何时能拿到“最终答案”作为训练标签。
  • 更新到底有没有帮助? 如何验证模型是真的变聪明了,而不是在死记硬背或遗忘旧知识?

为了解决这些,他们开发了 TrajOps——一个专为持续学习设计的 MLOps 引擎。它提供三个核心接口:

  • Collect:在事件落定前后,精准抓取新闻和最终市场结果;
  • Inference:管理时间视野,确保部署模型只使用合法上下文;
  • Train:调用内置的 SDFT 流程,将反馈转化为训练信号。

整个“部署→反馈→训练→再部署”的闭环,就靠 TrajOps 自动跑通。目前,这个 7B 模型仍在 trajops.astraculum.com 上每天实盘运行,公开记录它的判断。

这不只是个金融实验

虽然实验场景是预测市场,但 Social World Model 的野心更大。它试图回答一个根本问题:AI 能不能像人一样,在开放、动态的社会环境中持续更新对世界的理解

传统 LLM 是“训练时学习”,而 SWM 探索的是“部署时学习”。后者更接近真实智能的运作方式——我们不是靠一次性的海量阅读成为专家,而是在一次次与现实的互动中修正认知。

这项工作证明,只要设计好学习机制和工程基础设施,即使是中小规模的模型,也能在长期动态环境中胜过参数更多但“思想僵化”的大模型。未来的 AI,或许不在于有多大,而在于能不能持续进化。