NeoHorse-1:让AI从执行轨迹中学习,迈出RSI可复现的第一步
Agent 的经验不该烂在日志里
想象这样一个场景:一个 AI Agent 接到任务,要根据最新邮件调整项目排期。它读了工作目录里的文件,却漏掉了那封关键邮件。于是它基于过时信息生成排期,还把结果写错位置。整个执行链从中间断掉,后续全是错误推理。

你让它重来一遍,它可能这次做对了。但下次遇到类似情况,它大概率还会踩同样的坑——因为今天的大多数系统里,Agent 的执行经验只留在日志中,几乎从不进入模型参数。模型每天在真实环境里“试错”,却无法真正“学会”。

基元律动最近发布的 NeoHorse-1 想改变这一点。他们开源了 4B 和 9B 两个版本的模型,核心思路有点绕:让原本负责给模型“派活”的路由系统,顺便记录下所有模型走过的路,再把这些路教给一个小模型,让它自己就能走完一群大模型曾走过的路径。

这件事,他们称之为迈向 RSI(Recursive Self-Improvement,递归自我改进) 的第一次可复现闭环验证。

RSI 不是玄学,得能跑通

RSI 是个热门但争议很大的概念。简单说,就是让 AI 把自己的产出当作经验,喂回研发流程,设计更强的下一代自己,循环往复。Anthropic 和 OpenAI 都声称看到了早期迹象,但外界很难验证——因为整个过程是黑箱,你看不到数据怎么流转,也复现不了那个闭环。

学术界今年涌现大量相关工作,如 Self-Harness、Continual Harness 等,但大多停留在“改进某个零件”的阶段。而 NeoHorse-1 的特别之处在于,它把 RSI 拆成了四个清晰、可检查的环节,并全部开源。
要理解它,得先从 OpenSquilla 说起。
Harness 框架,天然就是训练场
几周前,基元律动开源了 Harness 框架 OpenSquilla。它的初衷很实际:复杂 Agent 任务动辄跑几十轮,每轮都调用最贵的旗舰模型,Token 成本扛不住。
OpenSquilla 的解法是在 Harness 上加一个“路由器”。每执行一步前,先判断这一步需要多强的能力,再分派给“够用且最便宜”的模型或模型组合。测试显示,这套机制能省下 60% 到 80% 的 Token 开支。
到这里,还是在省钱。但 NeoHorse 的洞察更进一步:路由器在派活的每一步,其实留下了三样东西——
- 它预判了这一步需要什么能力
- 记录了实际派遣的模型
- 观察了这一步最终执行得怎么样
这比普通聊天记录的“问题—答案”丰富得多,形成了一份完整的教学档案:“需求预测 — 路由决策 — 执行过程 — 环境结果”。基元律动决定拿它办学。
四步构建可复现的训练闭环
NeoHorse 的训练思路分为四步,每一步都对应 RSI 闭环的一个环节。
第一步:保留完整的“推理—行动—反馈”链条
Agent 的真实能力藏在交错的推理、工具调用、环境交互、报错恢复和最终交付之间。NeoHorse 把每一次完整交互保存为一条轨迹,再按用户轮次切成训练单元:当前轮的推理与动作是模型要学习的目标,更早的历史作为上下文。
主语料库包含十万到百万条脱敏的真实任务轨迹,另加公开数据补齐覆盖面。
第二步:判断轨迹能不能用
不是所有日志都值得学。系统先用确定性规则检查:工具调用是否有返回?事件顺序是否成立?是否缺少最终回复?执行分支能否闭合?
结构完整的轨迹进入下一步;部分可恢复的只保留因果关系完整的片段;无法判断事件归属的则被隔离。
随后,系统从六个维度进行语义评估:目标达成、指令遵循、工具使用、证据一致性、错误恢复、正确终止。每条轨迹会被标记为“通过”“警告”“失败”或“未评估”。这样,系统不仅能知道任务成败,还能定位失败更可能发生在哪个环节——是证据获取错了,还是工具选错了,或是终止判断失误。
第三步:用 Router 预测的能力需求做课程学习
NeoHorse 借用 OpenSquilla 的 C0 到 C3 能力分层作为难度信号。训练分三个阶段推进:先集中学低需求档任务,再逐步混入高需求档的硬任务,同时刻意保留一部分简单样本到最后阶段,防止模型后期“只会做难题”。
关键细节在于:系统没有直接用“最终调用了哪个模型”当作难度标签。因为实际路由可能受任务指定、服务可用性等干扰。NeoHorse 用的是 Router 在回答发生前,根据请求及历史状态重新估计的能力需求。这个信号更贴近真实部署场景,决定了样本何时出现,而不是简单告诉模型“这是一道难题”。
第四步:路由引导的 On-Policy Distillation
传统知识蒸馏像让学生抄标准答案。而 On-Policy Distillation 是让学生先自己做题,教师再沿着学生实际走到的位置提供下一步监督——如果学生走进岔路,就当场纠正。
最后,模型评估结果会生成一张“能力短板地图”,标出哪些场景完成率低、哪种错误多发、哪个能力层级最薄弱。下一轮训练数据便向这些区域倾斜,同时维持基础能力覆盖。至此,“评估—选择—更新”这一圈转起来,构成一次 RSI 闭环。
效果如何?数字和行为都说得通
NeoHorse-1 在 4B 和 9B 两个尺寸上评测,覆盖 Harness Agent、工具调用、多轮交互、代码生成等十项 Benchmark。
- 4B 模型平均分从 58.94 提升到 64.87(+5.93)
- 9B 模型从 65.60 提升到 69.04(+3.44)
值得注意的是,NeoHorse-1-4B 的综合表现已接近 Qwen3.5-9B 基座的 65.60。在同一套路由课程下,用 Harness 轨迹训练的模型,在五个可比测试上平均比公开合成工具数据 Toucan 高出 6.26 分。
这些提升主要集中在流程清晰、反馈可验证的任务上,比如工具交互和代码执行。但在需要长时间保持状态、反复测试修复的任务上,4B 尺寸依然吃力——参数规模仍有意义,后训练补的是执行链条上的关键一环,而非抹平能力边界。
一个典型例子是数据分析任务:当环境中没有 pandas 时,NeoHorse-1-4B 没能及时识别方案已被阻断,反而反复尝试安装依赖、手动解析脚本,最终失败。这类任务恰恰需要交给模型池中更强的成员。
行为层面的变化更直观:
- 票务日报任务:基座模型处理工单状态矛盾后反复重写,越改越乱;NeoHorse 主动补取证据、识别新约束、核对一致后再交付,19 张工单匹配率达 100%。
- 五子棋网页任务:基座模型全程报索引错误,棋盘空白;NeoHorse 按顺序落下 13 黑 13 白,攻防轮转正常。
这算真正的 RSI 吗?
AI 的自我改进至少有三个层次:
- 自我修正:当前任务中发现错误并重试
- 运行层适应:把经验写入 Memory、Skill 或 Harness
- 递归自我改进:经验改变模型参数,新模型产生更好经验,多代循环积累
NeoHorse 已具备后两者的雏形:Harness 产生数据 → 评估发现缺口 → 数据配比调整 → 后训练更新模型 → 新模型回归多模型池。团队将其概括为 Data-RSI 与 Model-RSI 两个相连环节。
但当前报告只验证了单轮“评估—选择—更新”。它尚未证明第二代、第三代模型能持续获得增益,也没让“如何改进模型”这套机制本身自动进化。随着模型变强,旧数据可能失效;反复从自身轨迹学习,也可能放大偏差。
因此,正如基元律动所说,NeoHorse 完成的是一次迈向 RSI 的、可复现的单轮闭环验证。它没证明 RSI 已到来,但证明 RSI 可以是一个可复现的工程问题。
模型与 Harness 的飞轮,开始旋转
在基元律动的愿景中:
- OpenSquilla 是模型执行与产生经验的场所
- NeoHorse 是经验进入模型参数后的载体
理想飞轮是:OpenSquilla 用多模型完成任务并留下轨迹 → NeoHorse 从中学习,承担更多原需昂贵模型的工作 → 推理成本下降 → Agent 使用量增加 → 更多执行产生新数据 → 推动下一轮训练。
过去,Harness 框架常被视为“缺乏技术含量”的胶水层。NeoHorse 的结论是:谁能构建出一个持续运转、每一步都留下结构化记录的系统,谁就拿到了下一代 Agent 模型最便宜、也最难复制的训练数据。
模型参数可以开源、可以追平,但真实流量里踩出来的路不行。NeoHorse-1 把 Harness 的重要性提升到了新高度——它正成为连接用户任务、环境反馈和模型更新的中枢。
这还只是初步实验。但未来的 Agent 系统,或许真能让模型从每次执行中持续成长。