Agent效能跃升104%?上海AI Lab Self-Harness技术揭秘与范式革新

1 阅读

突破模型瓶颈:Harness工程的范式转移

在人工智能 Agent 领域,长期以来存在一种误区,即认为提升智能体性能的唯一途径是不断堆砌更强的底层大语言模型。然而,上海人工智能实验室近期提出的 Self-Harness 技术,为这一领域带来了颠覆性的思考。该技术证明,在固定底层模型、工具环境和评测协议的前提下,仅通过优化包裹在模型外层的 Harness(控制装置),即可实现性能的飞跃。在 Terminal-Bench-2.0 基准测试中,Qwen3.5-35B-A3B 模型的效能甚至提升了 104%,MiniMax M2.5 和 GLM-5 也分别获得了 28% 和 24% 的提升。

这一成果之所以引起 LangChain CEO Harrison Chase 及前 OpenAI 副总裁 Lilian Weng 等业界顶级专家的关注,是因为它触及了 Agent 架构中一个常被忽视的核心痛点:模型能力与执行策略之间的错位。Harness 并非简单的提示词集合,它涵盖了系统指令、工具调用规则、验证逻辑、运行时控制策略以及轻量级中间件。在多轮工具交互任务中,Harness 决定了 Agent 何时调用工具、如何从失败中恢复、如何验证最终产物以及何时终止执行。过去,这套系统高度依赖工程师的人工经验进行微调,随着模型种类和任务复杂度的指数级增长,这种“一模型一套人工调参”的模式已难以为继。Self-Harness 的核心创新在于,它让 Agent 具备了对自身外层控制逻辑进行自我审视、修改和验证的能力,从而开启了自进化 Agent 的新篇章。

自进化闭环:从弱点挖掘到回归验证

Self-Harness 的工作流程被设计为一个严密的三步闭环,旨在将模糊的“调优”过程转化为可量化、可复现的工程步骤。首先进行的是弱点挖掘(Weakness Mining)。系统驱动固定模型在特定环境中执行一系列任务,并完整记录其执行轨迹、工具调用序列及最终评测结果。与传统方法仅关注“是否成功”不同,Self-Harness 深入分析失败样本,结合验证器反馈、Agent 行为模式与失败结果之间的因果关系,提炼出可复用的失败机制。例如,它不会仅仅记录“某任务失败”,而是将其归类为“因缺少最终产物导致的失败”或“工具报错后未执行恢复策略导致的失败”。这种结构化的错误归因,为后续的针对性修改奠定了坚实基础。

在识别出潜在弱点后,流程进入提案阶段(Harness Proposal)。此时,模型角色切换为提案者,针对已挖掘出的失败机制,在预声明的可编辑表面上提出具体的 Harness 修改建议。这一过程有着严格的边界约束:修改不能推翻整个 Agent 的控制架构,只能作用于既定的编辑接口。每个提案必须明确说明预期改变的行为模式、可能引发的回归风险,以及为何该修改能解决当前的失败模式。这种透明化的提案机制,确保了修改的可解释性,避免了黑盒式的随机调整。

最后,也是最关键的一步,是提案验证(Proposal Validation)。任何候选的 Harness 修改都必须经过严格的回归测试。系统在同一评测协议下重新运行修改后的 Harness,并与当前版本进行对比。接受规则极为保守:只有在新版本在 held-in(训练集)或 held-out(测试集)中至少一个分割集上取得提升,且另一个分割集未出现退化时,该修改才会被采纳并进入下一代 Harness。这一机制彻底摒弃了模型“凭感觉”拍板的弊端,构建了一个记录完整、可复现、可回退的评测闭环,确保了每一次进化都是实质性的性能增益而非过拟合或退化。

实证分析:不同模型的不同进化路径

Self-Harness 的价值不仅在于提升整体分数,更在于其能够针对不同模型的特性进行个性化优化。通过对 Terminal-Bench-2.0 上的表现进行细致剖析,可以清晰地看到不同模型在复杂工具环境中暴露出的差异化弱点,以及 Self-Harness 如何精准“对症下药”。

以 MiniMax M2.5 为例,该模型在初始 Harness 下表现出一种“优柔寡断”的特质。尽管它能准确找到数据集中的关键元信息线索,但往往迟迟不创建评测所需的答案文件,而是持续进行无效探索,最终因超时或缺少产物而失败。Self-Harness 通过挖掘这一轨迹模式,保留了鼓励 Agent 尽早识别必需输出的修改建议。新的 Harness 引导模型在发现线索后优先创建初始产物,并在工具调用链条过长时,主动从探索模式切换到具体实现和验证模式。这种策略调整显著提升了该模型的交付效率。

相比之下,Qwen3.5-35B-A3B 的问题则集中在“循环依赖”与“破坏性操作”。在工具调用失败后,该模型容易陷入重复编辑、重复覆盖文件或重复执行相同命令的死循环,甚至在尝试恢复时误删评测必需文件。针对这一弱点,Self-Harness 为其引入了依赖预检查机制、失败后的产物自动恢复策略,以及避免完全相同命令重试的约束。此外,系统还增加了由工具错误触发的 Artifact-focused 提醒,确保模型在遇到错误时优先保护已生成的关键数据。这些细粒度的代码级 Harness edits,直接针对模型的执行缺陷进行了加固。

GLM-5 的表现则揭示了 Shell 状态管理的重要性。该模型在长时间运行中,容易忽视环境变量修改、工具安装或路径调整后的状态持久性问题,导致后续命令失效。同时,它在从探索阶段过渡到实现阶段的时机把握上也存在偏差。改进后的 Harness 通过引入状态确认机制,提醒模型在修改系统环境后验证变化的跨命令可用性。同时,通过监测长时间无产物生成的行为,系统主动推动模型转向实现与测试阶段。这表明,Self-Harness 并非简单地给所有模型添加通用提示,而是基于真实轨迹中的特异性弱点,生成并筛选出最适合该模型的动态控制策略。

行业启示:重新定义 Agent 的控制层

Self-Harness 的提出,标志着 Agent 开发范式从“模型为中心”向“系统为中心”的重要转变。随着 Agent 越来越多地应用于需要多轮交互、复杂工具调用和严格合规性检查的真实场景,模型本身的推理能力已不再是唯一的决定因素。外层 Harness 决定了 Agent 是否知晓何时调用工具、如何优雅地处理错误、如何确保产物正确性以及是否在退出前完成了最终验证。

过去,Harness 工程被视为一种依赖专家经验的“手艺活”,难以规模化复制。Self-Harness 提供了一条自动化、数据驱动的路径,让模型参与经验的挖掘与改写,但最终的裁决权始终掌握在客观的评测体系中。这种“人机协同但由机器自主迭代”的模式,既保留了人类设计的初始框架,又引入了模型自身的适应性调整能力。

当然,该技术也有其明确的边界。它并未宣称 Agent 可以完全脱离人类监督进行任意进化,其适用范围仍局限于特定的 Benchmark 和模型后端。然而,它清晰地划定了自进化的操作边界:改什么(基于弱点挖掘)、怎么改(基于有界提案)、怎么验(基于回归测试)、何时拒绝(基于性能门控)。这种严谨的工程方法论,为构建高鲁棒性、高可靠性的工业级 Agent 提供了可复制的解决方案。

随着 AI Agent 在金融、医疗、软件开发等高风险领域的深入应用,如何确保其行为的可控性和结果的准确性,将成为行业关注的核心。Self-Harness 所代表的自进化 Harness 技术,通过自动化、可视化的迭代流程,为这一挑战提供了有力的技术支撑。未来,随着更多模型和任务的适配,这一范式有望成为构建下一代智能系统的基础设施,推动 AI 从“单次问答”向“持续进化、自主负责”的通用智能体迈进。对于开发者而言,关注 Harness 的设计与优化,或许比盲目追求更大的模型规模更具性价比和现实意义。