中国NeoLab崛起:EverMind三篇论文揭示全栈自进化AI技术路径

1 阅读

自进化AI:从概念到落地的关键一跃

2026年的夏天,人工智能领域迎来了一场静默的革命。当海外众多NeoLab团队凭借宏大的叙事和惊人的估值吸引全球目光时,一家来自中国的团队——EverMind,用连续三篇高质量论文,为自进化AI领域交出了一份令人瞩目的全栈答卷。这不仅是技术上的突破,更标志着中国在下一代AI核心赛道上,已经拥有了与国际顶尖团队同台竞技的底气。

自进化AI,或称递归自我改进,其核心愿景是让AI系统在部署后能够通过自我迭代持续进化,而非停留在出厂时的静态能力。这一方向被认为是通往通用人工智能的关键路径之一。然而,实现真正的自进化面临着巨大的技术挑战:如何让AI安全地修改自身代码?如何高效地管理和复用海量技能?如何在模型训练中精准分配监督信号?这些问题长期困扰着学术界和产业界。

EverMind的贡献在于,它没有停留在单一技术点的突破,而是从系统层面构建了一个覆盖技能层、脚手架层和模型权重层的完整技术栈。这种全栈式的思考方式,使得其解决方案更具实用性和可扩展性,也为整个行业提供了宝贵的参考范式。

破解脚手架自进化难题:HarnessBank的“基因库”策略

在AI系统的实际部署中,模型权重往往是冻结的,因此修改Agent外围的“脚手架”——包括提示词、知识注入和运行时控制逻辑——成为提升性能最直接的手段。然而,让AI自主修改这些代码面临着严峻的过拟合风险:模型自我生成的反馈充满噪声,一个看似有效的修改可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃。

EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》一文中,提出了一套创新的框架,从根本上解决了这一难题。其核心思想是将“提出变更”与“归因变更”彻底分离。语言模型只负责诊断失败原因并提出补丁,而所有的采样、测量和显著性检验全部交由确定性的代码逻辑控制。这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。

更令人印象深刻的是其引入的“装备基因库”机制。传统的自进化系统往往以“任务”为键来存储改进,这极易导致系统只学会解决特定问题,缺乏泛化能力。EverMind则将每一份高性能脚手架以“WHERE × WHY”作为语义坐标存档,支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,从而引入了强大的抗过拟合归纳偏置。系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。

实验结果表明,在冻结任务Agent权重的情况下,HarnessBank在Terminal-Bench-2、LiveCode、Omni-MATH等七个多样化基准上取得了5.1%到15.4%的一致性能提升,且所有增益均通过了配对显著性检验。这一成果不仅证明了方法的有效性,更揭示了自进化过程中的一个深刻洞察:性能提升来自模型特异性的自进化过程,而非存在某个放之四海而皆准的“万能脚手架”。这意味着,EverMind构建的“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,为AI for AI的技术可行性提供了有力佐证。

构建十万级技能库:SkillCorpus的工程与科学

如果说脚手架的自进化赋予了Agent重写逻辑的能力,那么“技能”则是Agent沉淀经验的具体载体。在EverMind的Raven框架中,内置了高达10万项开箱即用的技能。这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》一文。

随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。EverMind团队构建了SkillCorpus框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。他们从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,最终精选出96401个高质量技能,并建立了包含16个类别的分类法,从实用性、鲁棒性和安全性三个维度进行了严格的质量控制。

仅仅有库还不够,关键在于检索。EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保Agent在执行任务时能够精准匹配到相关的技能。在SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,Agent在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升最大,达到了7.5个百分点。

更值得关注的是,技能并非一入库就固定不变。无论是人工编写的技能,还是AI自动生成的技能,EverOS都能依据任务执行的成败经验对其持续打磨。用得好的被强化、被复用,用得差的被修正、被淘汰。技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产。这种动态的技能管理机制,为Agent的长期学习提供了坚实的基础。

突破训练瓶颈:DASH算法让模型看清错误

自进化的最深层,是模型权重的自我迭代。EverMind的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》,展示了其在底层算法上的深厚功底。

传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:它对所有局部散度分配相同的系数,完全忽略了错误发生的时间顺序和上下文。EverMind的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间存在极弱的关联。这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。

为了解决这一问题,EverMind提出了DASH算法。其核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门,然后利用这些门控制向后的多步聚合。当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。

实验结果令人印象深刻。在AIME 2024、AIME 2025和HMMT 2025三个极具挑战性的数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三个模型规模上均取得了所有对比方法中的最高分。在Qwen3-1.7B上,DASH将三个基准的平均得分从vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,从65.00提升至66.40。更重要的是,DASH不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是免费的。

全栈自进化框架:从任务层到元改进层的四层递进

EverMind将自进化的完整路径,概括为一个从任务层到元改进层的四层递进体系。这一框架不仅是对其技术栈的总结,更是对整个自进化AI领域的系统性思考。

任务层是最直接的进化层次,进化在单次任务中即时发生。优化对象是单次任务的执行质量,既包括记忆的提取与回写,也包括技能的即时沉淀与复用。这一层的能力复利是“记得更牢、用得更顺、单次任务做得更好”,价值定位是沉淀任务级、可复用的记忆与技能资产。这正是EverOS与SkillCorpus所覆盖的核心场景。

脚手架层优化对象是Code与Policy,即Agent外围的运行逻辑与控制策略。经验来源是Eval与Reflection,更新动作是脚手架的版本迭代,验证方式是Agent Evals复盘。这一层的能力复利是“更会执行”,价值定位是可复用行为资产的持续积累。这正是Raven框架与Self-Evolving Harness论文所对应的工作。

模型层优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是LoRA与端侧模型的验证后灰度,验证方式是离线集加灰度测试。这一层的能力复利是“更准、更省”,价值定位是个性化的专属模型能力。DASH论文正是这一层的核心算法支撑。

元改进层是整个框架最令人兴奋的顶层。优化对象是Evaluator、Data与Training Recipe本身,经验来源是多轮实验与Benchmark,更新动作是优化“提出—选择—验证”的整个循环,验证方式是版本门槛加评测体系。这一层的能力复利是“下一轮进化更快、更可靠”,价值定位是让改进能力本身也持续升级。

这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制。它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。

对比海外坐标系:EverMind的独特优势

要理解EverMind这套完整技术栈的领先性,我们不妨将目光投向海外那些估值令人咋舌的NeoLab。

Recursive Superintelligence(RSI)提出了宏大的“自动化AI研究闭环”理念,并拿到了6.5亿美元融资和AWS的4.1亿美元算力合作协议。然而,RSI目前仍处于纯研发阶段,尚无成型的产品或框架落地,其公开结果仅限于在GPU内核算法优化基准上超越了人类两年的优化记录。

Engram以6亿美元估值完成了9800万美元A轮融资,其核心技术是基于稀疏记忆模块的参数化权重记忆(如LoRA微调)。Engram在降低推理成本和解决灾难性遗忘方面做出了出色工作,但其路径过于依赖底层权重的更新,缺乏在Agent脚手架和外部技能库层面的灵活进化机制,且需要白盒访问模型权重,这在实际部署中是一个重大限制。

Adaption Labs(估值10亿美元)主攻无梯度推理时适应,试图通过动态解码和适配器组合来消除微调和提示词工程。这在思路上与EverMind的Harness自进化有相似之处,但Adaption Labs缺乏如SkillCorpus这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。

Core Automation(估值目标40亿美元)由前OpenAI研究副总裁Jerry Tworek创立,其旗舰项目Ceres专注于持续学习模型,目标是将训练数据需求降低100倍。这是与EverMind方向最为接近的项目,但Core Automation目前仍在早期研发阶段,缺乏EverMind这样完整的技术栈和开源生态。

相比之下,EverMind的独特之处在于其“三层并发”的战略纵深。它没有陷入“参数化记忆”与“非参数化记忆”的非此即彼的争论,而是通过EverOS(非参数化长期记忆)、Raven(Harness自进化)和DASH(底层权重训练优化)构建了一个全栈生态。更重要的是,EverMind坚持开源优先,通过在GitHub上积累的超过1.2万颗Star(同期mem0为7千),正在迅速建立起类似Android的底层开发者生态护城河。

中国NeoLab的崛起:从盛大创新院到EverMind

回顾中国互联网史,盛大创新院的存在几乎算得上“异类”。2008年,陈天桥在盛大集团内部创立该机构,其定位不是做产品、也不追KPI,就是纯粹地探索技术前沿。这在那个流量为王、变现至上的互联网时代,是一种极为罕见的企业内研究文化。十余年后,时代的底色已经从互联网切换到了AI,而盛大集团的战略布局,也已经集中到更为前沿的脑科学和人工智能方向。近三年来,盛大All in AI,在原有风险投资体系基础上,通过内部孵化机制在全球范围内广泛吸引顶尖AI人才,陆续孵化出多支专注于不同AI方向的研究型团队。EverMind,正是其中一支。

如果说盛大创新院开创了中国企业内研究型组织的先河,那么EverMind的出现,则是这一基因在AI时代的延续与升华。也正因如此,这支团队从一开始便选择了一条在商业上看似“最难”、在技术上却“最根本”的路:解决AI的长期记忆问题,并在此基础上,探索AI的自进化之路。

仅仅一年间,团队就在长期记忆与自进化领域产出9篇高质量论文,其中数篇被ACL、KDD等顶会录用。这意味着EverMind的自进化不只是一个工程化产品,更有扎实的底层技术与严谨的学术支撑。DASH让模型在训练时“看清自己错在哪里”,Self-Evolving Harness让Agent在运行时安全地重写自身逻辑,SkillCorpus让Agent的成功经验被规模化地沉淀与复用。三者合一,构成了一个从“感知错误”到“修改逻辑”再到“沉淀记忆”的完整自进化闭环。

在定义“数字生命”下一个形态的道路上,中国的研究型团队,已经来了。至于更精彩的部分,才刚刚开始。