AI科研革命来临:18个智能体自主优化算法,开源模型逼近闭源巨头

1 阅读

人工智能科研领域正在经历一场前所未有的变革。Prime Intellect这家开源AI基础设施公司最近发布的研究成果,彻底颠覆了业界对AI自主科研的传统认知。通过巧妙设计的多智能体协同系统,他们成功证明了开源模型在特定条件下能够超越甚至逼近顶级闭源模型的表现。

文章配图

这项研究的核心在于构建了一个名为Harness的智能体编排框架,该框架能够让多个相对较小、成本较低的开源模型协同工作,共同完成复杂的科研任务。实验结果显示,当Kimi K3这样的开源权重模型与Prime Agent Harness结合时,其在nanoGPT优化器速通任务中的表现达到了惊人的2930步,这一成绩不仅超越了GPT-5.6 Sol的3042步,距离Claude旗舰模型Opus 5的2920步也仅有10步之差。

这种突破的意义远不止于单一任务的性能提升。它从根本上动摇了长期以来占据主导地位的RSI理论框架,即某个最强大的闭源模型率先跨越AI开发AI的临界点,然后通过不断自我迭代将其他竞争者远远甩在身后,最终实现赢家通吃的局面。新的实验证据表明,模型本身是否最强并非决定性因素,关键在于底层科研机器的效率和试错吞吐量。

实验的设计理念源于对人类科研过程的深度模拟。研究人员将18个前沿大模型投入到著名的nanoGPT训练任务中,这些模型包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1等多个知名模型。每个智能体都被赋予了一个明确的目标:在保证验证集损失低于3.28的前提下,用尽可能少的训练步骤完成1.24亿参数GPT的训练。

实验设置了一个3290步的基准线,作为所有参与者共同的起点。作为对比,目前人类研究者创造的最佳记录是2600步,这意味着存在690步的优化空间等待探索。每个智能体在启动时都会获得代码仓库、规则手册和目标指令,然后在8张H200 GPU的支撑下完全自主运行,人类基本退出干预。

整个实验过程中,智能体需要独立完成代码修改、训练启动、结果比较、噪声判断、实验决策等一系列复杂操作。为了确保实验的纯粹性,所有环境都被锁定在沙箱中并断网,防止智能体直接获取现成答案。

经过153次全自主实验,其中一些持续时间超过8天,研究团队得出了一些令人深思的结论。首先,没有任何一次实验提出了真正意义上的全新方法,最终有效的技术手段如归一化、学习率调整、权重平均等,都能在现有研究中找到相似思路。这一发现揭示了一个重要事实:在当前阶段,创新想法本身可能并非稀缺资源。

真正拉开差距的因素在于如何将想法付诸实践。强模型展现出显著的优势:它们不会轻易放弃一个想法,即使初次尝试失败,也会通过更换种子、重新消融分析等方式继续探索;它们更善于处理噪声,能够准确判断微小提升是真实改进还是随机波动;它们甚至会自主开发工具,建立小型数值实验室来验证假设。

Fable 5在实验中表现最为出色,最终达到2726步的成绩,相当于完成了从基准线到人类记录之间82%的优化空间。这一结果进一步证实了科研能力正在演变为试错吞吐量问题的观点。

基于这些发现,Prime Intellect提出了Multi-Agent Harness的概念。既然大量工作集中在代码编写、实验运行、结果监控、验证分析等环节,就没有必要每一步都调用昂贵的前沿模型。更经济的做法是让便宜的开源模型负责监控和实现,将真正需要判断的关键环节留给更强的模型。

这种架构设计带来了显著的成本效益:同样的预算能够支持更多实验,相同的实验也能够更快完成。当单次试错成本大幅降低时,AI科研能力的提升不再完全依赖于更强模型的出现,而是可以通过优化底层的试错机器来实现。

Kimi K3的实验表现尤为引人注目。Prime Agent Harness为其提供了持久运行的IPython内核,使模型能够围绕研究任务自主构建和迭代工作流程。这种能力让K3能够在实验中主动推翻自己的假设,从而提高整体效率。

这一功能看似简单,但在RSI框架下却具有重要意义。如果模型能力在短期内无法实现跳跃式提升,那么最容易持续扩张的就是模型外围的科研基础设施。通过提供更长的工作时间、更便捷的实验工具、更经济的执行模型,以及能够并行处理更多假设的多智能体系统,整体科研效率得到显著提升。

最终的结果可能不是一个突然发生智力爆炸的超级模型,而是一台越来越便宜、越来越快、越来越不知疲倦的AI科研机器。这种机器具备持续学习、自我优化、高效试错的能力,能够在相对较短的时间内完成大量科研任务。

从更宏观的角度来看,这一发展趋势与人类研究员的经验高度吻合。对于人类而言,创意本身往往并非最稀缺的资源,大家能够想到的研究方向差异可能没有想象中那么大。真正拉开差距的是基础设施的迭代速度,谁能更快、更稳定地验证想法、修复错误、运行实验,谁就能在竞争中占据优势。

同样的道理在AI4AI领域同样适用。我们未必需要每一步都让极其聪明但昂贵的模型亲自下场处理所有细节。很多时候,真正需要解决的问题是如何让一个表现尚可的模型以足够低的成本将实验循环运行得足够快。

在这种情况下,便宜的开源模型配合Harness框架反而显示出独特优势。它们能够承担大量基础性工作,让昂贵的模型专注于关键决策,形成高效的分工协作体系。

这一发现对整个AI行业发展具有深远影响。它表明AI科研的未来可能不完全依赖于单个模型的性能突破,而是更多地取决于整个科研生态系统的优化程度。通过持续改进智能体编排框架、优化实验流程、降低试错成本,我们可能看到一个更加民主化、更加高效的AI科研新时代。

如果AI开发AI最终真的进入指数级加速阶段,Prime Intellect提出的这条路线提醒我们一个重要事实:决定发展速度的不仅仅是顶层模型的智能程度,底层那套支持其不断试错的机器系统同样至关重要。这种认识将引导我们重新思考AI科研的发展策略,更加重视基础设施建设和系统优化。

展望未来,我们可以期待看到更多类似的创新实践。随着多智能体协同技术的不断完善,开源模型与智能体框架的结合将为AI科研带来更多可能性。这种模式不仅能够降低成本,提高效率,还能够促进知识的共享和传播,推动整个人工智能领域的健康发展。