树搜索驱动科研RSI:ScienceDiscovery如何实现小时级科学发现与通用积分器构建
近年来,人工智能在科学发现中的角色正从辅助工具向自主探索者演进。传统科研流程中,大量时间耗费在反复试错与代码调优上——第一版实现往往粗糙,真正价值体现在后续数十乃至上百次的迭代改进中。这一过程本质上是搜索问题,而非单次执行任务。在此背景下,openJiuwen社区推出的ScienceDiscovery平台提出了一种新颖范式:通过树搜索驱动科研产物的自主迭代(Research Self-Improvement, RSI),在无需训练模型、不调整参数的前提下,让科研代码自身在搜索空间中持续演化,最终产出高性能、通用性强的解决方案。

树搜索:构建科研产物的进化骨架
ScienceDiscovery的核心在于将科研迭代建模为一棵不断生长的搜索树。每个节点代表一个完整的科研产物(如一段Python程序),包含可执行代码及其评估得分。搜索过程遵循四步循环:选择(Selection)、改写(Rewriting)、评分(Scoring)与记账(Backpropagation)。具体而言,系统首先从现有节点中选择一个父版本;随后调用大语言模型(LLM)对其进行改写,生成新候选;新代码被送入隔离沙箱运行并打分;最后,本次访问记录被回传至该节点的所有祖先,影响其未来被选中的概率。
值得注意的是,失败版本同样被纳入树中,标记为无效但保留结构信息。这种包容性设计避免了因预设限制而扼杀潜在创新路径。沙箱机制由平台底座提供,能有效隔离死循环、超时或崩溃,确保评估安全可靠。当这棵树能在无人干预下持续生长并收敛至高性能解时,便实现了科研场景下的RSI——目标明确后,探索方向、回溯决策与深度挖掘均由程序自主完成。
案例一:攻克半无穷区间振荡积分难题
振荡积分在物理计算中极为常见,但传统通用积分器(如scipy.integrate.quad)在此类问题上表现糟糕。原因在于其依赖局部误差估计来决定采样密度,而振荡函数无衰减特性导致误差估计失效。ScienceDiscovery以38道典型振荡积分为测试集(AI全程不可见真值),仅以精度分作为反馈信号(0分表示完全准确)。
初始基线得分仅为−3.40,19道题中仅3道满足3%容差,最差结果误差高达24亿倍。经过119轮迭代、236个版本生成后,系统产出一个247行的通用求解器,得分提升至−0.0007——所有测试题均达标,平均相对误差仅0.07%。该程序并非为每道题硬编码分支,而是自主归纳出一套通用规则:先分析被积函数的发散点与振荡频率,再动态选择合适算法。更关键的是,该求解器在未参与训练的另外19道题上同样有效,证明其泛化能力。
整个过程耗时仅2小时,全程无人工介入。这标志着首个适用于半无穷振荡积分的通用工具诞生,填补了数值计算领域的长期空白。
案例二:高斯超几何函数的双精度突破
高斯超几何函数₂F₁(a,b;c;z)是特殊函数体系的核心,其全参数域双精度求值长期缺乏统一算法。scipy.special.hyp2f1作为行业标准,在特定参数分布下约三分之一的点有效数字不足10位。ScienceDiscovery使用glm-5.2模型,经48次扩展、598秒运行,生成199行程序。
在1000个全新测试点上,平均正确有效数字从9.836提升至11.771,达标点(≥10位)从659增至965。深入分析发现,程序自主发现并应用了一条经典恒等式:当z < −1时,标准级数不收敛,系统将其转换为1/z形式,并精确设定切换阈值。这一策略并非提示词中预设,而是搜索过程中自然涌现的数学洞察。
案例三:真实代码加速与物理规律反演
在AlgoTune基准(含154个真实数值任务)上,ScienceDiscovery以现成模型实现平均2.279倍加速,远超官方榜冠军claude-opus-4.6(1.837倍)及需强化学习训练的MetaEvolve(2.045倍)。提示词未指定任何优化技术,所有改进均由搜索自主发现,包括算法重构、内存布局调整等深层优化。
在符号回归任务中,系统面对纯数字表(4000行采样点),成功在111题中复现41.4%的物理定律,包括玻尔能级反解主量子数、普朗克分布反推温度等。平均每题仅调用模型16.5次,成本不足3元(deepseek-v4-flash),显著低于LaSR等需百万级遗传操作的方法。
动态选择机制:平衡深挖与探索
搜索效率的关键在于选择策略。ScienceDiscovery不采用贪心策略(仅扩展当前最优),而是对全树节点统一打分排序。高分节点优先被选中(集中资源深挖),但每次被选后其权重衰减,防止过早收敛。这种机制天然支持“回溯”——当某条路径连续多次无改进时,资源自动转向早期被搁置的分支。
积分案例中,最终版本源自第116版,而第116版由早已被超越的第65版(得分−2.22)改写而来。当时最优版(第95版,−0.99)已连续5次无进展,系统果断转向旧分支,最终发现更优解。若仅沿最优路径前进,此解将永远无法触及。
可扩展底座:四插槽架构支撑多领域适配
ScienceDiscovery的底层是一个固定四插槽的演进循环:改什么(What to rewrite)、从哪出发(From which candidate)、如何评估(How to score)、如何合并(How to merge)。算法变更仅需替换对应插槽实现,其余部分无需改动。树搜索、遗传算法、爬山法等均可无缝接入。
三个案例共享同一底座:积分任务更换评分函数(精度导向),代码加速任务关注运行时间,符号回归则验证表达式等价性。异步并发能力进一步提升效率——多个worker可同时扩展不同节点,突破Google ERA等串行实现的吞吐瓶颈。
验证瓶颈:从代码到实验科学的跨越
当前成功案例均具备低成本、快速机器验证特性:积分精度、代码速度、方程正确性均可在秒级判定。这使得236次迭代能在2小时内完成。然而,多数科研领域(如材料合成、生物实验)验证周期长达数天甚至数月,单次失败成本高昂。
要将RSI范式推广至这些领域,需突破两大瓶颈:一是加速验证,通过高保真仿真、代理模型预筛、自动化实验室压缩实验周期;二是确保分数可信度,避免代理指标与真实目标脱钩。每推进一步,可自动化的科研任务边界就向外扩展一圈。
未来,人类科研者的角色将转向定义目标与验证标准,而繁琐的试错迭代交由智能搜索系统完成。ScienceDiscovery所展示的,不仅是技术突破,更是一种科研范式的迁移——从“人主导试错”走向“系统自主进化”。随着验证技术的进步,这一范式有望重塑整个科学研究的效率边界。