阿里浙大推出 Astar:让 AI 自主决定下一步怎么进化

6 阅读

算法工程师最后的堡垒,也被 AI 攻破了?

过去几年,AI 已经能帮你写代码、跑实验、做评估。算法工程师的日常,逐渐变成:让 LLM 整理昨天的实验结果,让 LLM 实现新想法,再让 LLM 监控训练进程。似乎只要把需求说清楚,AI 就能完成大部分工作。

图片

但有一件事始终绕不开人:到底该往哪个方向改模型?

图片

这个“发现改进点”的能力,高度依赖工程师的经验和直觉。一个团队迭代快不快,往往卡在这一步。现在,连“怎么让自己变强”这件事,AI 也能自己做主了。

图片

阿里和浙江大学联合推出了 Astar ——一个专门用于指导 AI 系统进化的语言模型。它不靠通用知识,而是去翻 AI 系统自己的“进化血泪史”:那些散落在 Git 提交记录里的代码变更、训练日志和业务指标变化。把这些真实反馈内化后,Astar 能根据当前系统状态,自适应地提出下一步演化方向。

图片

在阿里核心推荐业务落地时,Astar 自动主导了 20 轮全链路迭代,离线 HitRatio 提升 23.6%,线上 GMV 增长 4.86%。更关键的是,它把人类产生有效 idea 的效率提高了 10 到 100 倍。

图片

为什么通用大模型搞不定工业级迭代?

图片

有人会问:既然 GPT、Claude 这么聪明,直接把代码丢给它们出主意不行吗?

图片

问题在于,工业场景太特殊。通用大模型学的是公开论文和开源项目,但真实业务系统往往是高度定制化的:数据分布偏斜、模型结构复杂、训练 pipeline 充满历史包袱。在这种环境下,通用建议常常水土不服。

工程师照着改完,满怀期待等三天三夜,结果指标纹丝不动,甚至反向跳水。算力和时间全打了水漂。

根本原因在于:AI 系统的迭代不是纯逻辑问题,而是一个带反馈的工程决策问题。你不仅要知道“理论上怎么改”,更要清楚“在这个特定系统里,哪种改法能带来正向收益”。

而这种经验,恰恰藏在系统自身的演化历史里。

从 Git 提交里挖金矿:Astar 的数据来源

Astar 团队盯上了每个算法团队都有的东西:版本控制系统里的提交记录

每一次 commit,都记录了模型从上一版到下一版改了什么代码,以及随之而来的 loss 曲线、AUC、HitRate 等指标变化。这相当于一份带着真实业务反馈的“避坑指南”——哪些改动有用,哪些是无效折腾,一目了然。

但要把这些杂乱的工程日志变成可学习的数据,得先跨过四道坎:

  • 数据太少:一个仓库的真实算法迭代可能只有几十次,相邻两次提交的差异又很小,监督信号极其稀疏。
  • 满库是“水”:大部分 commit 其实是加日志、改路径、删注释,跟模型性能毫无关系。
  • 搜索空间太大:改进方向太多——换损失函数?调优化器?改网络结构?每个方向下还有无数微操。
  • 验证成本太高:跑一次完整训练+评估要几小时甚至几天,没法像普通 RL 那样海量试错。

Astar 的整套设计,就是围绕这四个挑战展开的。

四招破局:Astar 的核心技术设计

1. 数据太少?两两组合,无中生有

与其只看相邻版本的演进,不如把历史上任意两次实验配对。比如对比 v1 和 v5,拉出它们的完整 loss 曲线,谁更低谁就是更好的版本。

这样,原本只有 N 次迭代的记录,瞬间扩展成 N² 个训练样本。更重要的是,模型既能学到短期微调技巧(如调整学习率),也能捕捉长期架构跃迁(如引入新模块)。

2. 满库是“水”?两级过滤,拧干水分

第一级是执行逻辑过滤:通过代码调用图(Reachability)和抽象语法树(AST),自动剔除所有不影响执行路径的改动——比如打印语句、死代码、格式调整。

第二级是进化意图过滤:用 LLM 对剩余代码做语义分析。如果一段修改无法被归类为明确的优化意图(如“提升收敛速度”“缓解过拟合”),就视为噪音丢弃。

经过这两轮清洗,留下的基本都是能真实影响模型性能的干货。

3. 空间太大?三级指引,层层递进

Astar 在训练时给数据打上了三级标签提示

  • 一级:主方向(如“优化策略”“特征工程”)
  • 二级:细分模块(如“Muon 优化器”“梯度正交化”)
  • 三级:具体动作(如“梯度降噪”“调整正交化阈值”)

推理时,模型也按这个逻辑思考:先定大方向,再聚焦模块,最后落实到具体代码。这种结构化生成,把近乎无限的搜索空间压缩成可管理的路径。

4. 验证太贵?离线打分,秒级初筛

团队用历史正负样本训练了一个奖励模型(Reward Model)。面对一个生成的改进方案,它能在一秒内预测出该方案降低 loss 的概率。

有了这个“代理专家”,系统可以:

  • 在海量生成中快速筛选出 top 几个靠谱方案上机验证
  • 为 Astar 的强化学习(RL)阶段提供低成本反馈,支持它主动探索新方向

这彻底绕开了“每次都要跑完整训练”的瓶颈。

小模型干翻人类专家?实测数据说话

基于上述处理后的演化语料,Astar 经历了标准的三阶段训练:中间训练(mid-training)→ 监督微调(SFT)→ 强化学习(RL)。

效果如何?在相同的推荐系统优化任务中:

  • 人类资深算法专家:单次生成有效方案的成功率(S@1)为 32.29%
  • 最强通用模型 GPT-5.5:30.71%
  • Astar 0.6B(6 亿参数):54.35%
  • Astar 8B:67.86%

这意味着,即便是最小的 Astar 版本,单次建议的有效性也远超人类和通用大模型

更惊人的是效率。过去,人类一周最多验证十几个方向;现在,Astar + 奖励模型 + 自动化 pipeline,能把单次试错成本从“天”压缩到“分钟”,迭代吞吐量提升一到两个数量级

真金白银的验证:Lazada 推荐系统实战

理论再好,也得看线上表现。团队直接让 Astar “接管” 了阿里 Lazada 核心广告推荐系统的演进,在无人干预的情况下连续跑了 20 轮全自动迭代。

结果:

  • 离线 HitRate@200 提升 23.6%
  • 线上 GMV(商品交易总额)增长 4.86%
  • 广告收入提升 1.82%
  • 点击率和订单量同步显著上升

要知道,这是个已经被无数专家反复优化过的成熟系统。在这种地方还能靠 AI 自动生成的改进拿到真金白银的增长,足以说明 Astar 的实战能力。

Astar 到底提了什么“神仙建议”?

以其中一个真实案例为例。

当时团队尝试引入新一代 Muon 优化器。它的特点是通过正交化把梯度各方向的权重“拉平”,在干净数据上效果极佳。但在推荐场景中,数据充满噪声,这种“一刀切”反而放大了本该被抑制的随机波动。

通用大模型的建议通常是:“调低学习率”或“换回 Adam”。但 Astar 给出了一个极具数学美感的方案:

“在正交化之前,先做频谱降噪(Spectral Denoising)。”

具体来说,它建议利用随机矩阵理论中的 Marchenko-Pastur 定律,计算出一个确定的数学边界:高于边界的信号正常拉平,落入噪声分布区间的信号直接压制。

这个改动:

  • 保留了 Muon 优化器的核心优势
  • 解决了噪声放大问题
  • 没有增加任何额外训练参数

这种直击痛点的修改,正是建立在 Astar 对该系统数据特性和算法数学本质的深度理解之上——而这恰恰是通用模型做不到的。

未来:人类设计 Meta-AI,AI 负责执行

Astar 的真正威力,还在于它的自我进化闭环

  1. Astar 提出改进方向
  2. Code Agent 自动生成代码并启动实验
  3. 验证结果回流到系统
  4. 新数据反哺 Astar,使其指导能力持续增强

这意味着 Astar 是一个“活着”的模型,会随着系统一起成长。

但这并不意味着算法工程师会被取代。相反,分工正在升级

  • AI 负责:尝试微调、跑实验、验证效果
  • 人类负责:设计元框架、定义新范式、构建更聪明的“造物飞轮”

当繁琐的试错劳动被自动化,人类的创造力才能真正聚焦于更高维的突破。AI 系统的无限进化之路才刚刚开始,而算法工程师,依然是这场变革的领航者。