AI复现2200篇ICML论文:人类与智能体的协作新范式
引言
2026年7月,Hugging Face发起了一场前所未有的科学实验:邀请全球社区成员使用AI编程智能体,对ICML 2026会议上的论文进行大规模复现。这场黑客松不仅是对AI研究可重复性的一次大考,更是对人类与智能体协作模式的一次深度探索。在19天内,1200多名参与者发布了6816份复现日志,覆盖了2226篇论文,约占整个会议论文的三分之一。这一壮举引发了我们对AI时代科学研究方式的深刻思考。

背景:AI研究的可重复性危机
AI研究的可重复性问题由来已久,但随着AI智能体加速实验和写作过程,问题变得更加严峻。ICML 2026收到了23918篇投稿,最终接受了6352篇论文,几乎是前一年的两倍。审稿人的数量并未同步增长,导致许多论文的审查深度不足。例如,一篇获得spotlight的论文,其审稿人坦言:“我的低置信度分数是因为我没有仔细检查所有证明。”这种状况凸显了传统同行评审的局限性,也促使我们探索新的审计方法。

黑客松的设计与执行
挑战机制
挑战从7月15日持续到8月2日,其核心机制包括:
- 论文选择:我们索引了所有6341篇ICML 2026论文,并提取了每篇论文的核心科学声明,使智能体能够从具体、可检查的目标开始。
- 自带智能体:参与者使用Claude Code、Codex、Cursor等工具,我们提供了简化接口,使智能体能够一键获取论文、声明和挑战说明。
- 完全公开:每次运行都会生成Trackio日志,包含代码、产物和完整的智能体执行轨迹,确保审计过程本身可审计。
- 自动评判:一个基于GLM-5.2的日志评判器对每个声明给出验证、证伪、玩具或不确定的结论,并明确将日志的自我评估视为不可信。

参与规模
- 1221名社区成员加入组织
- 6816份复现日志发布
- 2226篇论文被尝试复现,占会议论文的34%
- 35908个声明被评判,所有结论在挑战结束时公开
- 2962个云作业启动,274个完整智能体轨迹数据集发布
主要发现
复现成功的案例
51%的受检论文(1103篇)至少有一个声明被独立验证。其中,266篇论文被完全复现,632篇部分复现且无证伪。例如,关于“平坦极小值与泛化”的论文被20个独立团队复现,其中12个团队验证了所有声明。另一篇关于LLM法官可靠性的论文,17个日志中有14个验证了所有声明,这本身就是一个有趣的元发现。
证伪与争议
23%的受检论文(496篇)至少有一个声明被证伪或质疑。其中,49篇论文的所有声明均被证伪,242篇论文的独立复现团队对同一声明得出了相反结论。这揭示了可重复性的对抗性本质。
关键证伪案例
- 分页算法论文:论文声称其算法达到鲁棒性Hk+O(1),但复现发现附加项随k增长,且定位了证明中的具体错误步骤。我们的重新实现将k扩展到1024,确认了约9西格玛的偏差,真实鲁棒性应为Hk+Θ(log k)。
- 注意力机制理论:论文证明token粒子在原点位于凸包内时会坍缩到原点,但三个独立团队发现了反例,最早在t=224步出现。这解释了为何有限时间检查会“验证”该声明。
- 自蒸馏论文:论文的理论分析基于反向KL散度,但代码默认使用前向KL,且复现未能重现论文的+4pp结果。作者已确认并更新了arXiv版本。
- Transformer投影论文:约66%的评估标签位置是EOS填充标记,导致困惑度被低估约三倍。修正后,论文声称的“3.1%质量成本”实际约为9.4%。
虚假证伪的教训
我们也发现了复现中的错误。例如,一个日志声称论文方法比基线慢2倍,但实际上是复现代码中的算术错误:比较了每轨迹时间与每批次时间。正确归一化后,数据反而证实了论文声称的8倍加速。
与作者的互动
我们已开始联系所有确认发现的作者,以“这是我们的发现,证据在此,您同意还是我们的分析有误?”的框架进行沟通。早期反馈非常积极,多位作者确认了发现,两篇arXiv更正正在进行中,还有一位作者在挑战前一个月已悄悄修复了错误,这被视为独立收敛。
人类与智能体的协作
纯智能体执行的局限
尽管智能体表现出色,但纯智能体执行存在明显局限:它们可能陷入局部循环,误读尺度相关行为(如分页论文的“验证”来自过早停止的检查),甚至基于单位不匹配构建整个证伪。最可靠的结果来自人类引导的工作流:重新定向智能体、质疑假设、在浪费计算资源前判断实验前提是否错误。
人类不可替代的评估
某些评估本质上是人类的,例如,在量化图像生成论文中,数值指标显示“无崩溃”,但图像是否真正可用是感知问题。我们的获奖者构建了专门的审查界面,由人类亲自判断128对图像,并将注释提交到仓库,智能体随后验证其一致性。这展示了人类在感知和语义判断中的独特价值。
管理智能的有效性
我们的角色更像是教授或首席研究员,为智能体创造良好的工作环境,提供计算资源、数据访问和适时反馈。最成功的参与者是那些构建了正确环境并提出正确问题的人,然后让智能体去执行。
结论与展望
这次挑战是迄今为止对机器学习会议进行的最大规模、逐声明的开放审计。我们证明了AI智能体在科学审计中的巨大潜力,同时也强调了人类在关键决策和感知评估中的不可或缺性。未来,我们期待更多这样的活动,推动科学研究的透明度和可重复性。所有日志、结论、轨迹和产物均已公开,我们希望这一记录不会保持太久。
感谢所有参与者、获奖者、以优雅态度回应的作者,以及Hugging Face和alphaXiv的组织者。让我们共同期待下一次复现挑战。