Claude 11天完成费马大定理形式化证明:AI如何重塑现代数学验证范式?

0 阅读

费马大定理(Fermat's Last Theorem)自17世纪提出以来,一直是数学界最具传奇色彩的难题之一。其表述简洁至极:对于任意大于2的整数n,不存在正整数a、b、c满足aⁿ + bⁿ = cⁿ。然而,这一看似初等的命题却耗费了人类数学家超过350年的时间才得以彻底解决。1994年,安德鲁·怀尔斯(Andrew Wiles)与其合作者理查德·泰勒(Richard Taylor)最终完成了基于椭圆曲线与模形式理论的证明,标志着该问题的终结。但故事并未就此结束——数学界随即提出了一个更具工程挑战性的问题:能否让计算机对这一证明进行完全形式化验证

文章配图

2026年9月,Anthropic宣布,其AI系统Claude在短短11天内完成了这一任务,生成了约1300万行Lean代码,涵盖超过3万个中间定理,最终使用其中约29500个构建出完整的端到端证明。这一成果并非发现新的数学路径,而是将人类可读的证明文本精确翻译为机器可逐行检查的形式化语言。其工程规模之大,甚至超过了Lean核心数学库Mathlib的五倍,堪称形式化数学史上的里程碑事件。

形式化证明:从“显然成立”到“逐行可验”

传统数学论文依赖人类专家的直觉与共识。当作者写下“显然可得”或“易证”时,读者通常能凭借背景知识跳过细节。然而,形式化证明系统如Lean则要求每一步推理都必须严格源自公理或已证定理,不允许任何模糊跳跃。这种“超级编译器”式的验证机制,确保了逻辑链条的绝对严密性,但也带来了巨大的工程负担。

以怀尔斯的证明为例,其依赖现代代数几何、伽罗瓦表示、模形式等多个高深领域,涉及数千页前置文献。将其形式化意味着不仅要编码最终结论,还需将所有支撑性理论——包括群论、环论、范畴论乃至特定引理——全部用Lean语言重写。此前,学界普遍认为这是一项需多年社区协作的浩大工程。帝国理工学院Kevin Buzzard团队在2024年启动的项目,仅第一阶段技术蓝图就长达86页,足见其复杂性。

Claude的突破在于,它并非孤立地处理证明,而是通过多智能体协作架构,将整个任务分解为可并行推进的子目标。不同Agent分别负责定义扩展、引理证明、高层定理推导及模块整合。这种分布式策略极大提升了效率,但也带来了新的挑战:如何避免智能体在庞大任务空间中“迷失方向”?

Prove2Me:为AI数学家打造的协作操作系统

项目初期,多Agent系统迅速陷入混乱。随着代码库膨胀,各智能体难以同步全局状态,导致重复劳动、逻辑冲突甚至“失忆”——即忘记已完成的工作。Anthropic透露,早期尝试产生的代码最终仅占成品的7%,其余均因结构混乱被废弃。

转折点出现在引入Prove2Me平台。该系统由Tianyi Peng及其哥伦比亚大学合作者专为数学形式化设计,本质上是一个基于有向无环图(DAG)的任务调度引擎。整个证明被建模为节点网络:每个节点代表一个待证定理,边表示依赖关系。平台实时追踪哪些定理已证、哪些仍缺前置条件,并动态分配任务给最合适的Agent。

此外,Prove2Me实现了三项关键技术优化:

  • 定理与证明分离存储:允许独立更新证明而不影响定理声明,加速Lean编译;
  • 自然语言元数据嵌入:为每个定理附加人类可读描述,便于Agent语义搜索与复用;
  • 增量验证机制:仅重新检查受影响子图,避免全量重编译。

配合基于Claude Code的multi-agent harness,系统最终协调数十个智能体高效协作。整个过程消耗约60亿输出Token,所用模型能力大致相当于Claude Fable 5.1。值得注意的是,人类干预极为有限——Tianyi Peng仅提供高层级优先级提示,如“优先推进模性定理”或“加快伽罗瓦表示部分”,其余细节均由AI自主决策。

验证与意义:超越费马大定理本身

Anthropic强调,最终证明仅依赖Lean的三个标准公理(类型论基础、选择公理变体及排中律),并通过程序比对确认其定理陈述与Mathlib完全一致。这意味着验证权威并非Claude自身,而是Lean系统——AI只是“执笔人”,裁判仍是形式化逻辑本身。

Kevin Buzzard评价此为“非凡的自动形式化成果”,其意义远超单一问题的解决。历史上,形式化项目常因人力短缺而停滞。例如,四色定理的形式化耗时十余年,奇偶性定理(Feit-Thompson)亦历经六年。若Claude的方法可推广,则整个现代数学文献库的形式化进程或将提速一个数量级

更深远的影响在于科研范式的转变。过去,形式化被视为“事后验证”工具;如今,AI可将其融入研究流程——在提出猜想的同时生成可验证骨架,或在探索新理论时实时检查逻辑一致性。这种“证明即开发”的模式,可能催生新一代数学工作流。

技术启示:AI Agent在复杂知识工程中的边界

该项目也揭示了当前AI Agent系统的若干关键能力与局限:

首先,任务分解的粒度至关重要。过于粗粒度导致Agent无法聚焦,过细则增加协调开销。Prove2Me的DAG模型在两者间取得平衡,将证明拆解为逻辑原子单元,同时保留高层结构。

其次,记忆与状态同步是多Agent协作的核心瓶颈。传统LLM缺乏持久记忆,而Prove2Me通过外部图数据库实现全局状态共享,使Agent能“记住”整个项目的进展。

再者,领域专用工具链不可或缺。通用代码模型难以直接处理数学抽象,而Prove2Me提供的Lean语法感知、定理检索、依赖分析等功能,显著降低了Agent的认知负荷。

最后,人类角色正从执行者转向架构师。Tianyi Peng未编写一行Lean代码,却通过设计协作框架与设定目标优先级,引导系统走向成功。这预示着未来科研中,人类将更多承担“问题定义”与“策略制定”职责。

展望:形式化数学的新纪元?

Claude的成就并非终点,而是新起点。费马大定理虽具象征意义,但现代数学中存在大量更复杂、更分散的证明——如朗兰兹纲领相关成果,其形式化难度远超当前水平。下一步挑战在于:

  • 泛化能力:能否将Prove2Me框架迁移至其他形式化系统(如Coq、Isabelle)?
  • 交互增强:如何让数学家更自然地与AI协作,例如通过草图或口头描述指导证明路径?
  • 错误修复:当Lean报错时,AI能否自动定位并修正逻辑漏洞,而非仅重试?

与此同时,OpenAI的GPT-6 Astra正面向企业用户开放,强调长链路Agent任务与专业工作支持。可以预见,未来数年内,AI驱动的形式化验证将从“奇迹”变为“常规工具”,深刻改变数学、理论计算机科学乃至形式化安全验证等领域的工作方式。

费马在书页边缘写下“我发现了一个真正奇妙的证明,但这里空白太小,写不下”时,或许未曾想到,三个半世纪后,一台机器会用1300万行代码填满这片空白——不是为了炫耀新解法,而是为了向人类证明:我们终于能让逻辑本身开口说话。