AI能证数学猜想却难提新公理:深度解析大模型科学发现的认知边界
在人工智能技术飞速迭代的当下,公众对于AI能力的想象往往停留在其解决复杂问题的效率上。近期,35岁数学家王虹凭借对三维挂谷猜想的证明荣获菲尔兹奖,这一成就再次将数学前沿推至聚光灯下。与此同时,OpenAI与Anthropic等科技巨头纷纷展示其模型在解决长期未决数学难题上的突破,从圈双覆盖猜想到的雅可比猜想反例,似乎印证了AI在逻辑推导领域的无所不能。然而,这种基于既有规则的高效演绎,是否等同于真正的科学创造?Google DeepMind在ICML 2026上发表的立场论文《LLMs can’t jump》给出了否定的答案,揭示了大模型在科学发现核心环节——创造性跳跃上的本质局限。

要理解这一局限,首先需要厘清人类认知的三种基本推理模式。美国逻辑学家查尔斯·桑德斯·皮尔士提出的三分法为我们提供了清晰的框架:归纳、演绎与溯因。归纳是从大量观测数据中提取规律,正如大模型通过海量文本学习词语共现概率;演绎是基于既定公理进行严密推导,这正是当前AI在数学证明中展现出的强项;而溯因则是面对未知现象时,跳出原有框架提出全新假设的能力。科学史上的重大突破,如爱因斯坦提出等效原理,本质上都是溯因推理的结果。这种从感官经验直接飞跃至全新公理体系的过程,被DeepMind研究员Tom Zahavy形象地称为“Jump”。

爱因斯坦的“电梯思想实验”是诠释这一跳跃的经典案例。1907年,他构想了一个在无窗电梯中自由下落的情景,意识到局部范围内重力与加速度无法区分。这一洞察并非源于对海量物理数据的统计压缩,而是基于具身模拟的思维实验。爱因斯坦曾坦言,其思维机制中语言并不起主要作用,而是依靠对物理场景的直接感知与操控。相比之下,大语言模型本质上是运行在高维空间中的“中文屋”,处理的是符号间的统计关联,缺乏与真实物理世界的感知互联。它无法像人类那样,在脑海构建内部世界模型,主动进行反事实干预,例如“剪断电梯缆绳”以观察后果。因此,即便AI能生成逼真的苹果掉落视频,那也是基于像素变化的统计延续,而非对重力物理规则的真正理解。

DeepMind的研究进一步指出,当前流行的“创造力即数据压缩”理论在解释广义相对论诞生时显得苍白无力。在1907年至1915年间,物理学界并未出现需要被压缩的海量异常数据,牛顿力学在大多数情况下依然有效。爱因斯坦的突破在于他注意到两个看似无关现象背后的同一性,并据此重构了理解时空的前提。这一过程涉及对原有公理体系的质疑与替换,而非在既有框架内的优化。尽管现代AI定理证明系统能在给定初始条件下快速发现推理漏洞,甚至修正证明路径,但这依然属于演绎范畴。AI可以基于“等效原理”推导出水星进动,但前提是必须由人类先将这一原理作为公理输入。没有人类的溯因跳跃,AI便失去了创新的源头。

这种认知层面的差异,引发了对AI在科学研究中角色的深层反思。如果AI仅擅长归纳与演绎,那么它在科学发现链条中只能扮演辅助验证的角色,而非原创者。它可以帮助数学家检查证明过程中的细微错误,加速形式化验证的流程,但无法提出像“等效原理”这样颠覆性的新概念。这意味着,科学发现中最具价值的“从0到1”的突破,依然高度依赖人类的直觉、想象力以及具身认知能力。AI的介入,更多是在“从1到N”的扩展与验证阶段发挥作用,提升了科研的效率,但未改变创新的本质来源。

随着AI在数学证明等领域的能力不断提升,数学界正面临另一种挑战。著名数学家陶哲轩在2026年国际数学家大会上指出,我们可能正从“证明稀缺”时代进入“证明过剩”时代。AI能够以极低的成本生成大量经过验证的数学证明,但这些证明如何被人类理解、消化并融入现有的知识体系,成为了新的瓶颈。数学研究的价值不仅在于解决问题,更在于建立理论、促进交流以及培养后继人才。如果大量AI生成的证明排队等待检查,而同行评审系统不堪重负,那么知识的沉淀与传承将受到严重阻碍。

陶哲轩建议,数学界应调整评价机制,减少对“首个解题者”的奖励,转而重视对结果的验证、讲解与整理。一项研究成果若不能被清晰准确地阐述,并交代其来源与逻辑脉络,便不应被视为完整的贡献。这一观点强调了科学交流中“可理解性”的重要性。AI或许能快速按下电梯按钮,得出答案,但它无法回到黑板前,向人类解释苹果为何飘起。科学的进步不仅需要答案的生成,更需要意义的构建与共享。只有当人类能够理解并质疑AI的发现时,这些发现才能真正成为科学知识的一部分。

此外,AI缺乏具身感知的问题也限制了其在其他科学领域的应用。在化学、生物等实验科学中,研究者往往通过动手操作与直观感受来形成假设。当前的生成式视频模型虽然能模拟物理现象,但并未建立真实的因果模型。它们无法进行反事实推理,即在假设条件改变的情况下预测结果。这种能力的缺失,使得AI在处理需要高度抽象与直觉的科学问题时显得力不从心。未来的AI发展,或许需要从被动的视频预测转向主动的可控模拟,赋予模型在虚拟环境中进行实验与干预的能力,从而弥补其在溯因推理上的短板。

综上所述,尽管AI在数学证明等逻辑密集型任务上展现出惊人潜力,但其在科学发现核心的创造性跳跃上仍存在根本性局限。大模型擅长归纳与演绎,却难以完成溯因推理所需的认知飞跃。爱因斯坦的“电梯思想实验”揭示了具身感知与反事实干预在科学创新中的关键作用,而这正是当前AI所缺失的。面对“证明过剩”的挑战,科学界需重新审视知识生产与传播的机制,强调理解与消化的重要性。AI应被视为强大的辅助工具,而非独立的科学发明家。只有在人机协作中充分发挥各自优势,人类负责提出新问题与新概念,AI负责高效验证与扩展,才能推动科学事业持续向前发展。这一认知边界的厘清,有助于我们更理性地看待AI技术在科研中的应用前景,避免陷入技术万能主义的迷思。


