超越大语言模型:科学数据如何重塑AI的“原住民”地位?

1 阅读

从文本处理到科学发现:AI进化的关键转折点

在2026年世界人工智能大会(WAIC)上,阿里云创始人王坚讲述了一个看似与主流AI叙事无关的故事,却精准地切中了当前技术发展的痛点。一名18岁的高中生,利用一颗已退役的小行星观测卫星留下的旧数据,重新进行分析,最终发现了近150万个此前从未被编目的天体。这颗卫星的设计初衷并非为了寻找这些天体,但通过新的分析视角,沉睡的数据被激活了。

这一案例并非孤立的奇迹,而是指向了人工智能发展中最容易被忽视、却最具颠覆性的方向。它揭示了一个核心事实:当前的AI普及速度虽惊人,但其本质仍停留在“处理已知”的层面。截至2025年底,中国生成式人工智能用户已达6.02亿,普及率高达42.8%。从2023年ChatGPT引爆认知到这一普及率,仅用了两年时间;若从国内DeepSeek-R1问世算起,甚至只需一年。相比之下,中国从1997年接入互联网到2012年达到同等普及率,耗时15年。然而,速度的背后是深度的缺失。

大语言模型的“已知”困境

我们日常接触的AI,绝大多数是“大语言模型”(LLM)。它们搭建在海量文本数据之上,本质上是让机器更高效地处理人类已经写好的文字。这类似于古代汉语加标点、分段的过程——通过优化文本结构来提升阅读效率,但并未改变文本本身的信息含量。

这种基于文本的AI,其能力上限被严格限制在人类已有的知识体系之内。它通过电算加速了知识检索和重组的速度,却无法主动探究那些尚未被人类用文字描述过的信息。当面对NASA卫星扫描出的原始红外数据、地震波的震动频率或基因序列的碱基排列时,传统LLM显得无能为力。除非人类提供极其清晰的任务指令和筛选依据,否则AI只会停留在“处理已知”的层面,无法跨越到“发现未知”。

这就是当前AI的智能边界,也是即将被打破的能力天花板。王坚在演讲中提出的“范式变革”,正是要求我们将科学数据从边缘推向中心,让科学数据成为基础模型里的“原住民”。

科学数据:基础模型的“原住民”

过去,基础模型的核心训练素材是语言和代码,科学数据长期被边缘化。然而,真正的智能突破往往发生在跨学科的数据交叉点。以古生物学为例,地层中的化石记录永远是不完整的,观测到的物种存续区间与真实范围之间存在天然偏差。过去,科学家依赖人工统计和地层对比,精度仅停留在“百万年”量级。

中国科学家团队通过模型整合了10万个生物属、近2万个物种的化石数据,构建了目前世界上最完整、最精确的地质时间轴,将时间标定精度提升至“万年”级别。这一跨越不仅是误差修正,更是两个数量级的质变。这项工作入选联合国“科学促进可持续发展十年”政策清单,证明了数据驱动科研的巨大潜力。

科学数据往往是碎片化、不连续且充满噪声的。传统人工分析难以理清多维度的复杂关联,而当今的大语言模型也不具备直接处理这类原生数据的能力。如果将科学数据同文本、代码纳入同一语义空间的通用基础模型,让科学拥有同等核心地位,AI将能够直接处理深空无线信号、大气环流数据、古生物化石记录等信息,从中发现人类肉眼无法识别的隐藏关联。

从“变革”到“革命”:智能定义的刷新

这种转变并非渐进式改良,而是从根目录出发的重新定义。2026年3月,之江实验室与瑞士联邦理工联合举办“AI+天文学”研讨会,印证了这种范式转移的可行性。事实上,之江实验室几年前就已启动“科学基础模型”项目,内部代号“021”(Zero to One),寓意从0到1的突破。

当AI能够直接理解光谱、地震波、基因序列等非文字信息时,它不再仅仅是快速执行命令的工具,而是能够主动思考和探索未知的“大脑”。这种能力的跃迁,将引发科研方法、教育模式、产业逻辑乃至社会结构的深层次变革。

回顾历史,今天的AI大模型竞赛,或许就像当年的功能机之争,声势浩大,却远不是终局。当18岁高中生能利用退役卫星数据做出顶级科研发现,当AI开始替代人类完成高维数据空间中的模式识别,我们正站在一个全新纪元的门槛上。这场“范式革命”一旦完成,人类对“智能”的理解将被彻底刷新。未来的AI,将是能够自主探索未知、发现隐藏规律的智能体,而不仅仅是知识的搬运工。

结语:迈向自主探索的智能时代

从文本处理到科学发现,AI的进化路径正在发生根本性偏移。科学数据作为“原住民”的引入,不仅拓展了AI的能力边界,更重塑了人机协作的模式。在这一过程中,数据的质量、维度和多样性将成为决定AI智能水平的关键因素。

未来,随着多模态基础模型的成熟,AI将能够无缝融合文本、图像、音频、视频以及各类科学传感数据。这种融合将打破学科壁垒,促进跨领域的创新爆发。例如,在药物研发中,AI可以直接分析分子结构与临床数据的关联,加速新药发现进程;在气候变化研究中,AI可以整合卫星遥感、海洋浮标和大气监测数据,提供更精准的气候预测。

然而,这一进程也面临挑战。科学数据的标准化、隐私保护以及算法的可解释性等问题,需要技术界、政策制定者和伦理学家共同解决。只有建立起完善的数据治理框架,才能确保AI在探索未知的过程中保持安全、可靠和可控。

总之,AI的下一步不是简单的规模扩张,而是深度的范式革命。通过让科学数据成为基础模型的核心,我们将迎来一个AI能够主动思考、自主探索的新时代。这不仅是对技术的升级,更是对人类认知边界的拓展。在这场革命中,每一个参与者都将成为见证者和推动者,共同塑造智能的未来。