开源版Claude Science落地:OpenAI4S如何以Code-as-Action重构科研工作流
从“对话”到“行动”:科研智能体的范式转移
在人工智能辅助科学研究(AI for Science)的浪潮中,我们见证过无数演示Demo的惊艳亮相。然而,当兴奋退去,科研人员往往面临一个尴尬的现实:大多数AI助手仅停留在“聊天”层面。它们能给出看似合理的文献综述或代码片段,却难以真正进入复杂的科研闭环。查库、清洗、计算、绘图、报告生成,这些步骤中任何一环的断裂,都可能导致整个分析流程的崩塌。传统的基于工具调用的Agent,本质上是在一个静态的“工具菜单”中做选择题,这种模式在处理线性、短路径任务时尚可应对,但在面对需要多步迭代、状态维持和复杂逻辑分支的科研长程任务时,显得力不从心。
正是为了突破这一瓶颈,北京大学与元空AI Agent联合实验室推出了OpenAI4S项目。这不仅仅是一个简单的开源复刻,而是一次对科研智能体底层架构的深度重构。该项目沿用了Anthropic Claude Science所倡导的“代码即行动”(Code-as-Action)理念,但通过独立的开源实现,解决了闭源模型在数据主权、算力自主和流程定制上的痛点。OpenAI4S的核心突破在于,它将智能体从“旁观建议者”转变为“执行参与者”,让AI在一个持续运行的Python或R内核环境中直接编写并执行代码。这意味着,中间数据、临时变量和绘图对象被保留在内存中,而非在每个步骤后重新通过文本传递。这种架构上的改变,使得AI能够像人类研究员一样,在一个完整的笔记本环境中处理从数据下载到结论输出的全过程。
核心架构解析:Code-as-Action与持久化内核
OpenAI4S之所以能实现如此流畅的科研自动化,关键在于其“Code-as-Action”的执行机制与传统Agent的显著差异。在传统的Agent架构中,模型生成代码,用户运行代码,再将输出反馈给模型,这是一个离散的、以文本为媒介的循环。而在OpenAI4S中,代码是行动本身。智能体生成的每一行Python或R代码,都会在一个持久化的计算环境中立即执行。
这种持久化内核带来了几个革命性的优势。首先,它实现了状态的连续传递。当智能体下载完一组蛋白质序列数据后,这些数据结构会直接存在于环境变量中。当它接下来需要绘制热图时,无需再次描述数据来源,而是直接引用变量进行可视化。其次,它支持复杂的逻辑控制。循环、条件判断、异常处理等编程逻辑可以被组合在一次执行中完成。例如,智能体可以编写一个脚本,自动遍历多个样本,对每个样本进行独立的统计检验,并将结果汇总。这种能力使得AI能够处理那些需要反复调整参数、批量处理数据的科研场景。
此外,OpenAI4S的Web界面设计也紧密围绕这一核心展开。它不仅仅是一个聊天窗口,更像是一个集成了代码编辑器、文件管理器和结果展示区的科研工作台。研究人员可以随时中断智能体的自动执行,打开Notebook检查中间代码,手动修正逻辑,或者调整参数后重新运行。这种“人机共驾”的模式,既发挥了AI在自动化执行上的效率优势,又保留了人类专家在关键节点上的控制权,确保了科研过程的可解释性和可控性。
30+科研Skills:将专业能力代码化
通用大模型的“聪明”并不等同于科研领域的“专业”。要让AI真正理解并执行科研任务,必须将其内置大量的领域知识。OpenAI4S首批内置了30多个科研Skills,覆盖了蛋白质结构、序列分析、分子对接、单细胞测序、文献检索等主流计算生物学和化学场景。然而,这些Skills并非简单的API封装或参数预设,而是被设计成一组可以被智能体理解、调用和组合的“代码配方”。
以蛋白质结构预测为例,这个Skill不仅仅是一个调用AlphaFold模型的接口。它内部封装了从UniProt数据库检索序列、从RCSB PDB获取参考结构、调用GPU服务器进行推理、以及计算pLDDT置信度分数的完整代码逻辑。当用户下达“分析这个蛋白质的结构稳定性”指令时,智能体会检索这些Skill,识别出其中包含的依赖关系(如需要GPU、需要特定序列格式),并自动生成符合要求的执行代码。
这种设计使得Skills具有极强的扩展性。新的数据库、新的算法模型或新的实验流程,可以被开发者以代码片段的形式封装成新的Skill,并加入系统。例如,随着新材料科学的突破,研究人员可以编写一个专门用于计算材料能带结构的Skill,并无缝接入到OpenAI4S的工作流中。目前,已有14个Skill专门封装了需要GPU或高性能计算资源的能力,如突变效应评分、分子动力学模拟等。这种将专业能力“代码化”而非“黑盒化”的策略,确保了智能体在面对复杂科研任务时,不仅能“想”到该做什么,还能“做”得对、做得准。
严格的不伪造策略:科研诚信的数字防线
在科研领域,数据造假和结果幻觉是致命的错误。对于AI智能体而言,最大的风险莫过于为了完成任务而“编造”数据或模拟结果。OpenAI4S建立了一套严格的“No-Fabrication Policy”(不伪造策略),将科研诚信嵌入到系统底层逻辑中。
这一策略规定:智能体必须使用真实的数据源和真实的计算资源。如果连接不到外部数据库,它不能生成模拟序列;如果本地没有GPU资源,它不能假装运行了分子模拟;如果算法报错,它必须如实报告失败,而不能提供一份看似完美但实际错误的结果图表。以胰岛素(INS)蛋白分析案例为例,OpenAI4S会真实地从UniProt下载序列,从RCSB下载结构。如果遇到网络超时或计算资源不足,它会直接报错或跳过该步骤,绝不会为了凑出一份完整的报告而捏造数据。
这种“宁可算不了,绝不瞎编”的原则,对于科研智能体的可信度至关重要。在真实的科研工作中,负结果也是重要的科学发现。OpenAI4S通过这种方式,将AI从一个潜在的“造假者”转变为一个诚实的“实验记录员”。它迫使研究人员关注那些真正可执行、可验证的任务环节,从而建立起对AI生成结果的信任。这种信任,是AI for Science从辅助工具走向核心研究基础设施的前提。
算力调度与产学研协同:开源生态的未来
科研计算对算力的需求是巨大的,尤其是涉及蛋白质折叠、分子动力学模拟等高负载任务。单机笔记本往往难以胜任。OpenAI4S通过其架构设计,巧妙解决了这一难题。它支持接入自有计算环境,采用“本地交互+远程算力”的混合模式。智能体在本地负责逻辑编排、代码生成和结果可视化,而将具体的计算密集型任务通过SSH或API派发到研究人员自有的GPU服务器或集群上执行。
这种架构不仅降低了用户的使用门槛,无需在本地配置复杂的环境和昂贵的硬件,还保护了数据隐私。敏感的研究数据可以完全保留在本地或机构内部服务器上,只有经过处理的中间结果或模型权重才会被传输。这使得OpenAI4S非常适合高校实验室、医院和制药公司等对数据安全有高要求的机构。
OpenAI4S的开源,不仅是技术的分享,更是产学研协同模式的创新。该项目由北京大学与元空AI联合实验室共同推动,凝聚了多位研究生和工程师的智慧。它向全球的高校、科研机构和开发者发出邀请,共同构建这一科研基础设施。通过开放核心架构和Skills接口,OpenAI4S希望吸引不同领域的专家,开发针对化学、材料、地球科学等更多学科的专业Skills。这种众包式的开发模式,有望加速AI for Science生态的成熟,让科研智能体真正从Demo走向大规模应用,成为科学家手中不可或缺的数字助手。