Anew Labs 首轮融资后亮出技术底牌:结构预测、湿实验闭环与垂直大模型
通用与垂直正在靠近
最近几个月,AI 制药领域出现了两条明显靠拢的路径:一边是 Anthropic 这样的通用大模型公司开始组织生物实验,另一边是 Isomorphic Labs 这类专注生物分子建模的团队开始招聘大模型人才。

今年 6 月,Anthropic 推出 Claude Science,把科研工具、计算资源和大模型整合进同一个工作环境。它随后展示了 Claude 调用专业模型设计蛋白结合分子,并交由外部实验室验证的结果——大模型的角色正从“助手”转向能组织研究任务的 Agent。

几乎同时,Alphabet 旗下的 Isomorphic Labs 宣布完成 21 亿美元 B 轮融资。这家公司由 AlphaFold 背后的 Demis Hassabis 领导,目标是用 AI 重构药物研发流程。近日,它挂出了 LLM 相关岗位,明确要“在前沿模型上大规模实施和优化 LLM 后训练方法”。

就在这个节点,一个过去五年鲜少公开发声的团队——Anew Labs——也把布局摆到了台前。他们刚完成分拆后的首轮融资,金额达 2.9 亿美元,投资方包括红杉中国、高瓴、IDG 等头部机构。紧接着,官网悄悄上线了名为 AnewDDE 的技术报告,集中展示了结构预测、亲和力评估、抗体湿实验闭环设计,以及千亿参数大模型 AnewMind。

这使得 Anew 值得与 Anthropic、Isomorphic 放在一起观察。三家起点不同,却都在尝试连接领域专业模型、大模型与实验反馈。Anew 展示的,正是自己在这几个环节上已经做到哪一步。
结构预测略优于 IsoDDE,但关键在后续转化
AnewFold 的核心结果,先看两组数字:在 FoldBench 抗体-抗原结构预测任务上,成功率为 76.2%,而 Isomorphic 公布的 IsoDDE 为 75.6%;在蛋白-配体任务上,两者分别为 77.4% 和 76.0%。这些任务回答的是:给定参与相互作用的分子,模型能否准确预测它们以什么位置和形状结合。
报告还测试了更复杂的分子胶三元体系。在 131 个共同案例中,AnewFold 同时预测蛋白界面与配体位置的联合成功率达到 71.8%,高于几个开源基线。
这些数据足以让 Anew 进入最前沿生物分子模型的讨论圈。但必须承认,小幅分差不足以证明明确领先,评测设置是否完全对齐也存疑。更有意义的判断是:Anew 已展示出接近前沿的结构预测能力,接下来要看它如何转化为实际的研发收益。
毕竟,模型性能会被持续追赶。长期价值不只取决于预测准不准,更在于:候选分子怎么选、预测失败如何识别、实验结果如何反馈到下一轮优化。为此,AnewDDE 不只包含 AnewFold,还有亲和力评估工具 AnewAffinity、设计流程 AnewDesign,以及面向研发推理的 AnewMind。它们分别服务于结合强弱评估、候选设计和证据分析。
这套模块化布局是加分项,但模块之间是否产生协同效应,还得看具体任务中的表现。
纳米抗体 vs. protein minibinder:实验目标不同,不能只比命中率
AnewDDE 报告了一项针对内部靶点的纳米抗体(VHH)设计实验。Agent 先检索文献与结构数据库,分析结合位点,再组织生成和筛选。第一轮从 3092 个初筛候选中推荐 50 条序列进入湿实验,最终得到 7 个 KD 低于 400 nM 的克隆。
实验结果随后用于亲和力优化。第二轮测试 100 个候选,获得 16 个个位数纳摩尔 KD 的克隆。KD 越低,通常意味着结合越强,而纳摩尔级别的 KD 是产业界对治疗性抗体的基本要求。两轮共测试 150 个克隆,强结合抗体占比为 10.7%。
熟悉 Anthropic 动态的人可能会问:Claude 的蛋白设计命中率不是更高吗?确实。Anthropic 8 月公布的实验中,在不同设置下实现了约 22%—35% 的结合命中率,后续又报告跨 12 个靶点接近 50% 的成功率。
但这两组数字不能直接比较。
关键区别在于:Anthropic 设计的是 protein minibinder,而 Anew 做的是纳米抗体。
两者都属于 binder,但所处的研发语境完全不同。Anthropic 自己也在报告中明确指出,protein minibinder 尚非标准治疗药物形式,现阶段主要用于机制研究或靶点验证,真正进入临床的案例极少。相比之下,抗体是高度成熟的药物平台,其设计不仅受特定骨架和 CDR 区域约束,还需兼顾亲和力、稳定性、可开发性等更贴近成药的实际问题。
因此,“测到结合”和“达到个位数纳摩尔亲和力”本身就是不同门槛。靶点难度、实验迭代轮次、验证标准都会显著影响结果。更准确地说,Claude 展示的是通用 Agent 参与蛋白设计的学术探索能力,而 Anew 的工作更贴近工业级候选药物开发的要求。
Anthropic 证明了通用模型能调用垂直工具、在多个靶点上组织设计;Anew 则展示了从初始命中到实验反馈优化的完整闭环。后者目前基于单个内部靶点,跨靶点验证和功能评估仍需补充,但两轮设计带来亲和力提升,是有价值的执行证据。
这也引出一个核心问题:当通用模型越来越擅长调用工具,垂直公司的优势在哪里?
Anew 的潜在优势,是同时掌握专业模型、实验流程和项目经验。能否靠这些能力提高每轮实验的产出效率,比一次性的命中率更值得跟踪。
垂直大模型的价值不在参数规模,而在反馈飞轮
AnewMind Preview 是报告中最吸引 AI 从业者关注的部分。Anew 在具有推理能力的大模型底座上,进行了千亿参数规模的全参数后训练,目标是增强模型对研发证据和决策约束的理解。
报告显示,AnewMind 在四组 ADMET 与药物性质评测中均进入参评 LLM 前五,其中环肽渗透性排名第一、抗体可开发性排名第二。在 PharmBench 上,总分位列 17 个模型第三,分子设计与合成分项排名第一。
领域训练确实可能带来特定任务收益。但千亿参数和全参数后训练本身并不构成产品护城河。药企完全可以直接使用最强的通用模型,为什么还要用 AnewMind?
Anew 自己的评测也承认,通用模型在不少研发任务上表现强劲,AnewMind 并未全面领先。报告缺少完整的基座对照和训练消融实验,外界难以判断各项提升究竟来自数据、训练方法,还是架构调整。
因此,更合理的期待是:AnewMind 能否在具体研发环境中形成持续优势? 比如支持私有部署、处理敏感数据、无缝对接内部专业工具,更重要的是——能否用新的湿实验反馈形成“研发-训练”飞轮,持续提升模型能力。
垂直模型的机会,恰恰在于能持续获得通用模型接触不到的真实研发反馈,并将其转化为可重复的能力提升。Anew 同时拥有算法团队、实验平台和自有管线,具备探索这条路径的条件。但实验数据不会自动变成优质训练数据:失败原因如何标注、不同实验如何对齐、模型建议是否真的改善了结果,都需要大量额外工作。
后训练只是起点,研发与训练之间的反馈能否持续运转,才是长期竞争力的来源。
PharmBench:考的不是知识,而是研发判断
PharmBench 是 AnewDDE 中容易被忽略但极具价值的部分。它包含 50 个研发场景、200 道问题,由制药专家结合真实项目决策和实验结果设计。
这里考的不再是教科书知识,而是多年制药实践中沉淀下来的隐性经验:知道哪些数据可信、结论能推多远,以及什么时候必须对一个“漂亮结果”保持怀疑。
例如,一道题描述:修改化合物后,选择性提高了,但靶点活性却下降了。模型需要判断:这种变化是因为对目标蛋白结合更强,还是对脱靶蛋白结合更弱?不同解释会导向完全不同的下一轮设计方向。
另一道题中,抗体亲和力已经很强,却容易失稳和聚集;而负责识别抗原的关键区域又不能改动。模型需要在极有限的空间内,提出合理的分析思路和实验方案。
这比回答知识点更接近真实研发判断。PharmBench 还采用逐步披露信息的方式,观察模型能否随着新证据出现修正自己的回答。
但必须指出:连续回答研发问题,与自主推进研发仍有距离。
如果后续实验信息由预设流程提供,模型展示的主要是证据理解与决策建议能力。它尚未证明自己能主动选择最有效的实验、承担预算约束,或从失败中开辟新路径。
此外,内部评测还有一个待解问题:评分是在衡量科学推理能力,还是在奖励与历史项目路径相似的答案?真实研发常有多条合理路线,未被采用的方案未必错误。
这些问题决定了 PharmBench 榜单应如何解读。总分第三是积极信号,但完整的评分规则、独立专家复核和外部测试,会让它更有公信力。
对 Anew 而言,提出这套评测体系本身也体现了方向:把制药专家的判断转化成可测试、可改进的任务。如果未来开放评测方法,PharmBench 的价值可能超出 AnewMind 自身的成绩单。
三条路线交汇,竞争焦点正在转移
Anthropic、Isomorphic 和 Anew 的共同动作,让 AI 制药的竞争逻辑变得更清晰。
通用模型公司需要专业工具和实验反馈来证明实际价值;生物分子模型公司需要推理与任务组织能力来突破单一预测瓶颈;而拥有自有管线的团队,则能持续获得具体研发目标和现实约束,形成闭环。
相似的布局不等于相同的能力水平。模型精度、实验广度、数据积累与管线进展,仍需分别评估。
Anew 这次亮相的意义,在于提供了足够具体的材料,让外界可以开始认真评估它:结构预测接近前沿,说明专业模型已有积累;领域后训练和 PharmBench,展示了对研发推理的投入;两轮纳米抗体实验,则让设计、测量与优化之间的连接有了实例。
融资让它获得了关注,AnewDDE 让这份关注有了技术依据。下一次最有说服力的更新,将来自更多靶点的验证、更完整的实验记录,以及模型真正帮助管线向前推进的具体结果。