我们改了一行代码,基准分数提升了0.21 AUROC:药物预测基准设计中的两个关键数字

0 阅读

在人工智能驱动药物研发的浪潮中,模型性能评估的可靠性正面临严峻挑战。近期上线的LEADBOARD基准平台通过21项任务、覆盖18,382个隐藏化合物的系统性测试,揭示了两个被长期忽视却足以颠覆评估结论的关键因素:数据分割策略的选择与实验标签本身的不确定性。这两个看似技术细节的问题,实际上深刻影响着整个领域对模型能力的认知边界。

首先聚焦于数据分割方式带来的巨大偏差。以hERG抑制预测为例——这是药物心脏毒性筛查的核心指标。研究团队使用ChEMBL 37数据库中9,788个独特化合物,采用完全相同的Morgan指纹特征和LightGBM模型(默认超参数),仅改变训练/测试集划分逻辑,就观察到AUROC从0.606飙升至0.818,差距高达0.211。这一差异常见于多数文献报道的方法对比中,其根源在于药物化学家的实际工作模式:他们通常围绕某个核心骨架进行系统性修饰,产生大量结构高度相似的衍生物。随机分割会将这些“近亲”分子分散到训练集和测试集中,导致模型本质上是在执行近邻检索而非泛化预测。而时间分割(以2022年为界)则模拟了真实研发场景——模型必须预测从未见过的新化学空间,且训练时测试集对应的实验数据尚未公开,从根本上杜绝了信息泄露。

值得注意的是,这并非否定现有研究的价值。许多高质量基准已采用骨架分割(如基于Murcko核心的划分),其难度介于时间分割与随机分割之间。但问题的核心在于:脱离具体分割方式的单一分数不具备横向可比性。LEADBOARD因此强制所有任务采用时间分割(T)或骨架分割(S),明确拒绝开放随机分割(R)任务,并在每个榜单标注分割类型,确保评估条件的透明化。

第二个颠覆性发现源于对实验标签不确定性的量化。通过分析ChEMBL中同一化合物在不同文献中的测量值差异,研究者发现hERG数据的跨文献绝对误差中位数达0.148 log单位,90%分位数高达1.338 log——意味着十分之一的化合物在不同实验室测得的IC50值相差超过20倍。基于此,团队定义了“噪声基底”(noise floor)为0.421 log(单次测量标准差),并将其作为评估有效性的标尺。更令人警醒的是,hERG测试集中52%的化合物位于分类阈值(pIC50=5.0)的一个噪声基底范围内,即重新测量可能导致其类别翻转。因此该任务以回归指标(MAE)为主、分类指标(AUROC)为辅,并在页面显著位置说明原因。

这种噪声基底的概念被推广至全部21个任务。通过计算最佳无训练基线(如常数预测或最近邻)的MAE与噪声基底的比值,可直观反映当前方法距离理论上限的距离。数据显示,CYP2D6和CYP3A4等任务的比值已低于1.0,表明实验本身的变异程度接近或超过化合物间的实际差异,此时继续排名可能只是在区分噪声。对于这类任务,平台选择明确警示而非盲目排序。

基线模型的表现进一步印证了评估体系的必要性。在19个回归任务中,简单的常数预测(输出训练集均值)在7个任务上击败了精心训练的Morgan+LightGBM模型——尤其是在时间分割下。例如hERG任务中,LightGBM的MAE(0.599)反而劣于常数预测(0.589)。这揭示了一个关键洞见:指纹模型擅长化合物排序(rank ordering),但在未见化学空间的绝对效价校准(absolute potency calibration)上表现薄弱。随机分割掩盖了这一缺陷,因其测试集包含训练集的近邻分子,使排序优势转化为虚假的回归精度提升。

为应对多重提交导致的测试集信息泄露风险,LEADBOARD引入了阶梯机制(ladder mechanism)。新提交的分数仅当超越用户历史最佳成绩超过噪声基底时才会更新,否则仍显示旧分数。这意味着小于实验误差的“改进”不被视为有效进步,从根本上阻断了通过反复试错爬升排名的可能性。该机制的有效性完全依赖于真实可靠的噪声基底估计,而非象征性数值。

特殊任务的设计更体现了对现实复杂性的尊重。在“上市后撤回预测”任务中,初始数据存在年代偏差——1990年代批准的药物撤回率(7.8%)远高于2010年代(1.2%),导致仅凭批准年份就能获得0.636 AUROC。团队通过按批准年代匹配对照组,将年份预测器的性能压至随机水平(0.504),确保模型必须真正学习药物特性而非时间信号。而在“细胞/表型”任务中,基于JUMP Cell Painting的737维形态学特征被压缩为16维主成分,预测目标变为多维轮廓的相关性。由于缺乏跨实验室重复数据,噪声基底通过自助法(bootstrap)估计为0.0088,成为阶梯机制的阈值依据。

LEADBOARD的贡献不在于提出新算法,而在于重构评估范式:每个分数都附带分割方式(如[T/P3])、基线对比和噪声基底三重上下文。这种设计直指领域痛点——当前大量论文报告的“SOTA结果”因评估条件不透明而无法复现或比较。当不同研究使用不同分割、不同数据清洗流程、不同指标权重时,数字竞赛沦为无意义的数字游戏。

最后需要澄清三个常见误解:第一,时间分割不等于前瞻性验证(prospective validation),后者对应平台中的P4类任务(答案尚不存在);第二,基于跨文献差异的噪声基底是合理估计而非绝对真理,平台公开配对计数供社区验证;第三,此举并非否定其他基准,而是强调脱离元信息的分数如同没有刻度的尺子。LEADBOARD的核心价值正是提供一把自带精度说明的统一标尺,让研究者看清自己究竟站在山腰还是山脚。

在药物研发这个容错率极低的领域,过度乐观的模型评估可能导致数亿美元的错误投入。LEADBOARD通过暴露评估体系中的脆弱环节,推动社区建立更严谨、更贴近真实研发流程的验证标准。毕竟,衡量进步的工具本身,也需要被严格检验。