AI设计的分子靠谱吗?疟疾药物发现公开排行榜的评判之道

2 阅读

当AI批量生产分子,谁来当裁判?

2023年,疟疾夺走了约59.7万人的生命,其中四分之三是五岁以下的儿童,95%的死亡发生在非洲。这不是因为缺乏化学知识——疟疾的机制已被阐明,靶点已被表征,候选药物也已进入临床。真正缺失的是资金聚集的理由。当患者贫穷时,市场就不存在;没有市场,就没有投资;没有投资,开发就停滞。人们死去,不是因为药物无法制造,而是因为制造药物的理由从未出现在任何人的资产负债表上。

这是资源配置的失败,而非技术的失败。而资源配置的失败,恰恰是那些凭信念而非回报工作的人能够弥合的鸿沟。

几年前,设计候选药物只有少数团队能做到。如今,任何拥有模型的人一天就能生成数千个看似合理的分子。但奇怪的事情发生了:分子大量涌现,却几乎没有进展。原因很简单——模型能无限画出令人信服的结构,却无法告诉你这个化合物能否杀死寄生虫、是否伤害患者、或者能否被制造出来。回答这些问题需要工具——对接、全细胞活性预测、ADMET、选择性建模——而这些工具仍掌握在少数组织手中。

发现被民主化了,验证却没有。

此刻,某处有人画出了一个好分子,却永远不会知道。不是他们失败了,而是没有衡量它的秤。所以,我们决定放一把秤出来。VIDRAFT将其多年构建的验证工具押在了这个排行榜上。

构建公正裁判的真实难度

这句话写起来容易,但构建裁判比构建分子更难。在搭建评分器时,我们发现了十四个缺陷,全部在开放之前发现,其中大多数是那种会悄悄运行却产生错误答案的类型。有几个值得完整记录,因为如果这个排行榜值得信任,理由应该是这份记录,而不是我们的保证。

拒绝已批准药物的闸门是坏闸门

我们设置了常规毒性阈值并进行了测试。所有三种已批准的抗疟药都失败了,咖啡也失败了。阈值是错误的。心脏毒性和肝毒性模型对大型亲脂性分子存在偏见,而我们直接将其输出用于截断。如果以那种状态开放,任何人首先会说的是:“VIDRAFT的过滤器拒绝了已批准的药物。”

因此,我们采纳了一条规则:每个阈值必须先让已批准的药物通过,然后才能拒绝任何人。 这条规则随后又发现了三个缺陷:500 Da的重量上限使参考药物以531.9被取消资格;一个反应性检测器两次错误地拒绝了已批准的药物。

试图阻止用质量买分,却差点捧红咖啡因

直接对结合打分,重分子获胜。标准修正是按分子大小归一化。我们测量了效果:每重原子结合效率,DSM265(临床候选)为0.369,咖啡因为0.354。咖啡几乎与临床候选持平。我们修复了尺寸偏差,却创造了相反的偏差,过度奖励小而弱的结合剂。效力下限加上效率项解决了这个问题。

只为新颖性付费,新颖垃圾获胜

新颖性很重要——重画现有药物不是贡献。但单独对新颖性打分,任何新东西都能得分,无论是否有用。因此,新颖性乘以效力。新颖且惰性的得分为零。同样有效但类似已知药物的类似物也得零分,因为参考化合物本身在该项得分为零,类似物继承了这一点。分数只存在于一个地方:新颖且有效。这正是真实药物发现中有价值的东西。

模型从未见过失败

我们的全细胞活性模型预测咖啡因为1 μM活性化合物。原因是数据。训练集只包含有效的化合物。记录“100 μM无效果”没有定量值,被过滤掉了。从未见过失败的模型会说一切看起来都很有希望。 我们提取了5,190条失败记录并重新训练。临床候选与咖啡之间的差距从1.00扩大到1.74对数单位。

先怀疑自己的接线,再责怪工具

用已批准的药物验证对接,一个真实IC50为13 nM的化合物返回248 μM——相差四个数量级。我得出结论,该工具不能用于绝对值,并报告了这一点。我错了。调用路径坏了。 直接运行,绕过它,同样的设置返回13 nM——与文献完全匹配。我们撤回了结论并重写。

静默失败的那些

在新颖性计算中,我们使用了错误的函数名来重建化学指纹。没有引发错误。 值看起来完全正常,只有新颖性分数会悄悄出错。往返检查——存储指纹、读回、与自身比较——抓住了它。这类最危险,因为没有任何警报。

“90%下限”实际上是83%

我们以下限而非点估计来评分预测。模型无法自信判断的候选会被扣分。这就是公平的原因。然后我们测量了下限是否真的是下限。标称90%,实测83%。统计修正假设训练和测试数据可交换,而我们故意按化学骨架分割——持有整个系列,因为参赛者会提交我们从未见过的结构。这个设计违反了修正的前提。我们扩大余量,直到实测数字达到90.01%,并决定报告实测数字而非标称数字。

所以你不必相信我们的话

以上都不是吹嘘。这是证据,证明让裁判出错是多么容易。因此,我们没有要求信任,而是让事情可核查。已批准的药物和惰性化合物与参赛作品一起出现在排行榜上。

参考化合物:DSM265(临床阶段抗疟药)得分50.9;Brequinar(抑制人类酶——错误靶点)得分4.0;Teriflunomide(已批准药物,人类DHODH——错误靶点)得分2.8;布洛芬(惰性对照)得分1.9;咖啡因(惰性对照)得分1.8。如果临床候选位居榜首,咖啡因垫底,则评分器具有区分能力。这是你可以检查的,而不是你必须接受的。

选择性轴也以同样的方式验证——在人类侧使用阳性对照。Brequinar被检测到以6 nM结合人类酶,而DSM265在那里弱46倍。因此,人类侧检测器并非简单地将所有东西报告为弱;DSM265确实避开了我们的酶。 悬停任何一行,每个轴分数及其背后的数字都会出现——针对每种酶的预测效力、选择性比率、与最近已知化合物的相似性、合成难度。一个你无法质疑的分数是一个你无法信任的分数。

如何参赛——完整指南

你不需要是化学家。你需要一个模型和要问它的问题。

你要设计什么

阻断这个:PfDHODH——疟疾寄生虫的二氢乳清酸脱氢酶。没有它,寄生虫无法生存。

别碰这个:人类DHODH——同源物。抑制它会导致免疫抑制,而不是治愈。这就是teriflunomide和brequinar所做的。

越过这个:寄生虫生活在红细胞内。两层膜挡在你的化合物和靶点之间。

评分标准,完整公开

轴:全细胞活性(30分)——寄生虫是否真的死亡;靶点结合(20分)——是否结合PfDHODH,且效率高;选择性(20分)——结合寄生虫酶,而非人类酶;ADMET(15分)——吸收、分布、代谢、毒性;新颖性(10分)——与已知抗疟药的结构差异;合成(5分)——能否实际制造。

我们故意公开标准。知道什么能得分的参赛者比猜测的参赛者能产生更好的分子,而更好的分子是全部目标。开始前值得内化的三个策略:

  • 新颖性乘以效力。 新颖且惰性毫无价值。
  • ADMET、新颖性和合成随分子的候选程度缩放。 一个完全安全但无活性的化合物什么也没实现。
  • 不确定的预测得分较低。 在模型无法自信判断的地方,你会相应被扣分。

五个提示词,可直接粘贴

这些是参赛者指南中的提示词,逐字复制。任何模型都适用——OpenAI、Claude、Gemini、Qwen、KIMI、DeepSeek、开放权重,无论你用什么。

复制前一个警告。 原样使用,这些提示词会为每个人产生几乎相同的分子,重复项在到达时被拒绝——所以第一个提交被注册,其他人浪费一次机会。每个提示词都带有“改变这一点”的指令。请遵循。

A · 入门

你正在设计PfDHODH的小分子抑制剂,即恶性疟原虫的二氢乳清酸脱氢酶,用于开放抗疟挑战。

要求:
- 化合物必须抑制寄生虫酶,而不是人类DHODH。人类酶是同源的;抑制它会导致免疫抑制而非治愈。
- 它必须在全细胞中杀死寄生虫,这意味着在靶点可达之前,需要穿过红细胞膜,然后是寄生虫膜。
- 分子量低于500。无PAINS基序。无共价弹头。可合成。

提出8个候选,作为JSON数组:
[{"smiles":"...","name":"...","rationale":"为什么这应该对寄生虫酶具有选择性并能到达细胞"}]

改变这一点:说明你感兴趣的化学类型,或你自己的约束,以便你的集合不会与其他参赛者冲突。相同提交被拒绝。

B · 选择性——避开人类酶(20分)

设计PfDHODH抑制剂,并针对人类DHODH提出明确的选择性论证。

你应该推理的背景:
- Teriflunomide和brequinar抑制人类酶。它们是这里的失败模式,而不是模板。
- 寄生虫酶的抑制剂结合位点在残基组成和形状上与人类酶不同。故意设计到这种差异中,并说明你利用的是哪种差异。
- 一个不结合任何酶的分子是琐碎的“选择性”且毫无价值。对寄生虫酶的效力是前提,而不是权衡。

对于每个候选,明确说明:你期望人类酶难以耐受的特征,以及为什么。

提出8个候选,作为JSON:[{"smiles","name","rationale"}]

改变这一点:选择一个特定的选择性假设,并围绕它构建整个集合,而不是八个不相关的猜测。

C · 新颖骨架——空间所在(10分)

设计在抗疟文献中不出现的骨架上的PfDHODH抑制剂。

为什么这对评分重要:新颖性被测量为与已知抗疟化学空间的结构距离,并且它乘以分子的效力。
- 新颖但无活性的分子得分为零。
- 已知药物的有效类似物也得零分——参考化合物本身在新颖性上得分为零,类似物继承了这一点。
- 分数只对既新又真实的东西可用。

明确避免:DSM265和其他三唑并嘧啶类、Genz-667348以及已发表的PfDHODH抑制剂系列。不要装饰已知核心——改变核心。

提出8个候选,在八个不同的核心上,作为JSON:
[{"smiles","name","rationale":"为什么这个核心在这里未被探索,以及为什么它仍应结合"}]

改变这一点:说出你想探索的两三个环系统,以便你的集合是你自己的。

D · 全细胞——要穿过两层膜(30分)

设计PfDHODH抑制剂,优化为在感染的红细胞中实际杀死寄生虫,而不仅仅是结合分离的酶。

化合物必须穿过红细胞膜,然后是寄生虫膜,靶点才重要。从未到达酶的酶亲和力得分为零。

明确推理每个候选:
- 亲脂性和极性表面积在与被动渗透兼容的范围内
- 氢键供体的数量,以及是否足够低
- 在寄生虫区室pH下的电离状态
- 代谢稳定性——化合物必须存活足够长的时间才能起作用

提出8个候选,作为JSON:[{"smiles","name","rationale":"渗透性论证,而不仅仅是结合论证"}]

改变这一点:在生成之前设定你自己的目标性质窗口,并让集合遵守它。

E · 迭代——将你的分数反馈回来

以下是我之前的候选在开放抗疟挑战中的评分方式。改进它。

粘贴你的结果——悬停排行榜上的行并复制数字:
  候选ID、总分,以及六个轴分数及其所述原因(针对每种酶的预测效力、选择性比率、最近已知化合物、合成难度)

诊断哪个轴成本最高,然后提出8个修订候选,专门攻击该轴,同时不放弃已经得分良好的部分。

对权衡诚实:如果提高选择性可能牺牲全细胞活性,请说明并展示两个选项。

JSON:[{"smiles","name","rationale":"这针对哪个轴以及它权衡什么"}]

改变这一点:你自己的分数使这个提示词独一无二——没有两个参赛者有相同的起点。

条目为何被拒绝

结构在到达时被检查,所以以下任何内容都会直接返回,而不是到达表格。

  • 已知药物的类似物:新颖性接近零。参考化合物本身在该项得分为零,类似物继承了这一点——一个测试的类似物得分为0.96(满分10)。
  • 共价弹头:第一季是非共价轨道。末端丙烯酰胺、肽基腈等被自动拒绝。
  • PAINS基序:命中许多靶点的结构被自动拒绝。
  • 分子量超过550:被拒绝。上限阻止用质量购买结合分数。
  • 分子式C20H25N3O4等有太多异构体无法评估。提交SMILES或InChI。
  • 已输入的结构:重复项被拒绝,并记入先提交者。

还有一个类别被降级而非拒绝:预测的致突变性或极端不溶性。这些条目被完整评分并显示,但排名低于所有干净条目。一个结合良好但致突变的分子不是先导物——但你仍应看到你有多接近。

它仍然是你的

提交的分子的所有权完全归参赛者所有。 VIDRAFT对其进行评分并显示。我们不获取专利或所有权利益,不向第三方传递任何内容,也不将其放入我们自己的管道。

你决定结构是否公开。有两件事我们不会模糊。

一。 选择私有会向其他参赛者和公众隐藏结构——但不会向我们隐藏。 评分需要结构,因此它被存储,并且仅用于此目的。如果我们对此含糊其辞,我们承诺的其他任何事情也不值得相信。

二。 选择公开可能使你失去专利性。 公开是披露,披露可能阻碍该化合物未来的专利。如果你有任何商业意图,请保持私有并先申请。

我们内部坚持“先申请,后公开”。给参赛者同样的警告似乎是正确的。

关于奖项

每季结束时,排名最高的条目获得奖项。第一季——疟疾,2026年9月30日截止——奖金为1,000美元。

我们知道这不能支付你的时间或代币。它不是为了这个。它是一种方式,说你所做的有价值。

被忽视疾病的工作天生是吃力不讨好的:论文难以发表,资金不存在,大多数时候没人看。这个排行榜至少记录谁贡献了什么,并每季说一次谢谢。 如果有赞助商加入,金额会增加。每季针对不同的疾病。

邀请

需要三件事。

使用任何你喜欢的AI。 OpenAI、Claude、Gemini、Qwen、KIMI、DeepSeek、开放权重,或铅笔。我们记录你使用的模型——排行榜显示哪些模型实际产生好的候选,与哪些模型只是流行分开——但我们不限制。

提交一个结构。 SMILES或InChI。我们做其余的事。

回来看。 每个分数及其推理都是公开的。将其复制到提示词E中并再次运行。

最后

如果这个排行榜上的候选有一天成为真正的药物,它将始于某人的笔记本电脑和一行SMILES。 我们建造这把秤,是为了让那一行不被埋没。

开放发现挑战赛 #1——疟疾

赛季于2026年9月30日结束

这里的分数是对候选的计算评估。它们不是测量,不是对真实效力或安全性的声明,也不是对已批准药物的排名。实验验证是另一个完全独立的过程。