药物发现是一个周期长、成本高、失败率高的过程。一款新药从靶点确认到上市,平均需要十年以上时间和数十亿美元的投入,而其中大部分候选化合物在临床前阶段就被淘汰。分子性质预测的价值在于,它能在化合物被合成之前,就用计算模型预估其各项物理化学性质和生物学行为,把明显不合格的分子提前过滤掉,让实验资源集中在更有希望的候选物上。近年来,随着机器学习尤其是图神经网络的发展,分子性质预测的准确性和适用范围都有了显著提升。

分子性质预测的基本原理与表示方法
要让机器学习模型理解一个分子,首先需要把分子转化为计算机可以处理的数值表示。传统方法主要依赖分子描述符和分子指纹。分子描述符是通过对分子结构进行数学计算得到的特征,比如分子量、脂水分配系数、氢键供体数量、拓扑极性表面积等。分子指纹则把分子的结构信息编码为固定长度的二进制向量,其中最经典的是扩展连接指纹,它通过枚举分子中每个原子周围的子结构,再经过哈希运算生成向量,能够有效反映分子的局部结构特征。
近年来兴起的另一类表示方式是把分子建模为图结构。在图中,原子对应节点,化学键对应边,节点和边上可以携带丰富的特征信息,例如原子类型、化合价、电负性、键级和键长等。这种表示方式保留了分子的拓扑结构,更加贴近化学本质,也为图神经网络的应用奠定了基础。相比指纹,图表示不需要人工设计哈希规则,可以端到端地从数据中学习特征。
除了二维图表示,三维构象信息也在一些任务中变得重要。分子的生物活性往往取决于其三维空间形状,特别是在与蛋白质靶点结合的场景中。因此,一些研究工作引入了等变图神经网络,直接在三维坐标上建模分子的几何性质,使预测结果对分子的旋转和平移保持不变,从而更准确地刻画构象效应对性质的影响。
主流预测模型与算法架构
在分子性质预测领域,不同的表示方法对应不同的模型架构。对于分子指纹这类固定长度的输入,可以使用随机森林、梯度提升树等传统机器学习算法,这类方法在小数据集上表现稳定,训练成本低,至今仍是许多工业界基线方案的首选。
对于图表示的分子,图神经网络是目前的主流选择。消息传递神经网络通过多轮的邻居信息聚合,让每个原子的表示逐步融入其局部化学环境的信息,最终通过读出函数将所有原子表示汇总为分子级别的向量,再接全连接层完成性质回归或分类任务。消息传递的轮数决定了模型能感知的化学环境范围,轮数太少只能看到邻近原子,轮数太多则可能出现过度平滑问题。
下面是一个使用PyTorch Geometric构建简单图神经网络预测分子溶解度的示例代码:
import torch
import torch.nn.functional as F
from torch_geometric.nn import GCNConv, global_mean_pool
class MoleculeGNN(torch.nn.Module):
def __init__(self, node_features, hidden_dim=64):
super().__init__()
self.conv1 = GCNConv(node_features, hidden_dim)
self.conv2 = GCNConv(hidden_dim, hidden_dim)
self.fc = torch.nn.Linear(hidden_dim, 1)
def forward(self, data):
x, edge_index, batch = data.x, data.edge_index, data.batch
# 两轮消息传递,聚合邻居原子信息
x = F.relu(self.conv1(x, edge_index))
x = F.relu(self.conv2(x, edge_index))
# 将原子级表示汇总为分子级表示
x = global_mean_pool(x, batch)
return self.fc(x)此外,基于预训练的策略近年来发展迅速。由于带标注的分子数据往往规模有限,研究者先在海量无标注分子上通过自监督任务预训练模型,例如预测被遮蔽的原子类型、判断两个子图是否相邻等,再将预训练好的模型迁移到具体性质预测任务上微调。这种方法显著缓解了标注数据稀缺的问题,在小样本任务上带来了明显提升。另一条路线借鉴自然语言处理的思想,把分子的SMILES字符串当作序列,用Transformer架构建模,代表性工作在多项基准测试上取得了与图模型相当甚至更好的结果。
分子性质预测在药物发现中的具体应用场景
虚拟筛选是分子性质预测最典型的应用之一。当化合物库包含数百万甚至数十亿分子时,逐一进行实验或高精度物理计算都不现实。此时可以先训练性质预测模型,对整个化合物库进行快速打分,按照预测活性或成药性排序,只把排名靠前的少量分子送入后续验证流程。这种分层筛选策略可以把候选分子数量压缩几个数量级,大幅节约计算和实验成本。
ADMET性质评估是另一个关键环节。ADMET指吸收、分布、代谢、排泄和毒性,这些性质决定了药物能否在体内达到有效浓度并安全使用。历史上大量候选药物正是因为口服生物利用度差、肝毒性或药物相互作用问题而在晚期失败。利用机器学习模型预测血脑屏障通透性、肝毒性、hERG通道抑制等性质,可以在设计早期就规避这些风险。很多公开数据库如Tox21、ClinToz等都为这类模型提供了训练数据。
在先导化合物优化阶段,性质预测同样发挥重要作用。药物化学家在改造分子结构时,往往需要在活性、选择性和多个成药性质之间做多目标权衡。性质预测模型可以与分子生成模型结合,在生成新分子的同时同步评估其各项性质,实现多目标优化。逆合成分析中也用到了类似思想,通过预测反应可行性和产率,帮助规划目标分子的合成路线。
当前挑战与未来发展方向
尽管分子性质预测取得了长足进步,但它仍面临不少实际挑战。首先是数据质量问题。公开数据集的实验条件、测定方法往往不一致,不同来源的数据之间存在系统性偏差,而很多有价值的性质数据掌握在制药企业内部,公开数据只占很小一部分。数据量少且分布偏斜,使得模型在真实应用中的泛化能力常常低于论文中的基准成绩。
其次是不确定性量化问题。模型给出的预测值只是一个点估计,无法告诉研究者这个预测有多可靠。在药物发现这种高风险决策场景中,知道模型什么时候不可靠和知道预测结果本身同样重要。目前共形预测、贝叶斯神经网络等方法被用于估计预测区间,但在工业界的落地程度仍然有限。
展望未来,几个方向值得关注。一是数据层面的整合与标准化,通过联邦学习等技术在不共享原始数据的前提下联合多家机构训练模型,扩大有效数据规模。二是物理信息与数据驱动的融合,把量子力学计算结果或物理约束引入模型训练,提升预测的外推能力。三是大模型与分子任务的结合,通用分子基础模型有望通过一次预训练覆盖多种下游任务,降低每个新性质任务的开发成本。总体来看,分子性质预测不会取代实验,而是作为高效的过滤器与导航工具,与实验形成互补闭环,推动药物发现从经验驱动逐步走向数据与智能驱动的范式。