>新闻中心>新闻详情

JACS | 从“会生成”到“懂相互作用”,晨伫科技与浙大侯廷军团队发布EIP-Diff 推动高保真、可控的 3D 分子生成

2026.08.11
图片1.png

在基于结构的药物设计(Structure-Based Drug Design,SBDD)中,生成式 AI 已经能够围绕蛋白口袋快速提出大量新分子。

但一个始终难以回避的问题是:模型究竟理解了真实的蛋白-配体相互作用,还是只是在训练数据和评分函数中找到了“容易得高分”的捷径?


围绕这一问题,晨伫生物科技、浙江大学、浙江省人民医院、中国科学院大学杭州高等研究院和南加州大学的联合团队提出了 EIP-Diff(Explicit Interaction-Prompted Diffusion) 框架。

该工作将高保真晶体数据和残基级交互提示同时纳入 3D 分子生成,希望推动模型从“会生成分子”进一步走向“理解并服从关键生物学相互作用”。

01丨为什么高分模型仍可能生成“错误答案”?

目前,多数靶点特异 3D 生成模型采用隐式学习方式:神经网络从训练数据中自行归纳配体应当如何占据口袋、形成氢键并保持三维构象。

问题在于,一旦训练数据存在系统偏差,模型就可能把偏差当成规律,并在生成结果中进一步放大。论文将这一现象概括为:

算法偏差放大(algorithmic bias amplification)

研究团队分析了广泛使用的 Crossdocked2020 数据集。与实验解析的天然晶体复合物相比,Crossdocked 数据表现出多种明显偏差:

•分子平均重复次数达到 11.52,而晶体数据仅为 1.67

•人工交叉配对和分子对接破坏了天然的口袋-配体体积互补关系;

ILE 残基的氢键概率被抬高约 12%

2.75–3.5 Å 区间的氢键被显著高估;

•卤键等重要相互作用被系统性低估。

图片2.png

图1.CrystalDataset 与 Crossdocked 数据在分子重复、理化性质、口袋匹配及相互作用分布等方面的对比。图片来自论文原文。

当模型在训练过程中反复看到简单、易合成的骨架,就可能通过重复生成这些结构来提高 QED 或 SA 等指标,却没有真正学会口袋特异的 3D 结合约束。

论文中的例子显示,PocketFlow 的生成结果中苯环重复出现226 次。这类“指标膨胀”解释了为什么一些模型的计算分数很漂亮,却难以转化为真实生物活性。

02丨EIP-Diff:把相互作用从“隐变量”变成“明确指令”

EIP-Diff 的核心思路,是不再让模型完全依赖隐式归纳,而是把药物化学家关心的残基级相互作用直接编码为提示,并注入扩散去噪过程。

模型由全局自注意力和提示引导的交叉注意力两条信息流组成,并在整个坐标更新过程中保持 SE(3) 等变性。

图片3.png

图2.EIP-Diff 总体框架,包括全局自注意力、交互提示嵌入、提示引导的交叉注意力以及扩散生成过程。图片来自论文原文。

1.全局几何建模

EIP-Diff 首先在包含蛋白-蛋白、蛋白-配体、配体-蛋白和配体-配体连接的异质图上进行全局信息传递。

SE(3) 等变图注意力可以保证:当分子整体旋转或平移时,模型预测不会被坐标系的选择干扰。这是高保真 3D 构象生成的重要基础。

2. 显式交互提示

氢键、卤键、阳离子-π 和 π-π 堆积等相互作用被编码为可学习的提示向量,并与蛋白原子特征融合。

交叉注意力只沿“蛋白 → 配体”方向更新配体,使生成过程能够明确响应指定残基和相互作用类型。

•在训练阶段,交互提示是显式生物学先验;

•在推理阶段,交互提示又成为可控的分子设计指令。

例如,研究人员可以要求生成分子与某个关键残基形成氢键,或在特定位置引入芳香结构以形成 π-π 堆积。

3. 两阶段学习

团队首先在 3D ZINC 数据上预训练模型,使其掌握基本的化学有效性;随后再在目标数据上微调,使模型学习真实蛋白口袋构象和相互作用模式。

这种方式将“学习化学语法”和“学习复杂结合几何”适当分开,有助于提高训练稳定性和模型泛化能力。

03丨45,318 个晶体复合物,释放模型的几何潜力

为了给显式架构提供可靠监督,研究团队基于 BioLiP2 构建了 CrystalDataset

该数据集收录 45,318 个实验解析的蛋白-配体复合物,并保留:

•天然蛋白-配体配对;

•实验解析的原生三维构象;

•残基级相互作用注释。

CrystalDataset 的价值不仅是数据更加干净,更重要的是,它能够提供 EIP-Diff 所需要的真实几何与交互标签。

研究在 99 个随机选择的晶体口袋上进行测试,每个口袋生成 100 个分子,共计 9,900 个样本。

即使在有偏的 Crossdocked 数据上训练,EIP-Diff 仍然表现出较强的抗模式坍塌能力:

•重复分子比例 RMR_1:0.5%

•分子唯一性:99.7%

•Struct-DCS:0.951

•Pharma-DCS:0.920

•化学空间重建率 CSR:99.8%

•化学空间探索率 CER:38.7%

图片4.png

图3.不同模型的药理属性分布、原子组成分布以及不同交互提示数量下的生成成功率。图片来自论文原文。

当训练数据换成 CrystalDataset 后,模型的三维几何能力得到显著释放:

•3D ShapeSim Top-1 Dominance 从 8.1% 提升至 40.4%

•Struct-DCS 从 0.951 提升至 0.961

•Pharma-DCS 从 0.920 提升至 0.943

这说明,Crossdocked 条件下较低的几何得分并非模型缺乏结构能力,而是模型对几何信息的敏感性受到了错误监督的限制。

在晶体数据基础上加入真实交互提示后:

•3D ShapeSim Top-1 Dominance 进一步达到 47.5%

•Struct-DCS 达到 0.968

•分子唯一性达到 99.9%;

•真实化学空间覆盖率达到 100%

•化学空间探索率达到 41.9%

对于包含 11 个已知相互作用的复合物,提示条件相较无提示生成的成功率最高提升 64%

04丨从复现结合模式,到优化新的相互作用

总体指标并不能完全回答模型是否真正理解特定蛋白口袋。因此,团队进一步选择 KAT6A 和 YTHDC1 进行结构验证与分子优化。

KAT6A:复现真实结合模式

在 KAT6A(PDB: 6OIO)案例中,EIP-Diff 的 3D 结构相似度指标达到 0.467,在六种比较模型中领先。

生成分子保留了原配体的酰基-磺酰肼核心,并与 Ser690、Arg655、Gly659 和 Arg660 等关键残基形成稳定氢键;疏水取代基也能够有效填充口袋。

YTHDC1:在保留关键作用的基础上优化

在 YTHDC1(PDB: 8K2E)案例中,团队以参考配体的关键相互作用为提示,生成并筛选了约 30,000 个候选分子

最优设计保持了原有羧基的关键定位,并在分子动力学模拟中表现出更强的 MM/PBSA 结合自由能:

•设计分子:−36.43 ± 1.41 kcal/mol

•参考分子:−26.02 ± 1.08 kcal/mol

新分子还与 SER362 和 SER378 建立了稳定氢键。

图片5.jpg

图4.KAT6A 结合模式复现与 YTHDC1 分子优化,包括结构相似度、结合构象、结合自由能和关键残基作用分析。图片来自论文原文。

05丨走向实验:IDO1 候选分子达到 0.31 nM

IDO1 是肿瘤免疫治疗的重要靶点。其抑制剂 BMS-986205 需要经历从表面延展态、弯折过渡态到深部稳定态的动态结合过程,对生成模型的三维构象能力提出了较高要求。

针对这一复杂口袋,团队锚定入口处的氯苯片段,对关键尾部区域进行生成式骨架跃迁,并获得 30,000 个独特分子

经过分子对接、合成可及性和 QED 等多参数筛选,研究人员最终选择了两种候选化合物进行实验验证。

在 IFN-γ 诱导的 HeLa 细胞体系中,两种候选化合物的 IDO1 抑制活性分别为:

•候选化合物 1:IC50 = 0.75 nM

•候选化合物 2:IC50 = 0.31 nM

•阳性对照:IC50 = 0.29 nM

图片6.png

图5.IDO1 骨架跃迁设计、候选分子结构、结合构象以及细胞水平剂量-反应结果。图片来自论文原文。

这一结果将研究从“生成结果是否接近真实分子”推进到“生成分子能否在实验中发挥作用”。

它说明,显式交互提示不仅能够改善计算指标,也有机会帮助模型处理动态结合口袋、骨架跃迁和关键残基约束等更加接近真实药物研发的问题。

06丨EIP-Diff 的模型优势体现在哪里?

从统计相关走向生物学约束

EIP-Diff 不再要求网络独自猜测全部结合规律,而是把残基级相互作用作为显式条件,使模型的生成依据更接近真实药物化学设计逻辑。

让高质量数据真正发挥作用

CrystalDataset 不仅提供更多样本,更提供天然配对、实验构象和真实交互注释。研究结果表明,只有当模型架构能够利用这些信息时,高保真数据才能真正转化为三维几何性能。

平衡真实性、探索性与可控性

模型既要贴近真实药理和结构分布,又不能反复生成少数简单骨架;既要覆盖已知化学空间,也要探索新区域;同时还要响应具体残基与相互作用要求。

EIP-Diff 在这些维度上保持了较为均衡的表现。

接入实验验证闭环

KAT6A、YTHDC1 和 IDO1 三类验证分别对应结合模式复现、结构优化和前瞻性活性验证,构成了从算法评估到实际药物设计任务的完整证据链。

模型不能替代化合物合成与实验验证,但可以更有效地把设计假设转化为值得优先验证的候选分子。

结语

这项研究所强调的,不只是一个取得更高指标的 3D 分子生成模型,而是一种架构与数据协同设计的思路

用实验晶体数据提供可信监督,用 SE(3) 等变网络保持三维几何一致性,再用显式交互提示把药物化学知识转化为可操作的生成条件。

从“让模型自由生成”走向“让模型围绕关键相互作用生成”,EIP-Diff 为靶点特异分子设计、片段优化和骨架跃迁提供了更可控的技术路径,也为生成式 AI 如何跨越计算指标与真实生物活性之间的鸿沟,提供了新的思路。

论文与代码信息

论文题目: An Explicit Interaction-Prompted Diffusion Framework for High-Fidelity 3D Molecular Generation

代码地址: https://github.com/zephyrdhb/EIP-Diff


分享: