JACS | 从“会生成”到“懂相互作用”,晨伫科技与浙大侯廷军团队发布EIP-Diff 推动高保真、可控的 3D 分子生成

在基于结构的药物设计(Structure-Based Drug Design,SBDD)中,生成式 AI 已经能够围绕蛋白口袋快速提出大量新分子。
但一个始终难以回避的问题是:模型究竟理解了真实的蛋白-配体相互作用,还是只是在训练数据和评分函数中找到了“容易得高分”的捷径?
围绕这一问题,晨伫生物科技、浙江大学、浙江省人民医院、中国科学院大学杭州高等研究院和南加州大学的联合团队提出了 EIP-Diff(Explicit Interaction-Prompted Diffusion) 框架。
该工作将高保真晶体数据和残基级交互提示同时纳入 3D 分子生成,希望推动模型从“会生成分子”进一步走向“理解并服从关键生物学相互作用”。
01丨为什么高分模型仍可能生成“错误答案”?
目前,多数靶点特异 3D 生成模型采用隐式学习方式:神经网络从训练数据中自行归纳配体应当如何占据口袋、形成氢键并保持三维构象。
问题在于,一旦训练数据存在系统偏差,模型就可能把偏差当成规律,并在生成结果中进一步放大。论文将这一现象概括为:
算法偏差放大(algorithmic bias amplification)
研究团队分析了广泛使用的 Crossdocked2020 数据集。与实验解析的天然晶体复合物相比,Crossdocked 数据表现出多种明显偏差:
•分子平均重复次数达到 11.52,而晶体数据仅为 1.67;
•人工交叉配对和分子对接破坏了天然的口袋-配体体积互补关系;
•ILE 残基的氢键概率被抬高约 12%;
•2.75–3.5 Å 区间的氢键被显著高估;
•卤键等重要相互作用被系统性低估。

图1.CrystalDataset 与 Crossdocked 数据在分子重复、理化性质、口袋匹配及相互作用分布等方面的对比。图片来自论文原文。
当模型在训练过程中反复看到简单、易合成的骨架,就可能通过重复生成这些结构来提高 QED 或 SA 等指标,却没有真正学会口袋特异的 3D 结合约束。
论文中的例子显示,PocketFlow 的生成结果中苯环重复出现226 次。这类“指标膨胀”解释了为什么一些模型的计算分数很漂亮,却难以转化为真实生物活性。
02丨EIP-Diff:把相互作用从“隐变量”变成“明确指令”
EIP-Diff 的核心思路,是不再让模型完全依赖隐式归纳,而是把药物化学家关心的残基级相互作用直接编码为提示,并注入扩散去噪过程。
模型由全局自注意力和提示引导的交叉注意力两条信息流组成,并在整个坐标更新过程中保持 SE(3) 等变性。

图2.EIP-Diff 总体框架,包括全局自注意力、交互提示嵌入、提示引导的交叉注意力以及扩散生成过程。图片来自论文原文。
1.全局几何建模
EIP-Diff 首先在包含蛋白-蛋白、蛋白-配体、配体-蛋白和配体-配体连接的异质图上进行全局信息传递。
SE(3) 等变图注意力可以保证:当分子整体旋转或平移时,模型预测不会被坐标系的选择干扰。这是高保真 3D 构象生成的重要基础。
2. 显式交互提示
氢键、卤键、阳离子-π 和 π-π 堆积等相互作用被编码为可学习的提示向量,并与蛋白原子特征融合。
交叉注意力只沿“蛋白 → 配体”方向更新配体,使生成过程能够明确响应指定残基和相互作用类型。
•在训练阶段,交互提示是显式生物学先验;
•在推理阶段,交互提示又成为可控的分子设计指令。
例如,研究人员可以要求生成分子与某个关键残基形成氢键,或在特定位置引入芳香结构以形成 π-π 堆积。
3. 两阶段学习
团队首先在 3D ZINC 数据上预训练模型,使其掌握基本的化学有效性;随后再在目标数据上微调,使模型学习真实蛋白口袋构象和相互作用模式。
这种方式将“学习化学语法”和“学习复杂结合几何”适当分开,有助于提高训练稳定性和模型泛化能力。
03丨45,318 个晶体复合物,释放模型的几何潜力
为了给显式架构提供可靠监督,研究团队基于 BioLiP2 构建了 CrystalDataset。
该数据集收录 45,318 个实验解析的蛋白-配体复合物,并保留:
•天然蛋白-配体配对;
•实验解析的原生三维构象;
•残基级相互作用注释。
CrystalDataset 的价值不仅是数据更加干净,更重要的是,它能够提供 EIP-Diff 所需要的真实几何与交互标签。
研究在 99 个随机选择的晶体口袋上进行测试,每个口袋生成 100 个分子,共计 9,900 个样本。
即使在有偏的 Crossdocked 数据上训练,EIP-Diff 仍然表现出较强的抗模式坍塌能力:
•重复分子比例 RMR_1:0.5%;
•分子唯一性:99.7%;
•Struct-DCS:0.951;
•Pharma-DCS:0.920;
•化学空间重建率 CSR:99.8%;
•化学空间探索率 CER:38.7%。

图3.不同模型的药理属性分布、原子组成分布以及不同交互提示数量下的生成成功率。图片来自论文原文。
当训练数据换成 CrystalDataset 后,模型的三维几何能力得到显著释放:
•3D ShapeSim Top-1 Dominance 从 8.1% 提升至 40.4%;
•Struct-DCS 从 0.951 提升至 0.961;
•Pharma-DCS 从 0.920 提升至 0.943。
这说明,Crossdocked 条件下较低的几何得分并非模型缺乏结构能力,而是模型对几何信息的敏感性受到了错误监督的限制。
在晶体数据基础上加入真实交互提示后:
•3D ShapeSim Top-1 Dominance 进一步达到 47.5%;
•Struct-DCS 达到 0.968;
•分子唯一性达到 99.9%;
•真实化学空间覆盖率达到 100%;
•化学空间探索率达到 41.9%。
对于包含 11 个已知相互作用的复合物,提示条件相较无提示生成的成功率最高提升 64%。
04丨从复现结合模式,到优化新的相互作用
总体指标并不能完全回答模型是否真正理解特定蛋白口袋。因此,团队进一步选择 KAT6A 和 YTHDC1 进行结构验证与分子优化。
KAT6A:复现真实结合模式
在 KAT6A(PDB: 6OIO)案例中,EIP-Diff 的 3D 结构相似度指标达到 0.467,在六种比较模型中领先。
生成分子保留了原配体的酰基-磺酰肼核心,并与 Ser690、Arg655、Gly659 和 Arg660 等关键残基形成稳定氢键;疏水取代基也能够有效填充口袋。
YTHDC1:在保留关键作用的基础上优化
在 YTHDC1(PDB: 8K2E)案例中,团队以参考配体的关键相互作用为提示,生成并筛选了约 30,000 个候选分子。
最优设计保持了原有羧基的关键定位,并在分子动力学模拟中表现出更强的 MM/PBSA 结合自由能:
•设计分子:−36.43 ± 1.41 kcal/mol;
•参考分子:−26.02 ± 1.08 kcal/mol。
新分子还与 SER362 和 SER378 建立了稳定氢键。

图4.KAT6A 结合模式复现与 YTHDC1 分子优化,包括结构相似度、结合构象、结合自由能和关键残基作用分析。图片来自论文原文。
05丨走向实验:IDO1 候选分子达到 0.31 nM
IDO1 是肿瘤免疫治疗的重要靶点。其抑制剂 BMS-986205 需要经历从表面延展态、弯折过渡态到深部稳定态的动态结合过程,对生成模型的三维构象能力提出了较高要求。
针对这一复杂口袋,团队锚定入口处的氯苯片段,对关键尾部区域进行生成式骨架跃迁,并获得 30,000 个独特分子。
经过分子对接、合成可及性和 QED 等多参数筛选,研究人员最终选择了两种候选化合物进行实验验证。
在 IFN-γ 诱导的 HeLa 细胞体系中,两种候选化合物的 IDO1 抑制活性分别为:
•候选化合物 1:IC50 = 0.75 nM;
•候选化合物 2:IC50 = 0.31 nM;
•阳性对照:IC50 = 0.29 nM。

图5.IDO1 骨架跃迁设计、候选分子结构、结合构象以及细胞水平剂量-反应结果。图片来自论文原文。
这一结果将研究从“生成结果是否接近真实分子”推进到“生成分子能否在实验中发挥作用”。
它说明,显式交互提示不仅能够改善计算指标,也有机会帮助模型处理动态结合口袋、骨架跃迁和关键残基约束等更加接近真实药物研发的问题。
06丨EIP-Diff 的模型优势体现在哪里?
从统计相关走向生物学约束
EIP-Diff 不再要求网络独自猜测全部结合规律,而是把残基级相互作用作为显式条件,使模型的生成依据更接近真实药物化学设计逻辑。
让高质量数据真正发挥作用
CrystalDataset 不仅提供更多样本,更提供天然配对、实验构象和真实交互注释。研究结果表明,只有当模型架构能够利用这些信息时,高保真数据才能真正转化为三维几何性能。
平衡真实性、探索性与可控性
模型既要贴近真实药理和结构分布,又不能反复生成少数简单骨架;既要覆盖已知化学空间,也要探索新区域;同时还要响应具体残基与相互作用要求。
EIP-Diff 在这些维度上保持了较为均衡的表现。
接入实验验证闭环
KAT6A、YTHDC1 和 IDO1 三类验证分别对应结合模式复现、结构优化和前瞻性活性验证,构成了从算法评估到实际药物设计任务的完整证据链。
模型不能替代化合物合成与实验验证,但可以更有效地把设计假设转化为值得优先验证的候选分子。
结语
这项研究所强调的,不只是一个取得更高指标的 3D 分子生成模型,而是一种架构与数据协同设计的思路:
用实验晶体数据提供可信监督,用 SE(3) 等变网络保持三维几何一致性,再用显式交互提示把药物化学知识转化为可操作的生成条件。
从“让模型自由生成”走向“让模型围绕关键相互作用生成”,EIP-Diff 为靶点特异分子设计、片段优化和骨架跃迁提供了更可控的技术路径,也为生成式 AI 如何跨越计算指标与真实生物活性之间的鸿沟,提供了新的思路。
论文与代码信息
论文题目: An Explicit Interaction-Prompted Diffusion Framework for High-Fidelity 3D Molecular Generation
代码地址: https://github.com/zephyrdhb/EIP-Diff