

论文题目: Atomic context-conditioned protein sequence design using LigandMPNN 期刊: Nature Methods 发表时间: 2025 年,Volume 22,Pages 717–723 作者: Justas Dauparas、Gyu Rie Lee、Robert Pecoraro、Linna An、Ivan Anishchenko、Cameron Glasscock、David Baker 机构: University of Washington / Institute for Protein Design 代码: https://github.com/ dauparas/LigandMPNN
这篇 Nature Methods 论文提出 LigandMPNN,一个面向非蛋白原子上下文的蛋白序列设计模型。它解决的是 ProteinMPNN 这类逆折叠模型的一个关键缺口:模型虽然能根据蛋白骨架快速设计序列,却看不见小分子、核酸、金属离子等功能相关原子。LigandMPNN 在 ProteinMPNN 的残基图基础上加入配体原子图和蛋白–配体图,把局部原子类型、距离、角度信息注入序列设计过程,并进一步预测侧链构象。结果显示,它在小分子、核酸和金属邻近残基的天然序列恢复率上显著优于 Rosetta 和 ProteinMPNN,并已有超过 100 个小分子或 DNA 结合界面获得实验验证。它的重要性不在于单纯提高一个 benchmark 分数,而在于把蛋白设计从只面向骨架稳定性,推进到更接近真实功能位点设计的原子级上下文建模。
过去几年,AI 蛋白设计的进展很大程度来自两个环节:一是生成目标蛋白骨架,例如 RFdiffusion、Chroma、RoseTTAFold All-Atom 等;二是给定骨架后设计氨基酸序列,例如 ProteinMPNN。
但真正做功能蛋白时,问题并不只是让蛋白折叠成一个稳定结构。很多应用场景要求蛋白和非蛋白对象发生精确相互作用,例如:
这意味着序列设计不能只看蛋白骨架,还必须看功能位点附近的原子环境。ProteinMPNN 的强项是给定蛋白骨架后快速设计序列,但它主要利用蛋白主链坐标,不显式建模小分子、核酸和金属等非蛋白原子。LigandMPNN 正是补上这个缺口:在保持 ProteinMPNN 高速、轻量、易用优势的同时,让模型在设计序列时显式感知原子级配体上下文。
从 de novo protein design 的典型流程看,一个新功能蛋白通常要经历三步:
第一步,生成或选择一个适合承载功能位点的蛋白骨架;第二步,在这个骨架上设计氨基酸序列,使其既能折叠成目标结构,又能在关键位置形成所需相互作用;第三步,用结构预测、能量评估、实验筛选等方式判断设计是否可靠。
AI 方法已经显著推进了第一步和第三步。骨架生成可以由扩散模型、结构生成模型、Rosetta scaffold search 等完成;结构过滤可以使用 AlphaFold、RoseTTAFold、ESMFold 或 Rosetta。真正容易被低估的是第二步:当骨架和配体都给定时,哪些氨基酸应该放在功能位点周围?它们的侧链应该怎么指向配体?
传统 Rosetta 可以做这件事,因为它有原子级能量函数和 rotamer 搜索。但 Rosetta 的问题也很明显:速度较慢,需要蒙特卡洛搜索侧链身份和构象;面对新配体时常常需要参数化;能量函数对金属、非标准化学环境、溶剂和质子化状态较敏感。
ProteinMPNN 则几乎走向另一个极端:速度快、鲁棒性强、序列设计能力出色,但它没有把非蛋白原子作为显式输入。因此,在小分子结合蛋白、核酸结合蛋白、金属酶和传感器设计中,ProteinMPNN 可能设计出能折叠的序列,却不一定能正确组织功能位点。
LigandMPNN 的目标很清楚:把非蛋白原子作为条件上下文纳入序列设计,而不是事后用能量函数补救。
Rosetta 的优势是可以显式考虑氢键、范德华、静电、溶剂化、排斥项和 rotamer 组合。对于功能位点设计,这是非常自然的思路:给定一个 backbone 和 ligand,在周围位置搜索氨基酸身份和侧链构象,使能量函数更优。
问题是,这类方法通常需要大量组合搜索。一个结合口袋周围十几个可变位点,每个位点有 20 种氨基酸,每种氨基酸又有多个 rotamer,组合空间会迅速膨胀。更重要的是,对于新小分子,Rosetta 往往需要合理的配体参数、部分电荷、键角、扭转项和能量项适配。实际使用时,这对非专家并不友好。
ProteinMPNN 的核心思想是把蛋白残基作为图节点,利用主链几何关系设计序列。它在许多蛋白设计任务中表现非常稳健,因为它学到了给定 backbone 时哪些氨基酸更可能支持该结构。
但对于小分子结合位点,关键不只是 backbone 能不能稳定,而是侧链能不能正确识别配体。比如一个羧酸配体附近是否应该放 Arg/Lys/Ser/Tyr,金属附近是否应该放 His/Cys/Asp/Glu,DNA 大沟附近是否应该放能与碱基形成选择性相互作用的残基。这些判断依赖非蛋白原子的类型和位置。ProteinMPNN 不看这些原子,就很难系统性解决功能位点序列设计。
RFdiffusion、RFdiffusion All-Atom、RoseTTAFold All-Atom 等模型可以生成更复杂的结构上下文,甚至考虑蛋白、核酸、小分子和金属等多类生物分子。但生成骨架只是开始。真正进入实验前,还需要把骨架转换为可表达、可折叠、可结合的氨基酸序列。
LigandMPNN 的定位正好在这里:它不是 docking 模型,也不是 backbone diffusion 模型,而是面向结构设计流程中最关键的序列设计环节。
LigandMPNN 的核心假设是:在固定蛋白 backbone 和非蛋白原子坐标的情况下,功能位点周围的氨基酸身份主要由局部原子环境决定;如果模型能够读取配体原子类型、局部距离和几何方向,就能比只看蛋白骨架的模型更合理地设计序列。
这个假设有两个技术含义。
第一,非蛋白原子不需要被当成完整分子语言来建模。对于序列设计,模型更关心某个残基附近有哪些原子、距离多远、方向如何、可能形成什么局部相互作用。因此,LigandMPNN 选择局部近邻原子图,而不是全局密集原子图。
第二,模型不直接进行物理能量优化,而是从 PDB 中学习天然蛋白–配体、蛋白–核酸、蛋白–金属环境中氨基酸选择的统计规律。它用深度学习替代了大量手工能量搜索,但仍通过距离、角度、元素类型等特征保留物理相关信息。
LigandMPNN 解决的是给定结构上下文的蛋白序列设计问题。
输入包括:
输出包括:
因此,LigandMPNN 不是只生成一条序列,而是给出一个概率化设计空间。用户可以通过采样温度、位置限制、氨基酸偏好和下游过滤,得到多条候选序列。

LigandMPNN 的关键设计是三个图。
蛋白残基作为节点。每个残基连接 Cα 距离最近的 32 个残基。边特征不只是 Cα–Cα 距离,而是使用 N、Cα、C、O 和虚拟 Cβ 之间的两两距离。因为有 5 类原子,两两组合形成 25 组距离特征。这些距离经过 radial basis function 编码后输入模型。
虚拟 Cβ 很重要,因为 Gly 没有真实 Cβ,但侧链方向和口袋几何需要一个近似侧链指向。通过 backbone 几何推断 Cβ,可以让所有残基在表示上保持一致。
对每个蛋白残基,模型选取离该残基虚拟 Cβ 最近的 25 个非蛋白原子。这里的非蛋白原子可以来自小分子、核酸、金属或其他上下文原子。
这些原子构成一个局部全连接原子图:
这张图负责把配体信息传给蛋白残基。对于每个残基,模型建立残基与其最近 25 个配体原子之间的边。边特征包括:
这一步很关键。只知道配体原子距离还不够,因为氢键、疏水接触、金属配位、碱基识别都依赖方向性。角度特征相当于告诉模型:这个原子在残基 backbone 的哪一侧,是否适合被侧链接近。
论文 Fig. 1 展示了这三张图和信息流:蛋白图编码 backbone,配体图编码局部原子环境,蛋白–配体图把原子上下文注入残基表示,然后由 decoder 生成序列和侧链构象。
LigandMPNN 保留了 ProteinMPNN 的主体框架:encoder–decoder + message passing + autoregressive sequence decoding。
它的模型可以拆成三块。
这一部分处理蛋白残基图。输入是残基节点和残基–残基边特征,输出每个残基的 hidden representation。论文中使用 3 层 encoder,hidden dimension 为 128。
它学习的是给定 backbone 后,某个位置更适合什么类型氨基酸。比如埋藏疏水核心倾向疏水氨基酸,转角和环区有特定残基偏好,二级结构对氨基酸也有统计偏好。
这是 LigandMPNN 相比 ProteinMPNN 的核心新增部分。它包含两类 message passing:
第一类在配体原子图内部传递信息,让配体原子节点理解周围原子。比如一个氧原子如果位于羧酸基团中,它与单独的醇氧在局部距离和连接环境上不同。模型虽然没有显式输入完整键级和化学价,但通过元素类型和原子间距离,可以学习到一部分局部化学模式。
第二类在蛋白–配体图上传递信息,把配体原子信息整合到对应残基表示中。这样每个残基不仅知道自己的 backbone 环境,还知道附近是否有金属、碱基、芳香环、极性原子或疏水原子。
decoder 随机自回归地产生氨基酸序列。与语言模型常见的从左到右不同,蛋白序列设计不天然具有单一方向。LigandMPNN 沿用 ProteinMPNN 的随机解码思想,可以更自然地处理多链、对称蛋白和多状态设计。
在推理时,模型对每个位置输出 21 类 token 的 logits 和 log-probability,然后按照温度参数采样。温度低时序列更保守,温度高时多样性更大。模型还可以通过 decoding order 和概率平均支持对称设计和 multistate design。
LigandMPNN 参数量为 2.62M,相比 ProteinMPNN 的 1.66M 增加不多。论文报告在单 CPU 上,100 个残基的 ProteinMPNN 约 0.6 秒,LigandMPNN 约 0.9 秒,仍属于非常轻量的设计模型。
LigandMPNN 的序列模型使用 categorical cross entropy 训练,目标是在给定 backbone 和非蛋白原子上下文时预测天然氨基酸身份。
训练数据来自 PDB biological assemblies,筛选条件包括:
训练时,作者给蛋白和上下文原子坐标加入 0.1 Å 标准差的高斯噪声。这一点非常重要。PDB 晶体结构的 backbone 几何并不是完全中立的,它可能已经带有天然序列诱导出的精细局部几何。如果模型过度读取这些细节,就会变成从晶体几何中反推天然序列,而不是学习适用于新设计 backbone 的规律。加噪声可以模糊这类细节,降低记忆风险。
此外,作者还随机选择 2–4% 的蛋白残基,把它们的侧链原子作为上下文原子加入训练。这个增强没有显著提高总体序列恢复率,但它让模型在实际使用中能够接受某些固定侧链作为功能位点约束,从而帮助稳定用户指定的催化残基或关键相互作用。
LigandMPNN 的另一个实用设计是侧链 packing 网络。因为功能位点设计只给出氨基酸身份还不够。比如同样是 Tyr,如果芳香环方向错了,就无法形成理想的疏水堆叠或氢键;同样是 His,如果咪唑环角度不对,就不能合理配位金属。
侧链 packing 模型输入:
输出:
模型把每个 χ 角表示为 3 个成分的圆形分布混合模型。每个角预测 3 个混合系数、3 个均值和 3 个方差或 concentration 参数。解码方式也是自回归的:先预测所有 χ1,再预测 χ2、χ3、χ4。每预测一个角,就把该角对应的三维原子坐标用于后续预测。这符合侧链几何的层级性质:χ2 的可行性依赖 χ1,远端 χ3/χ4 依赖前面角度。
从功能设计角度看,这个模块非常实用。它可以帮助用户判断某个序列虽然在氨基酸概率上合理,但侧链是否真的能以高概率指向配体。
一个典型工作流可以是:
需要强调的是:LigandMPNN 本身不解决 ligand placement,不做 docking,不生成小分子,也不直接预测结合亲和力。它解决的是给定原子上下文后,如何快速设计与该上下文匹配的蛋白序列。
作者首先做 retrospective benchmark:给定天然蛋白–非蛋白复合物结构,让模型设计序列,然后看配体附近残基是否恢复天然氨基酸身份。评价区域定义为侧链原子距离任意非蛋白原子 5.0 Å 内的残基。
结果非常直接:
上下文类型 | Rosetta | ProteinMPNN | LigandMPNN |
|---|---|---|---|
小分子附近残基 | 50.4% | 50.5% | 63.3% |
核酸附近残基 | 35.2% | 34.0% | 50.5% |
金属附近残基 | 36.0% | 40.6% | 77.5% |

这个结果说明,非蛋白原子上下文确实提供了 ProteinMPNN 无法获得的信息。尤其是金属场景,LigandMPNN 提升非常大,原因并不难理解:金属结合位点对 His、Cys、Asp、Glu 等残基有强烈偏好,而这种偏好高度依赖金属离子位置和元素信息。ProteinMPNN 只看 backbone,很难知道某个局部几何对应金属配位环境。
不过,序列恢复率不是功能成功率。天然序列受到进化历史、稳定性、表达、动态和物种环境影响,不等于唯一最优设计。这个指标更适合作为模型是否学会结构上下文统计规律的证据,而不能直接证明每条设计序列都能结合目标分子。
作者做了多组消融。
减少每个残基可见的上下文原子数,会明显影响核酸场景。这符合直觉:核酸比小分子和金属更大,局部原子数量更多,如果只看很少的原子,会丢失碱基、糖环和磷酸骨架的几何信息。
移除蛋白–配体图和配体图会让序列恢复率下降约 3%。这说明新增的原子图模块确实有贡献,但也提示我们:大量序列信息仍然来自蛋白 backbone 本身。也就是说,LigandMPNN 不是完全靠 ligand 决定序列,而是在 backbone 统计规律上叠加功能上下文修正。
去掉化学元素类型对金属场景影响更大,序列恢复率下降约 8%,但对小分子和核酸影响相对小。这说明模型可以从几何中推断部分化学身份,但面对金属这种元素身份强决定相互作用类型的场景,显式元素信息非常重要。
侧链 packing 的评价指标是扭转角是否接近晶体结构,常用阈值为 10°。作者比较了 Rosetta、LigandMPNN without ligand context 和 LigandMPNN。
χ1 恢复率结果如下:
上下文类型 | Rosetta | LigandMPNN-wo | LigandMPNN |
|---|---|---|---|
小分子 | 76.0% | 83.3% | 86.1% |
核酸 | 66.2% | 65.6% | 71.4% |
金属 | 68.6% | 76.7% | 79.3% |
在小分子数据集上,LigandMPNN 的 χ1、χ2、χ3、χ4 加权平均正确率分别为 84.0%、64.0%、28.3%、18.7%;Rosetta 分别为 74.5%、50.5%、24.1%、8.1%。这说明 LigandMPNN 对近端侧链几何更可靠,但远端扭转角仍然难预测。

这也符合蛋白侧链建模的基本难点。χ1 和 χ2 更受 backbone 和局部 packing 约束,信号较强;χ3 和 χ4 往往出现在长侧链残基中,远端构象受溶剂、动态、多构象和晶体环境影响更大,天然结构中的单一构象未必代表唯一正确状态。
这篇文章最值得关注的实验部分,是作者把 LigandMPNN 用于重新设计 Rosetta 生成但结合弱或不结合的小分子 binder。
两个例子:
作者还指出,PDB 训练集中没有 rocuronium-binding protein complex;最接近 cholic-acid-binding design 的 PDB 结构也具有不同结构和不同结合位置。这为模型在训练集之外的泛化提供了一定证据。

更广泛地,LigandMPNN 已被用于 DNA 结合蛋白和小分子结合蛋白设计。论文讨论中提到,超过 100 个由 LigandMPNN 设计的 protein–DNA 或 protein–small-molecule binding interfaces 已经在实验中证明能结合目标,并有多例共晶结构与设计模型接近。
早期 AI 蛋白设计更关注生成能折叠的结构。LigandMPNN 提醒我们,功能蛋白设计的关键不只是折叠,而是相互作用。一个稳定蛋白如果不能正确识别底物、小分子、金属或核酸,就不是有用设计。
LigandMPNN 没有使用庞大的 all-atom transformer,也没有做复杂扩散采样。它只是在 ProteinMPNN 上增加局部原子图和蛋白–配体 message passing,就取得了明显收益。这说明对许多设计任务而言,合理的局部几何表示比盲目扩大模型更重要。
论文认为 LigandMPNN 比 Rosetta 类物理设计快约 250 倍,因为它绕过了昂贵的蒙特卡洛侧链身份和构象搜索。对于真实设计项目,速度意味着可以探索更多 backbone、更多序列、更多突变组合和更多过滤策略。
LigandMPNN 不只是给出一个侧链构象,还给出概率分布和 log-probability。这对实际设计很重要。设计者不应只看某个静态模型是否画出氢键,而应关注这个侧链构象是否在模型看来稳定、可信、可重复出现。
它不是 docking 模型,也不是 backbone 生成模型。用户必须先知道小分子、核酸或金属在蛋白中的位置。如果 ligand pose 本身错误,LigandMPNN 会围绕错误上下文设计出看似合理但功能错误的序列。
训练和推理主要基于静态结构。真实结合涉及蛋白柔性、配体构象变化、诱导契合、水网络、质子化状态、离子环境和熵效应。LigandMPNN 能学习局部原子统计规律,但不能完整替代结合热力学建模。
作者也提醒,对于 PDB 中很少出现或完全没有出现的元素,需要谨慎使用;如果元素未见过,甚至需要映射到最接近的已知元素。这对金属酶、含硼/硅/卤素特殊配体、共价抑制剂、金属簇和非天然辅因子设计尤其重要。
天然序列恢复高,说明模型学到了天然复合物中的统计规律,但并不保证新设计功能更好。天然序列不是唯一可行序列,也不是所有场景下的最优工程序列。真正的设计成功仍需要亲和力、选择性、稳定性、表达量和功能实验验证。
χ3 和 χ4 的恢复率较低,说明长侧链远端构象仍难准确预测。对于 Arg、Lys、Gln、Glu、Met 等长侧链参与的相互作用,单纯依赖侧链 packing 结果可能不够,需要结合 Rosetta relaxation、分子动力学或多构象评估。
论文展示的实验验证非常有价值,但很多成功案例来自 Baker/IPD 体系内的设计管线。未来还需要更多独立实验室、更多靶标类型、更复杂配体、更真实药物发现场景中的前瞻性测试。
LigandMPNN 的意义可以放在更大的 AI 蛋白设计流程里理解。
未来的小分子结合蛋白、蛋白传感器和酶设计,很可能不是单模型完成,而是组合式管线:
在这个流程中,LigandMPNN 像是一个高效的功能位点序列设计引擎。它不解决全部问题,但把一个非常关键、过去高度依赖 Rosetta 和人工经验的步骤变成了可快速采样、可规模化、可与生成模型衔接的深度学习模块。
对 AI 制药而言,这尤其重要。小分子药物发现通常关注配体设计,但 LigandMPNN 提供了反向视角:我们也可以设计蛋白去识别小分子。这对 biosensor、diagnostics、targeted delivery、enzyme engineering、synthetic biology 都有潜在价值。
更进一步,LigandMPNN 与 RFdiffusion All-Atom、RoseTTAFold All-Atom、BoltzDesign、BindCraft 等方法之间可能形成互补:前者负责序列和侧链,后者负责骨架、复合物结构或结合构象。真正成熟的 AI 生物分子设计系统,可能会把这些模块整合成一个从目标分子到可实验验证蛋白的闭环平台。