科研、项目合作:panp6600 (注明来意,清北硕博团队专注于AI for Science自研大模型,接受天使轮投资,欢迎投资者咨询)
————————————
本文内容独家整理,盗用必究
蛋白质的能量挫折(energetic frustration)是理解蛋白质功能的关键物理原理,但传统计算方法的巨大计算成本一直阻碍着蛋白质组规模的研究。来自德国莱比锡大学、智利天主教大学、巴塞罗那超级计算中心等顶尖机构的研究团队,开发了基于深度学习的超快速工具FrustraMPNN, 将完整蛋白质组的单残基能量挫折分析从数年缩短至数小时,实现了7000倍的速度提升 ,同时在3415个人类蛋白质结构的外部验证集上保持高达0.80的Spearman相关系数。这项突破性工作由通讯作者Jens Meiler教授(莱比锡大学药物发现研究所、范德堡大学)、César Ramírez-Sarmiento教授(智利天主教大学生物医学工程研究所)和Clara Schoeder博士共同领导。
什么是蛋白质的局部能量挫折?为何它如此重要? 蛋白质的局部能量挫折源于能量景观理论和最小挫折原理。 在蛋白质的天然状态下,大部分相互作用和区域被优化以维持结构稳定性,这些区域被称为最小挫折区域(minimally frustrated) 。然而,特定区域存在相互冲突的相互作用,形成局部能量张力,表现为中性挫折(neutral)或高度挫折(highly frustrated)位点。
论文图1A展示了天然蛋白质(RNase LE)与设计蛋白质(PD-L1结合物)的挫折模式对比 。天然蛋白质显示典型的挫折分布,而设计蛋白质由于主要优化总能量而表现出异常大量的未挫折区域。图中残基按挫折指数着色:绿色(最小挫折)、灰色(中性)、红色(高度挫折)。
这些高度挫折区域并非结构缺陷,而是 进化选择的关键功能特征 。挫折模式已被证明能驱动变构作用所需的蛋白质动力学,通过将活性位点残基置于化学反应所需的能量不利构象来实现酶催化,通过界面的构象灵活性介导蛋白质-蛋白质和蛋白质-配体结合,以及调控病毒生命周期和折叠转换行为等重要生物过程。
传统方法为何难以实现蛋白质组规模分析?
尽管挫折分析的重要性已被确立,但其综合的"单残基模式"(single-residue mode)分析在规模化应用方面仍面临巨大障碍 。主要障碍是计算成本:现有基于物理的方法,如Frustratometer网络服务器和FrustratometeR R包,依赖AWSEM-MD力场来生成和评估诱饵能量。
深度突变单残基挫折分析特别耗时,因为它需要系统地突变和能量评估每个位置的所有20种可能氨基酸,而不仅仅是天然残基或特定突变。 对于一个300残基的蛋白质,这种计算需要生成6000个结构模型——每个可能的替换一个——并对每个模型通过广泛采样进行独立的挫折计算以获得统计显著性 。这比构象挫折分析或突变挫折分析大约多20倍的计算量。因此,单残基分析可能需要多个CPU天的计算时间,较大的蛋白质甚至需要数周或数月。计算成本随蛋白质大小呈二次方增长,有效地阻止了需要对数千种蛋白质进行全面单残基挫折分析的蛋白质组规模研究。
FrustraMPNN的深度学习架构如何突破计算瓶颈? 研究团队开发的FrustraMPNN采用了专门设计的图神经网络(GNN)架构来捕获决定局部能量挫折的局部结构背景,其灵感来自成功的蛋白质分析框架ProteinMPNN和ThermoMPNN。
论文图1B展示了FrustraMPNN的架构示意图 。蛋白质被建模为图,每个残基作为一个节点,边连接到48个空间上接近的残基邻居。这种图结构自然编码了理解局部能量冲突所必需的三维关系。
核心技术原理的数学表达 输入处理阶段 :骨架坐标(N, Cα, C, O)和虚拟Cβ被转换为成对距离,并由ProteinMPNN中的结构编码器处理以捕获几何约束。这些距离使用高斯径向基函数(RBF)编码,可以表示为:
其中
和 分别表示残基 和 的空间坐标。
序列解码阶段 :序列解码器将这些结构特征条件化到野生型序列嵌入上。与ProteinMPNN生成自回归序列概率不同,该系统从解码器中提取潜在嵌入。这些解码器输出与原始序列嵌入连接,并输入到Light attention块中。
注意力机制 :Light attention块为不同特征分配权重,使模型能够专注于最具信息量的结构特征。注意力权重可以表示为:
其中 、 、
分别代表查询、键和值矩阵, 是键向量的维度。
最终预测 :两层多层感知器(MLP)将学习到的表示映射到每个残基的连续挫折指数。可选地,通过ESM-2语言模型捕获的进化信息嵌入也被连接到light attention特征中并输入MLP。最终的挫折指数 可以表示为:
其中 、 和
分别表示结构、序列和进化嵌入。
数据集构建策略如何影响模型泛化能力? 研究团队使用了两个具有对比特征的训练数据集来训练FrustraMPNN:
论文图1C和1D展示了FireProt和Megascale数据集的特征 。(a) FireProt数据集基于FireProtDB数据库,包含约100个天然蛋白质的3404个实验表征的稳定性突变,代表了不同的折叠和功能,蛋白质长度从50到400个残基;(b) Megascale数据集包含776298个天然和从头设计蛋白质的系统突变扫描,主要是长度低于75个残基的蛋白质。
两个数据集不仅在数据点数量和蛋白质大小上不同,而且在特征上也有差异 ,如二级结构的总体比例和突变分布。FireProt蛋白质展示了广泛的尺寸范围(平均
残基)、二级结构组成(31%螺旋、28%片层、41%环)和代表主要结构和进化类别的折叠类别。相比之下,Megascale蛋白质主要较小(平均 残基),螺旋结构丰富(52%螺旋、18%片层、30%环),折叠多样性有限。
数据集平衡策略的关键作用 研究团队为每个数据集创建了三个不同版本:(a) 默认版本(仅计算FireProt和Megascale数据集中存在的突变的挫折);(b) 饱和版本(计算两个数据集每个位置所有可能突变的挫折);(c) 平衡版本(通过子采样实现最小、中性和高挫折类别的平等代表性)。
在训练期间平衡挫折类别被证明对于跨越全范围挫折指数的准确预测至关重要 。天然数据集表现出对最小挫折残基的强烈偏向(通常占位置的40%),高度挫折位点仅占约10%。尽管在挫折数据中模型在不平衡数据上训练时对高度挫折区域的敏感性降低,研究团队的平衡策略通过有针对性的子采样使类别间的代表性均等化,**在不牺牲整体性能的情况下将高度挫折残基的预测准确性提高了23%**。
外部验证显示出色的泛化能力 研究团队在一个完全外部的验证集上严格测试了FrustraMPNN,该验证集包含3415个由AlphaFold2预测的人类蛋白质结构。这些蛋白质具有高置信度预测(平均pLDDT > 70)和50到1000个残基的长度,在大小、来源和整体多样性方面呈现出与两个训练数据集不同的分布。
在这个具有挑战性的外部集合上,使用ESM-2嵌入和light attention训练的平衡FireProt模型表现出卓越的泛化能力 ,在挫折类别中加权平均RMSE为 ,Spearman相关系数为
(表2)。
论文图2A展示了使用FireProt和Megascale数据集训练的模型在外部人类蛋白质组验证集上的挫折类别(中性、最小、高度)分类性能的混淆矩阵 。对角线条目表示类别特定的召回率,表明FireProt模型在高度挫折残基方面实现了更高的准确性(0.744),相对于Megascale模型(0.654)。
FireProt训练的模型准确捕获了单残基挫折指数的分布,与使用Megascale数据集训练的模型相比,在识别不同挫折类别方面表现特别强劲。 使用基于先前工作的单残基最小挫折指数 和高挫折指数 的截断值 ,两个模型都在最小挫折区域实现了良好的性能(FireProt 0.804,Megascale 0.790),但FireProt在正确识别高度挫折残基方面显著优于Megascale(0.744 vs. 0.654)。
论文图2B展示了计算真值(灰色)和预测(青色)之间挫折类别的全局分布比较
。 论文图2C展示了按结构背景分层的预测准确性 :左侧面板显示了残基溶剂可及性(表面、边界、核心)的RMSE和Spearman相关系数;右侧面板显示了二级结构元素(螺旋、片层和环)的验证指标。最高的Spearman相关系数被识别为蛋白质核心和螺旋作为二级结构元素。
论文图2D展示了每种氨基酸类型的单残基挫折预测的氨基酸特异性性能(RMSE、F1分数)分析 。最高的预测准确性(F1分数 )观察到Gly、Ile、Val、Thr、Ser、Leu、Cys和His,值在 和 之间。
酶活性位点的挫折预测如何验证模型准确性? 为了评估FrustraMPNN的预测能力,研究团队将其输出与三个代表性酶的基于结构的FrustratomeR计算进行了比较:A类β-内酰胺酶(PDB: 4BLM)、丝氨酸-羧基蛋白酶(PDB: 1NLU)和β-葡萄糖苷酶(PDB: 1CBG)。
论文图3展示了酶活性位点中局部蛋白质单残基挫折预测的测试案例 。在β-内酰胺酶中, 高度挫折的关键残基Lys73、Glu166和Lys234,以及中性挫折的Ser70、Ser130和Ala237,被FrustratometeR计算和FrustraMPNN预测一致识别 (图3A),这也与先前工作的注释一致。
结构投影的视觉检查证实,FrustraMPNN准确地再现了全局挫折景观,特别是保留了催化位点特征的高挫折信号。预测类别总数的比较显示,从24个(计算)到21个高度挫折位点的轻微变化,从81到76个最小挫折,从151到159个中性挫折残基。不一致是稀疏的,主要局限于中性和最小状态之间的转换,而不是高度挫折功能残基的显著错误分类。
论文图3中的Sankey图量化了计算和预测状态之间残基计数的流动 ,显示出高度一致性(例如,24个高度挫折残基中的21个被正确预测)。序列图对齐了来自FrustratometeR(FR,计算)和FrustraMPNN(FM,预测)的挫折谱,不一致(dis)由深蓝色条表示。
对于丝氨酸羧基蛋白酶和β-葡萄糖苷酶,也可以看到类似的模式(图3B)。在大多数情况下,预测的挫折状态与FrustratometeR计算一致。 活性中心的关键残基从Mechanism and Catalytic Site Atlas获得 。在这两种情况下,活性中心包含高度和中性挫折残基,这些残基被预测方法准确捕获。
计算速度提升有多显著? FrustraMPNN最直接和变革性的优势是其计算效率,消除了广泛采用综合单残基挫折分析的主要障碍。研究团队系统地对FrustraMPNN在单个GPU上与当前标准工具FrustratometerR在单残基模式下运行的预测时间进行了基准测试,涵盖了从50到1000个残基的蛋白质。
论文图4A展示了与FrustratomeR单残基模式相比的平均加速因子与蛋白质序列长度的关系 (以25个残基为单位)。单独的曲线显示了FrustratomeR使用1个(黄色)、10个(绿色)和21个(蓝色)CPU核心的性能。 对于约100个残基的小蛋白质,FrustratomeR必须执行约2000个单独的挫折计算,FrustraMPNN相比单CPU计算提供了约1200倍的加速 。
这种优势随着蛋白质大小急剧增加: 对于大约300个残基的蛋白质,需要6000个挫折评估,使用FrustratometerR需要19小时,FrustraMPNN在约30秒内完成整个分析 。将FrustratometerR并行化到21个CPU(每个突变一个CPU),计算仍需要80倍的时间。对于较大的蛋白质(超过10000个单独计算),与21个CPU相比,加速超过100倍,FrustraMPNN保持次分钟计算时间。
蛋白质组规模分析的实际应用
这种可扩展性对于蛋白质组规模分析特别关键。 作为示例案例,研究团队以单残基模式分析了完整的大肠杆菌蛋白质组(约4300个蛋白质),使用FrustratometerR需要大约1.71 CPU年,但使用FrustraMPNN在不到12个GPU小时内完成,相当于计算时间减少了7000倍 (图4B)。
论文图4B展示了大肠杆菌蛋白质组(约4300个蛋白质)完整单残基挫折分析的估计计算时间 :使用单个CPU的FrustratometeR需要1.71 CPU年,而FrustraMPNN仅需12 GPU小时。
结果证明了深度学习方法的卓越可扩展性优势,特别是考虑到单残基分析需要评估每个位置的所有20种氨基酸。因此, FrustraMPNN在单次操作中以高精度预测整个蛋白质组所有位置的所有单残基挫折指数 。
数据集多样性如何驱动模型泛化能力? 三个关键因素对于实现FrustraMPNN跨不同蛋白质拓扑、二级结构组成和大小的稳健泛化至关重要:训练数据中的结构多样性、挫折类别的平衡代表性,以及进化信息的结合。
结构多样性的重要性从两个训练数据集的比较分析中显而易见 。FireProt蛋白质展示了广泛的尺寸范围(平均
残基)、二级结构组成(31%螺旋、28%片层、41%环)和代表主要结构和进化类别的折叠类别(SCOP,蛋白质结构分类)。相比之下,Megascale蛋白质主要较小(平均 残基),螺旋结构丰富(52%螺旋、18%片层、30%环),折叠多样性有限。
覆盖蛋白质结构空间的这种差异直接与AlphaFold人类蛋白质组验证集上的泛化性能相关。 FireProt模型的卓越泛化能力可能归因于其在训练期间接触到更大的结构多样性 。尽管Megascale包含近80倍的数据点,但其专注于小型人工生成的蛋白质意味着它只覆盖了天然蛋白质占据的构象和化学空间的有限部分。相比之下,FireProt数据集包含的数据较少,但覆盖了更广泛的蛋白质折叠、二级结构组成和功能类别。
这一发现—— 精心策划的多样性超过了纯粹的数据量 ——为生物预测模型的未来发展提供了重要的方法论见解。在结构多样化的FireProt数据集上训练的模型表现优越,尽管其规模小于Megascale,这挑战了更多数据总是产生更好模型的常见假设,正如在蛋白质表达和蛋白质工程的深度学习模型中也已确定的那样。
FrustraMPNN如何加速生物学发现? FrustraMPNN代表了计算结构生物学的变革性进步,消除了将挫折分析限制在专业应用的主要障碍。通过实现数量级加速同时保持高准确性,这一工具使这种强大的分析技术对更广泛的科学界可及。其影响扩展到蛋白质科学的多个领域,从基础机制研究到应用生物技术。
显著的加速使得以前超出合理计算范围的全新研究范式成为可能。 跨整个蛋白质组的挫折映射现在可以系统地识别数千种蛋白质中的功能位点 ,揭示传统基于序列或结构的方法看不到的模式。
在蛋白质工程中,设计变体的改变挫折模式的高通量筛选提供了一种新的优化标准,补充了蛋白质-蛋白质相互作用中的稳定性和结合亲和力。事实上, 最近对蛋白质降解靶向嵌合体(PROTACs)与目标蛋白结合进行降解的研究显示,蛋白质-蛋白质界面处的界面挫折更高 ,表明界面挫折的计算可以指导基于结构的合理PROTAC设计方法。
对于药物发现,蛋白质-蛋白质界面的挫折分析可以识别易受小分子破坏的可塑区域,指导变构调节剂的设计。FrustraMPNN还可以促进在探索突变景观期间优化特定挫折特征,如核心稳定性或界面的高功能挫折。单残基挫折指标可以作为多标准评估函数中的项,与标准势能(如Rosetta能量函数)一起,或指导采样策略(如蒙特卡罗模拟),以选择在热力学稳定性和必要功能动力学之间取得平衡的序列。
模型存在哪些局限性和未来发展方向? FrustraMPNN的一个结构性限制是其仅限于单个残基的挫折指数,这有效地将复杂的相互作用网络投影到单个数字上。这种粒度可能无法揭示对蛋白质功能至关重要的成对相互作用模式中的特定挫折。例如, 催化残基在单个残基水平上通常表现为最小挫折,因为相反的能量相互作用相互抵消 ,与环境中支持残基的高度挫折特定接触掩盖了这种内在挫折。未来的发展可以扩展架构以预测接触图上的挫折,使这些目前被平均化的成对能量冲突得以解决。
此外,必须注意的是, FrustraMPNN的预测与使用Frustratometer的计算并不完全一致 。FrustraMPNN提供的是准确性和巨大预测速度之间的平衡,以实现在相对短的时间内筛选许多蛋白质,或如所示,整个蛋白质组,并计算每个位置和每个突变的整个单残基挫折景观。当然,准确性也发挥作用,特别是在非结构化区域(如环)或片层/螺旋与环之间的过渡中,预期会有较低的准确性。
这些错误可能源于ProteinMPNN使用的嵌入,导致整体预测的高度不确定性,特别是对于低质量骨架。一个指示可能是酶测试案例β-葡萄糖苷酶(PDB: 1CBG)中催化残基身份的预测。一个关键残基Asn234在预测中被错误分类为中性,在FrustratometeR的计算中被分类为高度挫折。这可能是因为Asn234位于β片层到环的过渡处,从而损害了预测的准确性。
尽管存在这些局限性, FrustraMPNN与其他计算工具的交叉承诺强大的协同作用 。与生物分子结构预测方法(如AlphaFold2、AlphaFold3以及Boltz2)的集成使得能够对缺乏实验结构的蛋白质进行挫折分析,将覆盖范围扩展到整个蛋白质组。与设计工具(如ProteinMPNN或RFDiffusion3)的结合可以将挫折作为明确的设计标准,创建具有定制动态属性的蛋白质。
对理解蛋白质功能和进化的深远影响 除了作为计算工具的直接实用性之外,FrustraMPNN还为蛋白质生物学的基本问题提供了新的视角。快速分析大型蛋白质家族中的挫折揭示了 进化如何塑造挫折位点的分布,以从保守的支架实现多样化的功能 。同源物的系统分析表明,功能位点的挫折模式通常比序列身份更保守,表明进化在能量景观上的操作与在特定残基上的操作一样多。
FrustraMPNN还可以提供区分天然蛋白质和人工蛋白质的设计原则的见解。计算设计蛋白质的分析显示, 它们通常表现出比天然对应物更低的总体挫折 ,反映了对稳定性而非功能的优化。这一观察表明,引入受控挫折可以增强设计蛋白质的功能能力,超越当前最大化热力学稳定性的范式,向工程化类似天然对应物的动态、响应系统迈进。
开源工具与数据可用性
FrustraMPNN使用Python 3.8+实现,依赖项包括PyTorch 1.12+、PyTorch Geometric 2.0+和NumPy。 该软件在GitHub上以MIT许可证分发 (https://github.com/schoederlab/frustraMPNN/),包括全面的文档、安装说明和教程。Google Colab笔记本提供了无需本地安装的即时访问。所有训练数据、模型权重、UniProt ID和验证结果存储在Zenodo(https://doi.org/10.5281/zenodo.17978321)。
论文引用:
Beining M, Engelberger F, Parra RG, Schoeder CT, Ramírez-Sarmiento CA, Meiler J. FrustraMPNN: An ultra-fast deep learning tool for proteome-scale analysis of deep mutational single-residue local energetic frustration in proteins. bioRxiv. 2025.
代码和数据资源:
GitHub仓库:https://github.com/schoederlab/frustraMPNN/ Zenodo数据集:https://doi.org/10.5281/zenodo.17978321 ESM-2模型:https://github.com/facebookresearch/esm frustrapy工具:https://github.com/engelberger/frustrapy.git ---------------------结束---------------------
— 商务合作— |AI for Science / AI 制药:模型复现、训练微调、部署与平台工程化交付 我们提供AI大模型工程化与可交付部署服务服务,面向 AI for Science / AI 制药方向(包括蛋白质、分子生成、结构预测、虚拟筛选、docking、单细胞等)。从“研究脚本”升级为 可复现、可训练可微调、可评测、可部署、可交接 的系统化工程。
1)环境与复现交付(从零到跑通) 2)训练(Training)与微调(Fine-tuning)工程交付 3)推理(Inference)与批量任务运行 4)评测(Evaluation)与报告自动化 5)平台化与团队可用(课题组/团队落地)
6)部署、运维与交付 咨询:panp6600
服务器部署 :远程部署到你的服务器/云 GPU(含常见运维配置) 监控与告警(可选) :运行状态、资源占用、失败告警、成本/时长统计 交付文档 :Runbook(从零部署、日常运行、排障指南) 交付录屏 :关键流程演示(部署、训练、推理、评测、报告) 培训与售后 :1 小时培训(可录屏)+ 限期售后支持(可选按月订阅维护) 简单 Web 面板(提交任务/查看结果/下载报告) 工作流平台化 :数据 → 训练/微调/推理 → 评测 → 报告 的端到端流水线
实验管理 :项目/实验命名规范、任务列表、运行状态、失败原因归因与重跑
多用户协作(可选) :权限与审计、共享资源管理、结果集中存储
评测指标体系 :整理并实现项目/论文常用指标(按方向与任务定制) 对照实验 :baseline 与 ablation 的标准化跑法(同一套脚本、同一套记录) 自动化报告 :输出标准报告(表格/图表/关键结论/配置与复现实验命令) 可追溯性 :报告自动引用对应的版本、数据、参数与产物路径,便于复查 推理脚本统一化 :输入输出格式规范(文件/参数/API),批量推理支持 任务编排 :多任务队列、批处理、并发控制、断点续跑(适合大规模生成/筛选) 产物管理 :输出结果落盘、结构化记录(便于后续筛选/追溯/复用) 性能优化 :显存/吞吐优化建议(batch、精度、缓存、流水线等,视项目适配) 轻量化微调(如 LoRA/Adapter 等,视项目适配) 训练入口工程化 :将训练脚本整理为统一入口(参数配置、日志、保存、恢复、评测)
数据管线 :数据下载/清洗/切分(train/val/test)、缓存、数据版本管理与校验
训练配置体系 :YAML/JSON 配置化(超参、模型、数据、评测、输出路径统一管理)
可恢复训练 :断点续训(checkpoint)、自动保存与恢复、训练中断容错
实验追踪 :记录参数、代码版本、数据版本、随机种子、checkpoint 与产物清单
多卡/分布式训练(如需要) :单机多卡、分布式启动脚本、通信参数与稳定性验证
训练质量控制 :loss 曲线、梯度/数值稳定性检查、过拟合监控、早停策略(可选)
交付产物 :训练配置、启动脚本、checkpoint 管理规范、训练/微调报告(含关键图表)
环境固化 :Docker / Conda 方案(二选一或双方案),依赖锁定、版本记录、可迁移配置 GPU 适配 :CUDA/驱动/torch 版本匹配与验证,单机/多卡环境可用性检查 一键运行 :安装 → 下载模型/数据 → 运行 → 输出结果 的脚本化流程 结果对齐 :复现基准实验(baseline),对齐论文/仓库给出的关键指标或输出格式 交付产物 :可复现目录结构、运行命令清单、运行日志与产物说明