社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

Frances Arnold最新bioRxiv|多反应主动机器学习实现酶的广谱催化进化

Biosyn世纪 • 1 月前 • 362 次点击  

mr-ALDE驱动的原球蛋白定向进化:一次进化练就多副催化绝活

01
研究目标与产业意义

酶催化(biocatalysis)之所以被视为化学合成的可持续路径,是因为酶能以远高于传统催化剂的效率和选择性完成反应,还能催化其天然功能之外的转化——这种能力叫做混杂性(promiscuity)。论文开篇即指出:

"Biocatalysis offers sustainable solutions to pressing challenges in chemical synthesis by exploiting the remarkable efficiency and selectivity of enzymes."

但混杂活性通常很弱,需要通过定向进化(directed evolution,DE)——反复突变加筛选——才能被打磨成真正有用的催化剂。而定向进化能否成功,很大程度取决于起点:手上这个蛋白是否已经对目标反应有一丁点儿可检测的活性。问题是,怎么找到这个起点?现状相当粗放:研究者往往把一堆结构、来源各异的蛋白逐一测试,指望撞上一个有活性的。论文原话形容这种做法是:

"these mostly uninformed "shots in the dark" often result in low success rates for finding the desired functions."

本文的产业意义正在于此:与其"摸黑试错",能不能用机器学习从一个已知不错的蛋白出发,一次性设计出一批各有偏好、又整体覆盖多种反应的酶,把"起点匮乏"这个瓶颈系统性地解决掉?如果可行,制药和精细化工行业每次想开发新的生物催化路线,就不必再从零起步、单独跑一轮筛选和进化——这对依赖生物催化生产手性中间体(例如论文中提到的抗血小板药物替格瑞洛,ticagrelor)的企业尤其有吸引力。

02
创新思路与方法

本文核心方法是多反应主动学习辅助定向进化(mr-ALDE),是作者此前提出的ALDE框架(主动学习辅助定向进化:模型基于新数据反复迭代更新以优化单一酶催化任务)的多目标拓展版。传统ALDE一次只盯着一个反应优化,mr-ALDE的假设是:如果针对多个反应的序列-功能关系存在重叠区域,那么处在重叠区域的变体就更可能对训练时没见过、但相关的新反应也有活性。论文称:

"we reasoned that sequence optimization across several reaction types could enable the discovery of enzyme variants which exist at overlaps of these landscapes, which we propose are 'zones of promiscuity'"

具体实现上,作者选择了一个此前已被改造出去芳构化功能的原球蛋白(protoglobin)变体,命名为混杂原球蛋白PromPgb,作为亲本酶——它对8个初始训练反应中的7个都有可检测活性,只有N2(以羟胺为亚氮宾前体的C–H胺化)测不到产物。围绕血红素辅因子远端确定了8个活性位点残基后,这8个位点的理论组合空间高达20⁸ = 256亿种变体。为避免随机采样落入大片无功能区域,训练库改用两两/三三位点的组合突变(12个双位点库+6个三位点库,共528条序列,仅占搜索空间的1%),既能捕捉关键的上位效应(epistasis),又不会一下子把蛋白拖垮。

这528个变体先测试8个初始训练反应(4个卡宾环丙烷化+4个亚氮宾转移),产出超过4000个序列-功能数据点,喂给一个多任务集成模型分别预测"卡宾转移平均改善度"和"亚氮宾转移平均改善度"两个目标,再用期望超体积改进(expected hypervolume improvement)这个多目标贝叶斯优化的采集函数,排出最值得测试的候选序列。如此循环两轮(Round 1出63条序列、测22个反应;Round 2出64条序列、测26个反应),每一轮携带的突变数都比训练集更高,却仍不掉基础活性。

03
关键结果详解
定向进化的起点困境与"混杂性区域"假说

作者首先把定向进化比作在蛋白序列-功能地形图上的一次"贪婪爬坡":每一轮突变加筛选,都只能往当前看得见的更高处走一步,走到哪座山峰,很大程度取决于爬坡从哪里开始。论文写道:

"Directed evolution of a novel enzymatic activity starts with a protein that displays at least trace levels of the desired function such that a round of mutation and screening can reliably generate improvements."

问题是,起点从哪儿来?目前主流做法是把一批结构、来源各不相同的蛋白拿来逐个测试:

"the identification of new activities commonly relies on experimental testing of diverse but somewhat random collections of proteins"

Fig. 1. 定向进化的

Fig. 1. 定向进化的"爬坡"过程(A):不同起点会走向不同的适应度峰值;以及本文提出的mr-ALDE框架示意(B):模型在多个反应的活性位点突变数据上训练,建议兼顾多反应活性的变体,再对训练内外的反应逐一验证

Figure 1A的地形图直观展示了这种偶然性:从"可能起点"(likely starting point)出发,爬到的往往只是局部最大值(local maxima),而非真正的全局最大值(global maximum)。作者由此提出一个反其道而行的思路:与其在一堆蛋白里找起点,不如在同一个蛋白的活性口袋里同时对多个反应做文章,把那些恰好落在多个反应"地形图"重叠区域的变体找出来。论文称这类变体所处的区域为"混杂性区域":

"we reasoned that sequence optimization across several reaction types could enable the discovery of enzyme variants which exist at overlaps of these landscapes, which we propose are 'zones of promiscuity'"

这就是本文方法多反应主动学习辅助定向进化(mr-ALDE)的立论基础:一次建模,同时兼顾多个反应目标,产出的酶变体天然就该对训练里没出现过的相关新反应也有几率适用。

选定原球蛋白PromPgb为工程亲本,圈定活性位点设计空间

要验证这个假说,首先要有一个"底子够好"的亲本酶——既要对多种反应有基础活性,又要扛得住同时引入多达8个氨基酸突变而不失活或失稳。作者把目光投向原球蛋白(protoglobin),这是一类源自古菌、天然功能未知,但已被证明高度热稳定、且在此前研究中反复被改造出卡宾/亚氮宾转移活性的血红素蛋白。围绕四个卡宾环丙烷化反应和四个亚氮宾转移反应(涵盖C–H键官能团化、芳香去芳构化、硼酸胺化三类机理)组成的初始训练反应(Initial Training Reactions,ITRs):

Fig. Scheme 1. 用于筛选亲本酶并首次训练ALDE模型的8个初始训练反应(C1-C4卡宾环丙烷化,N1-N4亚氮宾转移)

Fig. Scheme 1. 用于筛选亲本酶并首次训练ALDE模型的8个初始训练反应(C1-C4卡宾环丙烷化,N1-N4亚氮宾转移)

作者用这8个反应筛选了一个由84个野生型及已工程化原球蛋白同源物组成的库,找到一个此前已被改造出去芳构化活性(Scheme 1中的N1反应)的Aeropyrum pernix原球蛋白变体:

"we identified a variant of Aeropyrum pernix protoglobin (ApePgb), evolved previously for dearomatization chemistry (N1 in Scheme 1), that demonstrated measurable activity for all ITRs except N3"

这个变体被正式命名为混杂原球蛋白(PromPgb):

"This variant, designated PromPgb (Promiscuous Protoglobin), was selected as the parent enzyme for application of mr-ALDE."

接下来要决定"改哪里"。作者选定了朝向血红素辅因子远端(底物结合处)的8个残基作为设计空间:

"For this study, we identified eight positions, which are facing toward the distal side of the heme cofactor (where substrates bind): L59, W62, F63, F73, L86, S90, F93, and S149"

Fig. 2. PromPgb活性位点结构(A):8个设计位点残基环绕血红素辅因子分布;训练策略(B):全组合空间达256亿种变体,改用双/三位点低维子集采样以兼顾表观遗传相互作用

Fig. 2. PromPgb活性位点结构(A):8个设计位点残基环绕血红素辅因子分布;训练策略(B):全组合空间达256亿种变体,改用双/三位点低维子集采样以兼顾表观遗传相互作用

8个位点的全组合空间极其庞大:

"The combinatorial space of all variants containing mutations at these positions is > 2.5 x 1010."

直接随机采样这么大的空间,大概率只会采到失活变体。作者转而只在两两、三三位点子集内做位点饱和突变

"Twelve double-site libraries and six triple-site libraries were designed based on structural proximity (assessed on a structure prepared using AlphaFold) and ease of construction (Table S8 of Supporting Information). These libraries covered 22 of the 28 possible combinations of the selected eight residues."

最终构建出528条序列(占理论搜索空间的1%)用于初始筛选:

"affording 528 sequences (1% of the possible search space) for initial reaction screening"

训练数据揭示突变的重塑力,两轮ALDE预测显著提升广谱性

528个变体针对8个ITR逐一测试,产出的数据集规模相当可观:

"This collection of 528 PromPgb variants was evaluated against the eight ITRs, yielding a comprehensive dataset of >4,000 sequence-function pairs"

Fig. 3. 两轮ALDE预测流程与效果对比(A):训练库、Round 1、Round 2三批序列的突变谱与规模;训练数据结果(B):8个反应的活性分布;预测变体活性提升(C);变体可催化ITR数量分布(D);变体活性超越亲本的ITR数量分布(E)

Fig. 3. 两轮ALDE预测流程与效果对比(A):训练库、Round 1、Round 2三批序列的突变谱与规模;训练数据结果(B):8个反应的活性分布;预测变体活性提升(C);变体可催化ITR数量分布(D);变体活性超越亲本的ITR数量分布(E)

筛选结果显示,仅仅是训练库里的随机双/三位点突变,就足以大幅度重塑8个反应各自的催化表现:

"Screening revealed that mutations within the training library substantially altered catalytic performance across all eight ITRs"

其中一个亮点是,亲本PromPgb本身唯一测不到活性的N2反应(以羟胺为亚氮宾前体的C–H胺化),在训练库里已经有近一成变体能够催化:

"nearly 10% of variants in the training library were capable of catalyzing C–H amination using hydroxylamine as a nitrene precursor (reaction N2), the only ITR not catalyzed by the parent protoglobin PromPgb"

作者进一步分析了不同反应间活性变化的相关性,发现总体偏弱:

"A Pearson correlation analysis (Figure S68 of Supporting Information) revealed that the seven ITRs accessible to PromPgb were generally, albeit quite weakly, correlated (average r = 0.28)."

这说明突变虽然常常"牵一发动全身"影响多个反应,但每个反应仍保留了自己独有的结构/机理决定因素——这也是为什么"广谱变体"值得专门去找,而不是随便挑一个整体活性好的突变就能覆盖所有反应。

基于这4000多个数据点训练出的多任务模型,第一轮预测出63条序列(相对PromPgb平均汉明距离6.49个氨基酸),送去测试22个反应;第二轮在此基础上更新模型,又预测出64条序列(平均汉明距离4.89个氨基酸),测试26个反应:

"These sequences had a mean Hamming distance of 6.49 amino acids from PromPgb and a mean pairwise distance of 4.19 amino acids... In the second round, informed by updated activity data from Round 1, 64 of the 96 top-ranked variants were obtained and characterized, with a mean Hamming distance of 4.89 amino acids from PromPgb"

两轮预测变体的表现明显优于训练库里的随机突变体:能保留基础活性(≥5%亲本产率)的反应数量中位数从训练库的4个提升到Round 1的6个、Round 2的5个:

"ALDE-predicted variants more frequently retained basal activity (≥5% of parent yield) toward the parent-accessible ITRs than did the random multi-mutants in the training library, with median accessibility of six and five reactions in the first and second rounds, respectively, versus four in the training library"

更值得注意的是"超越亲本"的比例:训练库里只有33%的变体能在任意一个ITR上超过PromPgb,而两轮预测库都有近七成变体做到了这一点:

"While only 33% of training library members were capable of performing any ITR with greater yield than PromPgb, nearly 70% of protoglobin variants in both predicted libraries were capable of catalyzing at least one ITR with greater yield than PromPgb."

顶尖变体呈现"专才"与"通才"的分化格局

作者进一步统计了每个ITR上表现最好的那个变体,整理成一张热图表格:

Fig. Table 1. 预测文库中代表性变体对8个ITR的产率倍数热图(相对PromPgb的log-fold变化),行2-9为各反应的最佳变体,行10-11为改善反应数最多的两个

Fig. Table 1. 预测文库中代表性变体对8个ITR的产率倍数热图(相对PromPgb的log-fold变化),行2-9为各反应的最佳变体,行10-11为改善反应数最多的两个"通才"变体

结果呈现出清晰的"偏科"倾向:卡宾转移表现最好的变体,往往在其他卡宾反应上也不错,但除N4外,在所有亚氮宾反应上都明显掉分:

"The variants which demonstrated the highest activities for carbene transfer ITRs (reactions C1–C4) tended to maintain their activities for other carbene transfer reactions, while taking major losses in activity for all nitrene transfer ITRs (N1–N4) besides N4"

反过来,亚氮宾转移表现最好的变体,则在一定程度上保留了卡宾转移活性——这种不对称性本身就是一个值得玩味的机理线索。而真正意义上的"通才"——那些能以最多反应数改善、且改善幅度最大取胜的两个变体VAFFMAFQ和TNVFITFQ——反而不是任何单一反应上的头名:

"the two designs which catalyzed the greatest number of ITRs with higher yields than PromPgb (VAFFMAFQ and TNVFITFQ; Table 1, Entries 10 and 11) were not the highest performers for any single ITR."

这也揭示了"专精"与"广谱"之间的真实取舍:亲本PromPgb的"看家本领"N1(去芳构化)就是一个典型例子,两轮预测都没能找到比PromPgb本身更强的N1变体,最好的N1突变体产率只有亲本的五分之一:

"The best mutant for reaction N1 (VAVFIAFN; Table 1, Entry 6) could only catalyze this reaction with 11% yield (one fifth the yield of PromPgb), indicating a tradeoff between the improvement of a promiscuous activity and the "native" function."

变体集合在未训练的26个反应体系中依然展现广谱性与立体发散能力

前面的分析都还停留在最初的8个ITR上。真正检验mr-ALDE价值的,是这批变体能否推广到完全没在训练中出现过的新反应。作者把测试范围扩大到26个反应,其中18个是训练阶段从未见过的新转化:

Fig. Scheme 2. 扩展至26个碳宾/亚氮宾转移反应的检验全景(A):训练/Round 1/Round 2覆盖情况及PromPgb活性缺口;增强催化功能实例(B):N6胞内C–H胺化、C13碳宾C–H插入;立体发散产物(C):C1环丙烷cis/trans、C8亚甲基环丙烷E/Z;全新活性实例(D):PromPgb完全无法催化、但预测变体可以催化的反应

Fig. Scheme 2. 扩展至26个碳宾/亚氮宾转移反应的检验全景(A):训练/Round 1/Round 2覆盖情况及PromPgb活性缺口;增强催化功能实例(B):N6胞内C–H胺化、C13碳宾C–H插入;立体发散产物(C):C1环丙烷cis/trans、C8亚甲基环丙烷E/Z;全新活性实例(D):PromPgb完全无法催化、但预测变体可以催化的反应

结果相当亮眼:只要PromPgb本身能催化出可检测产物的反应,几乎都能找到比它更强的预测变体:

"For every transformation that PromPgb could catalyze with detectable product formation, we identified at least one model-predicted variant that was more active than the parent."

更有说服力的是泛化到机理上完全不同的反应。变体FYIFMMFQ能催化烷基叠氮化物分子内C(sp³)–H胺化生成吡咯烷,而这条反应需要叠氮活化和分子内环化两个训练反应里完全没出现过的机理步骤:

"variant FYIFMMFQ catalyzes the intramolecular C(sp³)–H amination of alkyl azide 1 to afford pyrrolidine 2 in 3% yield (Reaction N6 in Scheme 2B), whereas PromPgb furnishes only trace product under identical conditions."

模型迭代更新的价值也在第二轮体现:变体VVFFMAFN在分子间碳宾C–H插入反应中把产率从1%提到6%,是亲本的六倍:

"the second round yielded variant VVFFMAFN, which delivers product 4 in 6% yield, representing a six-fold increase relative to PromPgb (Reaction C13 in Scheme 2B)."

另一层惊喜来自立体化学。训练数据从未记录任何反应的立体化学结果,但不同活性位点构型的变体天然就会偏向不同的立体路径。对于环丙烷化核心结构恰好是抗血小板药物替格瑞洛关键中间体的C1反应,PromPgb本身对顺式/反式产物几乎没有选择性,而作者找到的变体VYIAIVFQ能以9:1的比例偏向合成替格瑞洛所需的trans-产物:

"we identified variant VYIAIVFQ, which could deliver this diastereomer with a 9:1 preference for the trans- product."

类似地,变体TAIFMVFQ甚至能把PromPgb原本偏好E构型的反应,反转为偏好Z构型产物。最后,在PromPgb完全无法催化的10个反应中,预测变体集合成功拿下了其中5个:

"There were 10 transformations in the full set of tested reactions which PromPgb could not catalyze with detectable yield (Scheme 2A). We were able to identify variants that catalyzed five of these previously inaccessible transformations."

从最初8个训练反应到最终26个反应的全景检验,两轮mr-ALDE预测反复证明了同一件事:只需一次以多反应数据训练的模型迭代,就能从同一个亲本身上"挖"出既能保留原有活性、又能在训练外新场景里广泛泛化的变体集合,其中还包含此前完全不存在的立体选择性和全新反应能力。

04
产业影响与应用前景

论文测算,若靠传统定向进化对每个反应单独跑一轮进化才能达到同等的功能覆盖广度,需要好几个独立工程项目;而mr-ALDE一次设计周期就产出了127个催化活性、机理各异的变体,只测了655条序列:

"this ALDE design cycle furnished 127 catalytically active and mechanistically diverse variants upon testing only 655 sequences."

对生物催化相关企业而言,这意味着"一次投入、多点覆盖",不必为每个新反应单独立项筛选起点。作者也特意点出这套方法相对于FuncLib、MODIFY等零样本计算设计工具的优势:

"this method is particularly applicable to the generation of enzyme libraries primed for the discovery of new-to-nature biocatalytic reactions, for which there is presumably little evolutionary information contained in existing protein sequence information."

也就是说,零样本工具依赖天然序列中已有的进化信息判断突变是否稳定、有功能,但超自然化学(new-to-nature chemistry,即自然演化中从未出现过的反应类型,如本文的卡宾/亚氮宾转移)恰恰是天然序列里没有先例可循的,零样本方法在这里先天缺乏依据。此外,本研究把超过7000个序列-功能数据点连同代码一并公开在GitHub(https://github.com/fhalab/mrALDE),这类大规模、多反应标注数据集本身就是稀缺资源,可供后续机器学习模型训练和基准测试使用,间接降低整个领域的研发门槛。

05
未来探索方向

作者坦承了几处有待打磨的地方。其一,训练反应集该怎么选还不清楚——用更少还是更多样的初始反应训练,才能让模型预测得更准,仍需系统比较。其二,目前的目标函数只是"卡宾/亚氮宾平均改善倍数",容易被训练集中个别改善幅度极端的变体带偏;论文承认149位点富集天冬酰胺/谷氨酰胺很可能就是这种偏置的产物,如何设计不受离群值影响的目标函数编码是后续课题。其三,本文选用的原球蛋白骨架恰好是作者实验室长期深耕、先验知识极其丰富的对象,这套方法在缺乏同等先验积累的新酶上能否照样奏效仍待验证。最后,作者也提出一个更贴近传统生物催化需求的方向:mr-ALDE能否反过来用于扩展某个天然反应的底物范围(而非发掘全新反应类型),这可能是离产业应用更近的一步。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199252