逆合成生物学与深度学习驱动的酵母代谢暗物质系统挖掘
酿酒酵母(Saccharomyces cerevisiae)是合成生物学和代谢工程领域最重要的底盘细胞之一,从生物燃料到药物前体,大量高价值化合物的生产都依赖于它。然而,一个令人不安的事实是:我们对酵母代谢活动的了解远不如想象中全面。现有的基因组尺度代谢模型(genome-scale metabolic model, GEM)只覆盖了酵母代谢组中约7%的代谢物,超过90%的代谢组仍然是一片未知的领域。
"more than 90% of the yeast metabolome remains uncovered"
这些未被探索的生化反应被称为地下代谢(underground metabolism),形象地比喻为代谢的"暗物质"。它们虽然看不见、摸不着,却深刻影响着细胞工厂的实际表现。代谢工程中经常出现这样的困境:异源途径引入宿主后,目标产物的产量远低于理论预期,甚至完全检测不到。背后的"元凶"往往就是地下代谢中那些未知的副反应,它们悄悄地降解了目标产物,或者将前体物引向了意料之外的分支。深入理解这些隐藏的代谢反应,对于提高细胞工厂的生产效率、降低工业生物技术的研发成本,具有不可替代的战略意义。
这项由清华大学李飞然实验室主导、与瑞典查尔姆斯理工大学Jens Nielsen团队合作完成的研究,提出了一套整合逆生物合成(retrobiosynthesis)与深度学习的系统化工作流,试图一举揭开酵母地下代谢的面纱。
"we have developed an integrated workflow that combines retrobiosynthesis, deep learning-based enzyme annotation and enzyme–substrate prediction to systematically explore yeast underground metabolism"
所谓逆生物合成,是一种从产物出发、反推可能的合成路径的策略。研究团队从MetaNetX和MetaCyc两大生化反应数据库中提取了22,134条反应规则,然后将这些规则应用于酵母代谢组数据库(YMDB)中的代谢物,像拼积木一样组装出所有理论上可能发生的反应。由于反应组合的数量级极为庞大(仅脂质反应就达到1.79亿条),团队设计了一套精巧的过滤策略,包括去除断头反应、要求反应与已知代谢网络相连接等,最终将反应空间压缩到约109万条。
"This approach streamlines the reaction expansion to a single step, effectively addressing the combinatorial explosion that has previously been encountered in retrobiosynthesis pipelines"
在获得候选反应之后,团队利用CLEAN和DeepECtransformer两种深度学习模型为每条反应预测催化酶的EC分类编号,再通过ESP(enzyme-substrate pair)预测方法筛选能够催化特定底物的酵母内源酶。最终构建的Yeast-MetaTwin模型包含16,244种代谢物、1,976个代谢基因和59,865条反应,将酵母代谢组的覆盖率从7%大幅提升至92%。
酿酒酵母的代谢能力远超我们目前的认知边界。这项研究通过逆生物合成与深度学习的整合策略,系统性地挖掘了此前隐藏在暗处的"地下代谢"反应网络,构建了迄今最全面的酵母代谢模型Yeast-MetaTwin,并通过动力学分析、副产物预测和实验验证三个维度,展示了这一全景代谢图谱的实际应用价值。
整个研究的技术起点是一套系统化的反应挖掘流水线。研究团队从MetaNetX和MetaCyc两大数据库中提取了22,134条生化反应规则,将其应用于酵母代谢组数据库(YMDB)中2,540种具有SMILES结构的代谢物。由于反应规则与代谢物的排列组合数量极为庞大,仅脂质类反应就产生了1.79亿条候选,非脂质类也有400万条。
"This approach streamlines the reaction expansion to a single step, effectively addressing the combinatorial explosion that has previously been encountered in retrobiosynthesis pipelines"
Fig. 1. 逆生物合成与深度学习整合工作流示意图
为了从海量候选中筛选出生物学上合理的反应(Figure 1),团队设计了多层过滤策略:去除断头反应(产物或底物无法与其他反应相连)、要求反应与已知酵母代谢网络存在连接、以及保留在酵母体内有可能被催化的反应。经过这一系列筛选,最终获得约109万条候选反应。随后,研究者利用CLEAN和DeepECtransformer两种深度学习模型为候选反应预测催化酶的EC分类编号,再通过ESP酶-底物对预测方法,从酵母基因组编码的酶中筛选出最可能催化每条反应的内源酶。这条流水线最终产出了包含16,244种代谢物、1,976个代谢基因和59,865条反应的Yeast-MetaTwin模型。
"Yeast-MetaTwin, comprising 16,244 metabolites, 1,976 metabolic genes and 59,865 reactions"
将Yeast-MetaTwin与此前广泛使用的Yeast9模型相比,反应数量从约4,131条跃升至59,865条,代谢组覆盖率从7%提升至92%。这一数字直观地说明了此前的代谢建模遗漏了多少信息。
"93% of the yeast reaction network has not previously been explored through systematic modelling"
Fig. 2. Yeast-MetaTwin模型统计概况与代谢网络可视化
Figure 2展示了Yeast-MetaTwin的整体架构和代谢组成。通过Sankey图可以清晰看到,新拓展的地下代谢反应覆盖了脂质、氨基酸衍生物、聚酮类、萜类等多个化合物大类,其中脂质类反应的占比最大。利用iPath3进行的代谢网络可视化显示(Figure 2d),已知代谢网络仅占据了代谢地图的一小部分核心区域,而地下代谢的反应则像蛛网一样向外延伸,覆盖了大量此前完全空白的代谢空间。模型还揭示了一批枢纽代谢物(hub metabolite),即在网络中参与大量反应的关键节点化合物。这些枢纽代谢物往往处于多条代谢通路的交汇点,是理解代谢网络动态行为的关键。
为了验证模型的可靠性,研究者将Yeast-MetaTwin与多个独立数据集进行了交叉比对:基因必需性预测、合成致死基因对预测以及BIOLOG底物利用谱预测。在这些基准测试中,Yeast-MetaTwin的表现均优于或不低于Yeast9,说明新增的大量地下代谢反应不仅没有引入噪声,反而提升了模型对细胞生理行为的预测精度。
构建了网络结构之后,研究者进一步追问:地下代谢中的酶催化与已知代谢有什么本质区别?通过预测已知网络和地下网络中酶的催化动力学参数,团队发现了一个引人注目的规律。
"enzymes associated with the underground metabolism exhibit, on average, higher Km values than those of the known metabolic network"
Fig. 3. 已知代谢与地下代谢的kcat和Km分布比较
具体而言,地下代谢中酶的kcat(催化常数/转化数)分布与已知代谢网络相似,但Km(米氏常数)的中位值约为0.25 mM,而已知网络约为0.11 mM。
"showing an approximately twofold difference in median values"
这一发现具有深刻的生物学意义(Figure 3)。Km反映了酶对底物的亲和力,Km越高意味着酶与该底物的结合越弱。地下代谢中酶的Km系统性偏高,恰恰印证了"酶混杂性"(enzyme promiscuity)的本质:这些酶的"正职"是催化已知代谢中的反应,而催化地下代谢反应属于"兼职",因此对非天然底物的亲和力自然较低。这种混杂性并非缺陷,相反,它为生命提供了进化的原材料。
"This flexibility of underground metabolism allows enzymes to evolve additional functions, helping organisms adapt to different environmental conditions"
团队还分析了六大酶分类(EC1至EC6)中已探索与未探索反应的比例。结果显示,异构酶(isomerase, EC5)类别中已被探索的反应比例最低,仅为8.5%,而连接酶(ligase, EC6)的已探索比例最高,达到48.9%。
"the EC5.X.X.X (isomerase) category has the lowest proportion of explored metabolism, with 8.5% explored"
这说明异构化反应是酵母地下代谢中最大的未知领域之一,也意味着大量的底物异构化副反应可能在代谢工程中悄悄发生却从未被注意到。
在展示了模型的全局统计特征之后,研究者将注意力转向了一个实际问题:酵母内源代谢对天然产物的降解效应。这对代谢工程具有直接的指导意义,因为将异源途径导入酵母时,目标产物可能被宿主的内源酶降解,导致产量下降。
Fig. 4. 酵母天然产物降解反应预测与反应类型分布
团队利用Yeast-MetaTwin系统预测了48种酵母天然代谢产物的降解反应(Figure 4)。分析发现,氨基酸和中心碳代谢的中间产物参与的降解反应数量最多,这与它们在代谢网络中的枢纽地位一致。研究者还绘制了不同化合物类别的降解反应热图,展示了每类产物可能遭遇的降解方式(氧化、还原、水解、异构化等),为后续的菌株改造提供了明确的靶点清单。
更具产业价值的是对异源产物降解反应的预测。研究团队选取了40种在酵母细胞工厂中常见的异源表达产物,利用模型预测了它们在酵母中可能遭遇的降解反应。
"terpenes, aromatic compounds and flavonoids have a high potential to be degraded in yeast"
Fig. 5. 异源产物降解预测及香叶醇、裸盖菇素、L-PAC降解路径
Figure 5详细展示了三种代表性化合物的降解路径预测。以香叶醇(geraniol)为例,模型预测了多条降解途径:氧化为香叶醛、还原为香茅醇等。对于裸盖菇素(psilocybin),模型预测了脱磷酸化为psilocin等降解反应。对于L-苯乙酰甲醇(L-PAC,麻黄碱前体),模型同样预测了多种可能的降解产物。这三个案例代表了萜类、生物碱和芳香族化合物三种主要的天然产物类型,展示了模型在不同化合物骨架上的预测能力。值得注意的是,萜类、芳香族化合物和黄酮类被模型判定为在酵母中降解风险最高的三类异源产物,这一信息对于从事相关化合物的发酵生产的研究者而言是极有价值的预警。
计算预测的价值最终取决于实验验证。研究团队选择了香叶醇的降解反应作为验证对象。模型预测了两个酵母内源基因ADH6和SFA1编码的酶(Adh6p和Sfa1p)能够催化香叶醇氧化为香叶醛,以及OYE2编码的酶催化香叶醇还原为香茅醇。
Fig. 6. ADH6和SFA1催化香叶醇氧化的实验验证
研究者在体外表达并纯化了这些酶,通过NADH消耗的吸光度变化监测催化活性(Figure 6a)。实验结果证实,Adh6p和Sfa1p确实能够催化香叶醇到香叶醛的氧化反应。随后,团队通过GC-MS定量分析反应产物(Figure 6b,c),质谱确认了新峰的分子量与香叶醛标准品一致(Figure 6d,e)。
"Compared with the control, enzymes encoded by ADH6 and SFA1 degraded 31.5% and 11.6% of geraniol"
"both Adh6p and Sfa1p can catalyse the oxidation of geraniol to geranial, thereby validating the accuracy of our workflow"
与对照组相比,过表达ADH6的菌株使香叶醇降解了31.5%,过表达SFA1的菌株降解了11.6%(Figure 6f)。阳性对照(来自罗勒的已知香叶醇脱氢酶Gedh1p)也表现出预期的催化活性。这些实验结果不仅验证了Yeast-MetaTwin对香叶醇降解基因的预测是准确的,更重要的是证明了整套逆生物合成加深度学习工作流的有效性,为后续大规模验证和应用奠定了基础。
这项工作的产业意义是多层面的。在最直接的层面,Yeast-MetaTwin模型为代谢工程师提供了一张前所未有的酵母代谢全景地图,使得副反应的识别和规避从"盲人摸象"变成了"按图索骥"。当科研人员在酵母中表达一条异源途径时,可以先在模型中检索目标产物可能遭遇的降解反应和参与基因,提前进行基因敲除或替换,从而显著缩短菌株优化的周期。
在更深远的层面,这种整合逆生物合成与深度学习的方法论具有高度的可迁移性。同样的工作流可以应用于大肠杆菌、枯草芽孢杆菌等其他工业微生物,也可以拓展到植物和哺乳动物细胞的代谢研究。对于制药企业而言,理解宿主细胞的地下代谢有助于提高天然药物(如裸盖菇素、萜类化合物、生物碱)的发酵产量,降低生产成本。对于合成生物学初创公司来说,这种计算优先、实验验证的研发范式,意味着可以用更少的资源实现更精准的菌株设计。
Yeast-MetaTwin将酵母代谢组的覆盖率从7%提升到了92%,但剩下的8%同样值得关注,它们可能涉及更罕见的反应类型或尚未被数据库收录的代谢物。更重要的是,当前模型预测的反应仍需更大规模的实验验证。文章揭示了异构酶(isomerase, EC5)类别中仅有8.5%的反应被此前探索过,这意味着大量的异构化反应隐藏在暗处,等待发现。
此外,地下代谢的动态调控是另一个亟待攻克的前沿。酶的混杂性催化并非一成不变,它会随着环境条件(碳源、胁迫、生长阶段)的变化而改变。将代谢组学的动态测量数据与Yeast-MetaTwin的静态网络结合,有望实现真正意义上的代谢"数字孪生"。深度学习模型在酶-底物相互作用预测方面的精度也有提升空间,特别是在处理全新骨架和罕见反应类型时。随着更多实验数据的积累和算法的迭代,我们有理由期待一个越来越清晰的酵母代谢全图逐渐浮现,而这幅图的绘制方法也将为整个微生物代谢工程领域的系统化升级铺平道路。