社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

Nat Commun丨林捷聪等开发整合启动子-增强子序列与多模态表观基因组数据预测基因表达的深度学习框架——EPInformer

BioArt • 3 月前 • 256 次点击  

转录调控是细胞分化和环境适应的核心机制,依赖于DNA序列、表观基因组信号与三维染色质空间组织之间的精密协调。其中,增强子enhancer作为关键的顺式调控元件,可跨越数十至数百千碱基的基因组距离调控靶基因的表达。尽管ENCODEFANTOM4D Nucleome等国际大型计划已积累了海量的染色质开放性、组蛋白修饰及三维染色质接触数据,但如何系统性地整合这些多模态信息以准确预测基因表达,仍然是计算基因组学领域的重大挑战。现有的深度学习模型如AlphaGenomeBorzoi虽然在序列层面展现了强大的预测能力,但它们参数量庞大、训练成本高昂,且对远端增强子的调控效应捕捉能力有限。与此同时,基因组大语言模型(如Evo2Nucleotide Transformer虽擅长学习序列语法规则,但并非为细胞类型特异性的基因表达建模而设计,且微调成本同样不菲。

日,香港大学罗锐邦教授,麻省总医院/哈佛医学院/Broad研究所LucaPinello教授和昌平实验室赵亚杰研究员团队在NatureCommunications上发表了题为EPInformer: scalable and integrative prediction of gene expression from promoter-enhancer sequences with multimodal epigenomic profiles的研究论文该研究提出了一种可扩展的深度学习框架EPInformer,通过显式建模启动子-增强子相互作用,灵活整合DNA序列、表观基因组信号和染色质三维接触数据,实现了高精度的基因表达预测。


EPInformer的核心设计围绕多模态数据灵活整合远距离启动子-增强子相互作用显式建模两大目标展开,由四个功能模块组成(图1。第一,序列编码器EPInformer-seq采用残差卷积与扩张卷积相结合的架构,将启动子(转录起始位点周围2 kb及其候选增强子的DNA序列编码为固定维度的序列嵌入表示,并可通过在细胞类型特异的H3K27ac信号上进行预训练来增强序列特征的学习。第二,融合层将序列嵌入与增强子活性信号(如H3K27acDNase、增强子与启动子之间的距离或Hi-C染色质接触频率等信息进行通道拼接和卷积融合,使模型能够根据可用数据类型灵活配置输入。第三,交互编码器基于Transformer多头注意力机制,专注于学习启动子与多个候选增强子之间的相互作用模式,通过注意力掩码排除增强子-增强子间的干扰信号,高效聚合远距离调控信息。第四,预测模块整合启动子表示与mRNA半衰期等基因组特征,通过前馈神经网络输出最终的基因表达预测值。

1. EPInformer通过整合多模态启动子-增强子数据预测基因表达的框架概览

EPInformer在三项核心任务中展现出显著优势:

1. 高精度基因表达预测。在六种ENCODE细胞系上进行的12折跨染色体交叉验证中,整合全部数据模态的EPInformer-PE-Activity-HiC模型在RNA-seq预测中达到了0.84的平均Pearson相关系数,在CAGE预测中达到0.883,均显著优于现有方法XpressoCREaTorSeq-GraphReg,并在EnformerBorzoi各自的标准测试集上取得了更高的预测性能。值得注意的是,即使不使用Hi-C数据,仅整合增强子活性信号的EPInformer-PE-Activity也超越了Borzoi的表现,充分体现了该框架的灵活性。此外,EPInformer同样支持以ATAC-seq数据替代DNaseH3K27ac信号进行训练,为仅有ATAC-seq数据的细胞类型提供了实用的建模方案。

2. 精准预测增强子-基因相互作用。EPInformer利用交互编码器的注意力权重生成增强子-基因连接的评分,可有效识别细胞类型特异性的增强子-靶基因配对。在包含1,575对候选增强子-基因连接的K562 CRISPR扰动数据集中,EPInformer 的注意力评分优于广泛使用的ABCActivity-by-Contact评分AUPRC0.732 vs. 0.698,尤其在远端增强子(距转录起始位置60-100 kb的识别上优势更为突出。在GM12878细胞中,该评分对精细定位eQTL变异的富集分析同样优于ABC评分,进一步验证了EPInformer在增强子-基因调控关系预测中的有效性。

3. 揭示增强子中关键转录因子结合基序。EPInformer的序列编码器可独立用于预测增强子活性,并结合TF-MoDIScoTangermeme等下游解释工具,在全基因组范围内发现细胞类型特异的转录因子TF结合基序。在K562细胞中,模型成功识别出GATA1GATA2GATA1/TAL1等红系关键调控因子的基序;在GM12878细胞中则富集到ELF1ELK1BACH1等淋巴系相关基序。通过对KLF1基因远端增强子的体外饱和突变分析,EPInformer进一步发现了SP4ETV6GATA1等关键TF基序,为解析增强子的序列调控语法提供了碱基分辨率的功能洞察。

EPInformer的一个突出特点在于其轻量化与高效性。该模型仅包含约44.7万个参数,不到Enformer参数量的0.2%,在单块A100 GPU上约15分钟即可完成对18,377个蛋白编码基因的训练。这一特性使得即使是计算资源有限的实验室也能快速训练、部署和适配新的细胞类型与数据集,大幅降低了深度学习方法在基因表达建模领域的应用门槛。

总体而言,EPInformer通过将启动子-增强子序列信息与多模态表观基因组数据有机整合,显式建模远距离顺式调控元件的相互作用,在基因表达预测、增强子-基因连接识别和转录因子基序发现三项任务中全面超越了现有方法。该框架兼具高精度与高可及性,为研究者从顺式调控层面理解基因表达的动态调控机制提供了高效且灵活的计算工具,有望在复杂疾病遗传变异的功能解读和精准医学等方向发挥重要作用。

该研究由香港大学、麻省总医院/哈佛医学院/Broad研究所和昌平实验室等机构合作完成。香港大学计算与数据科学学院/麻省总医院癌症研究中心/昌平实验室赵亚杰课题组助理研究员林捷聪为本文第一作者,香港大学罗锐邦教授和麻省总医院/哈佛医学院/Broad研究所Luca Pinello为本文通讯作者。

原文链接
https://www.nature.com/articles/s41467-026-70535-8

制版人: 十一


学术合作组织

(*排名不分先后)



战略合作伙伴


(*排名不分先后)


·




转载须知


【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。








BioArt

Med

Plants

人才招聘

近期直播推荐



点击主页推荐活动

关注更多最新活动!



Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/195172