Py学习  »  机器学习算法

Nature Methods|哈工大王亚东团队开发DECODE通用深度学习框架实现多组学的反卷积和整合

单细胞测序网 • 4 月前 • 223 次点击  

导语

细胞丰度变化是理解组织异质性和疾病机制的关键,但单细胞多组学因成本高、样本受限,难以应用于大规模队列研究。去卷积方法通过利用单细胞数据推断组织层面的细胞组成,为解析细胞异质性提供了经济可行的替代方案。然而,现有去卷积算法多针对特定组学开发,依赖特定分布假设,难以跨组学通用,且易受批次效应和细胞类型不匹配影响,限制了多组学整合分析的可靠性。在代谢组学领域,相关工具仍属空白,亟需一种能够同时应对组学异质性、不完整参考和强批次效应的统一去卷积框架,以推动大规模多组学研究和医学发展。

单细胞测序网讯:202632日,哈尔滨工业大学王亚东团队和哈尔滨医科大学程亮团队在Nature Methods发表了题为“DECODE: deep learning-based common deconvolution framework for various  omics data”的研究论文,研究介绍DECODE,一个适用于细胞类型和细胞状态的通用解卷积框架,可以应用于转录组、蛋白质组和代谢组数据,并在细胞层面无缝整合多组学组织数据集。DECODE填补了代谢组学去卷积的空白,并显著优于最先进的方法。此外,DECODE在更接近实际应用的场景中表现出高度的鲁棒性,因此DECODE将成为将多组学队列数据全面扩展到细胞层面的强大工具。


DECODE 构建了一个面向多组学去卷积的统一计算框架,通过四个阶段实现对复杂组织中细胞丰度的稳健推断。首先,利用单细胞数据随机生成具有已知细胞比例的伪组织样本,用于模型训练,从而避免真实组织中细胞组成未知的问题。随后,引入对抗训练机制,通过编码器、判别器和去卷积模块的联合优化,有效消除伪组织与真实组织之间的批次效应,同时保留与细胞组成相关的生物学信号。在第三阶段,模型结合噪声注入、注意力去噪和对比学习策略,显著提升了对不同组学噪声特性和数据分布差异的鲁棒性。最终,DECODE 可根据参考单细胞信息是否完整,灵活选择标准或相对去卷积路径,在存在未知细胞类型的真实场景下仍能可靠估计已知细胞类型的相对丰度(图1

DECODE框架

DECODE 在多种复杂去卷积场景中均表现出稳定且领先的性能,包括跨供体、跨疾病、跨健康状态、跨数据集、空间转录组以及多细胞类型去卷积任务,整体一致性相关系数(CCC)始终处于最高水平。尽管在个别场景中部分方法在皮尔逊相关系数上略有优势,DECODE  在综合指标和复杂应用中持续优于组学特异或空间特异方法。其在真实组织数据和空间转录组中的预测结果与真实细胞分布高度一致,同时在计算效率上保持合理资源消耗,表明 DECODE 目前是适用于转录组和蛋白组数据的最具通用性和实用性的去卷积方法(图2


DECODE转录组学和蛋白质组学数据解卷积性能概述

单细胞代谢组学目前仅能检测数百种代谢物,显著少于转录组和蛋白组;同时,不同细胞类型的代谢特征相似度最高,导致细胞间差异信号极弱,仅少数细胞类型(如粒单系祖细胞)表现出明显区分性。这种低维度、高相似性的数据特性使传统去卷积方法难以准确区分细胞组成。在多数据集对比中,DECODE 在代谢组学去卷积任务中整体表现最优,预测结果与真实细胞比例高度一致,而其他方法常因无法捕捉微弱差异而出现比例截断。结果表明,DECODE 具备从高度相似、低信息密度的代谢数据中提取细胞特异信号的能力,显著拓展了去卷积方法在代谢组学中的适用性(图3

DECODE代谢组学数据解卷积性能概述

细胞状态反映了细胞功能的动态变化,其丰度定量对于理解发育、增殖及环境应答至关重要。为评估 DECODE  在细胞状态去卷积中的能力,研究构建了三个具有代表性的多组学数据集,分别对应伪时间轨迹、细胞周期阶段和药物处理时间点。结果显示,尽管不同细胞类型在相同状态下呈现高度一致的分子特征,且状态信号往往弱于细胞类型差异,DECODE 仍能稳定、准确地重建各类细胞状态的相对丰度。在所有测试场景中,DECODE 的整体性能均优于现有方法,能够有效捕捉连续伪时间变化、离散细胞周期阶段以及药物诱导的状态转变。综合来看,DECODE 不仅适用于细胞类型去卷积,也能够可靠解析多组学数据中的细胞状态组成,为研究复杂生物过程和动态调控机制提供了通用而稳健的计算工具(图4

 

4 DECODE在不同组学数据下的单元状态解卷积性能概述

作者发现,DECODE 在跨组学队列去卷积中展现出卓越的一致性与准确性,在转录组和蛋白组数据上均取得最高的细胞丰度一致性相关系数(CCC),且不同组学间预测结果高度一致。其跨组学预测在 KL 散度和相关性指标上均表现稳定,支持可靠的多组学整合分析。应用于乳腺癌和小鼠肝脏队列时,DECODE 不仅复现了已知的细胞组成比例,还揭示了与肿瘤转移和代谢性肝病进展相关的免疫细胞变化,表明其在真实生物学场景中具有较强的解释力和实用价值(图5

 

5 DECODE 在伪多组学和真实多组学队列中的应用

总之,DECODE 提出了一种统一的多组学去卷积框架,能够同时处理转录组、蛋白组和代谢组数据,填补了代谢组学去卷积领域的关键空白。通过引入迁移式对抗训练,DECODE 在不同平台、健康状态和样本类型之间有效消除批次效应;结合对比学习与自注意力机制,模型可从噪声显著、特征差异微弱的数据中重建可靠的细胞类型和细胞状态信号。多组学伪队列和真实数据验证表明,DECODE 在跨组学一致性和稳健性方面均显著优于现有方法。这些结果表明,DECODE 不仅具备方法学上的通用性,也能在真实生物医学场景中提供具有生物学解释力的细胞组成洞见。

原文连接:https://www.nature.com/articles/s41592-026-03007-y

3月28日,王亚东教授将作为嘉宾出席TICSSO-4会议现场,该研究的第一作者赵天意教授将以“Integration and inference of single-cell multi-omics data”为题在现场报告,欢迎关注!

TICSSO-4全议程公布 | 北京·三月,与全球顶尖科学家共探单细胞及空间组学奥秘(附参会指南)


图片
扫码报名TICSSO-4

-end-

加入单细胞行业交流群,请私信“进群

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/194080