基因测序技术的快速发展使得罕见病遗传学研究取得了显著进展,但仍有相当大比例的患者无法确定根本致病变异。现有技术中,全基因组测序(WGS)和全外显子组测序(WES)能够鉴定大量新型疾病相关基因,从这些变异中识别致病变异既耗时又需要专业知识支持。更重要的是,仅根据候选基因中变异的罕见性及预测致病性对其进行排序,而不结合临床背景,无法从WES/WGS数据中准确鉴定出疾病相关基因。虽然已有的基于表型的分析方法已在临床诊断中得到广泛应用,但在实际临床场景中的诊断准确率仍不尽如人意。
为克服现有方法的局限性,美国费城儿童医院王凯教授团队利用人工智能(AI)
来提升临床基因组测序结果解读。该团队开发了一种机器学习模型RankVar,该模型可基于临床记录和WGS/WES数据,对罕见病的致病变异进行优先级排序。RankVar融合了机器学习的解释能力与表型驱动分析的精准度,具有独特优势,即可直接整合至临床或科研工作流程中,无需经过表型特征分析这一中间步骤即可对测序数据进行变异排序与解读。研究显示,
RankVar相较于现有方法表现优异,能够适应不同的遗传模型及X/Y染色体变异,并可为单基因或寡基因疾病中的变异优先级排序提供有效的框架。
目前已有多种基于表型的基因优先排序方法能够整合表型数据,从基因测序数据中识别致病基因,但这些方法在实际临床场景中的诊断率远低于模拟研究中显示的诊断效能。研究团队将随机森林算法作为研究的核心机器学习方法,利用来自1KGP的2504个样本约77万个变异位点训练了模型,698个1KGP相关样本的22万个变异位点验证了模型,包含人为添加的致病性/可能致病性(P/LP)变异。研究共选取20
个特征用于模型训练,并在六个独立数据集上测试了模型性能:包括费城儿童医院(CHOP)260例各类孟德尔遗传病患者、西蒙斯综合库(SSC)356例样本、西蒙斯基金会资助的自闭症研究项目(Spark)中的97例样本以及出生缺陷生物样本库(BDB)中的135例样本,以及Phenopacket-Store的5912个合成样本。
图1.RankVar示意图。
为评估RankVar与其他广泛使用的工具的性能,研究团队
使用四个独立数据集(CHOP、BDB、SSC、Spark)比较了RankVar与三种可本地运行且免费的方法LIRICAL、 Exomiser、PhenIX。对CHOP、BDB数据集中已知诊断变异位点,以及SSC、Spark数据集中的候选致病变异位点进行排序时,RankVar模型均优于以上三种基准方法(图2E)。RankVar在CHOP、BDB
、SSC和Spark数据集上的前10位变异识别准确率分别为90.0%、81.5%、46.1%和76.3%。此外,在所有四个独立数据集中,RankVar的前1位识别准确率比基准方法高出9%以上,前10位识别准确率高出10%以上。
研究团队进一步利用SFARI基因列表中的基因评估了RankVar模型在SSC
和Spark数据集中的性能。数据显示,按SFARI类别1/S筛选变异后,RankVar模型性能显著提升(图2F)。SSC数据集中,前1位、前5位及前10位预测准确率分别从23.3%、37.6%和46.1%上升至46.0%、63.3%和68.3%;Spark
数据集中,预测准确率也从52.6%、74.2%和76.3%分别升至65.7%、88.6%和88.6%。此外,18个包含临床确诊致病基因的Spark样本中,RankVar性能表现持续优于所有三种基准方法。
图2.RankVar模型验证和性能评估。
研究团队分析了RankVar在不同变异类型及遗传模式下的准确性。在独立测试数据集中,RankVar模型在功能缺失变异上的表现均优于错义变异。此外,在
CHOP、 BDB、SSC和Spark数据集中,RankVar模型对具有显性遗传模式候选基因的识别准确率均高于隐性遗传基因。
此外,在评估能否区分同一个体中疾病相关的P/LP变异与表型不匹配的P/LP变异时,RankVar成功将测试数据集中与疾病相关的P/LP变异优先排序于表型不匹配的P/LP变异,表明RankVar更倾向于优先考虑与个体表型相关的变异,而非对所有P/LP变异进行统一排序。
为进一步验证RankVar模型的有效性,研究人员选取KBG综合征患者作为案例进行检测,验证了
ANKRD11基因为其最佳候选基因,证明了该模型准确识别候选基因的能力。同时,研究人员选取了CHOP医院部分已确诊病例进行研究,探究了RankVar与其他方法的工作机制差异(图3)。特征图分析显示,在分析的案例中表型信息对正确识别致病变异具有重要作用。RankVar模型将CHD7基因变异排在CHARGE综合征的首位,将KDM6A基因变异评为歌舞伎综合征的首要致病因素,预测准确率优于所有基准方法。以上案例充分证明RankVar
在不同遗传模式和临床背景下精准识别致病基因及变异方面具有卓越能力。
图3.RankVar模型的确诊案例分析。
此外,研究团队还评估了RankVar在真实世界表型中的适用性。在Phenopacket Store的合成数据集中,RankVar在所有模拟样本中均表现出优异性能:约88%的致病性变异位列前1名,98%进入前5名,100%进入前10名,充分证明该模型在实际应用场景中的有效性。
研究团队开发的RankVar模型将机器学习算法与表型数据及测序数据相结合,专门用于WGS/WES数据分析。RankVar模型可直接整合至临床或科研工作流程中,无需经过表型特征分析即可对测序数据进行变异排序与解读,其性能超越了现有的基准工具,并在真实临床应用中展现出可靠性。总之,该研究在整合表型与基因型信息以进行变异优先级排序方面实现了重大突破,显著提升了遗传学诊断的准确率,为推进罕见病的诊断提供了有效策略,有望助力初步诊断、未解决病例的再分析以及新型疾病基因的发现。
原文信息:
Zhang, Y., Ahsan, M.U., Wang, P. et al. RankVar: machine learning-based variant ranking and reinterpretation for rare genetic diseases. Genome Med (2026). https://doi.org/10.1186/s13073-026-01701-2
·END·