英文原题:Machine Learning-Enhanced Hyperspectral Raman Imaging for Label-Free Molecular Atlas of Alzheimer’s Brain
通讯作者:Shengxi Huang (Rice University)
作者:Ziyang Wang⊥, Jeewan C. Ranasinghe⊥, Dennis C. Y. Chan, Ashley Gomm, Rudolph E. Tanzi, Can Zhang, Nanyin Zhang, and Shengxi Huang*
构建生物组织分子图谱的无标记分子成像技术,对于理解复杂的生理和病理过程至关重要。传统的生物成像手段,如正电子发射断层扫描(PET)、磁共振成像(MRI)、免疫分析和荧光显微镜等技术提供了宝贵的结构和功能信息,但它们往往由于化学特异性不足、空间分辨率有限或依赖外源性标记等在应用中受到限制,这些技术局限在阿尔茨海默病的研究中尤为突出。
阿尔茨海默病(AD)以进行性神经退行性变和特定脑区恶化为特征,将导致严重的认知能力下降,目前的针对其治疗方法主要旨在缓解症状,这进一步强调了对分子生物标志物的需求,以捕捉早期生化变化并指导药物开发。AD病理核心是错误折叠的淀粉样蛋白(Aβ),但仅凭其存在无法完全解释伴随疾病进展的多因素分子破坏,因此亟需能够以高空间分辨率解析区域特异性生化特征的免标记成像技术,以发现捕捉早期生化变化的生物标志物。
拉曼光谱通过探测化学键特征的振动模式,提供了无标签、非破坏性的分子对比。高光谱拉曼成像在每个像素点捕捉完整的波谱,从而实现在无需染色的情况下实现组织切片化学全景的可视化,可实现了具有分子级特异性的亚微米级空间映射,使其在分析异质的大脑微环境时特别具有价值。然而,高光谱拉曼成像产生的丰富光谱信息对后续的分析研究带来的困难:每张图像可能包含数千个重叠的光谱,其中编码了细微的生化变化。因此,提取具有生物学意义的模式需要先进的、数据驱动的分析方法,以将光谱数据转化为具有空间分辨率的分子图谱。机器学习 (ML) 算法为解析此类高维光谱数据提供了一个强大的框架。无监督方法可以在没有预先标签的情况下揭示内在变异和分子关联,而监督模型可以对光谱进行分类,并识别出对诊断区分贡献最大的光谱特征。将机器学习与拉曼光谱相结合,近期已能够对复杂的生物样本进行准确且可解释的分析,包括 AD 的早期检测。
为应对这一挑战,美国Rice大学Shengxi Huang教授课题组提出了一种基于机器学习增强的高光谱拉曼成像框架,该方案实现了无标记且具有分子分辨率的空间映射,空间分辨率达到亚微米级,并以此构建了AD小鼠脑切片的全面分子图谱。生成的分子图谱显示,淀粉样蛋白Aβ42的积累显著增加,且胆固醇和糖原代谢表现出区域特异性改变,特别是在海马体和皮层区域 。这些结果证明了“机器学习-拉曼” (ML-Raman) 成像技术超越经典Aβ病理学捕捉分子异质性的能力。该框架建立了一种可解释的、数据驱动的空间分辨率生化成像方法,通过结合光谱学与人工智能技术,可以实现定量的分子表征。
图1. ML-拉曼框架工作流程概览。
(a) AD与非AD样本脑切片的高光谱拉曼成像。
(b) 采用无监督与有监督ML算法的分析流程。
(c) 基于K均值与主成分分析的分子特征提取与空间可视化。
(d) 运用支持向量机、泊松-稀疏编码逻辑回归、随机森林及XGBoost等监督式ML方法进行分类、特征重要性映射与生物标志物识别。
(e) AD评分的空间映射及分子分布与疾病进展相关性分析。
图2. 拉曼光谱与无监督机器学习分析。
(a) AD与非AD脑切片的平均及单点拉曼光谱,并附对应光谱的主成分一载荷谱。
(b) 按疾病状态(AD与非AD)颜色编码的主成分一、二、三得分分布图。
(c) 按脑样本编号颜色编码的主成分一、二、三得分分布图。
(d) 光学图像。(e) 基于区域边界K均值聚类标注的脑区划分。
(f) 非AD样本的主成分一得分分布图。
(g) 1004 cm⁻¹波数处的拉曼强度分布图。(h) 光学图像。
(i) 基于区域边界K均值聚类标注的脑区划分。
(j) AD样本的主成分一得分分布图。
(k) 1004 cm⁻¹波数处的拉曼强度分布图
图3. Aβ40与Aβ42相对分子丰度的余弦相似度概率分析。
(a) 非AD与AD脑切片中Aβ40及Aβ42的余弦相似度概率分布小提琴图。水平线代表第25、50(中位数)及第75百分位数。
(b) 非AD与AD脑切片中Aβ40及Aβ42的余弦相似度概率空间分布图。
(c) 非AD与AD脑切片中Aβ42/Aβ40余弦相似度概率比值的小提琴图。
(d) 非AD与AD脑切片中Aβ42/Aβ40余弦相似度概率比值的空间分布图。
图4. AD与非AD脑切片的监督机器学习分析。
(a) 使用支持向量机、泊松-稀疏编码逻辑回归、随机森林及XGBoost算法进行AD与非AD分类时,测试集的精确率、召回率与F1分数。交叉验证折叠间的方差以误差条形式呈现。
(b) 支持向量机与泊松-稀疏编码逻辑回归生成的特征重要性分布图。
(c) 泊松-稀疏编码逻辑回归对训练集与测试集生成的AD评分空间分布图。
(d) 海马结构、皮层、丘脑及下丘脑区域中非AD与AD样本AD评分的小提琴图。
(e) Aβ40/Aβ42余弦相似度概率比值与AD评分的相关性分析。
图5. 潜在生物标志物分子的识别。
(a) AD与非AD样本间潜在生物标志物的余弦相似度概率中位数差异。
(b) 非AD与AD脑切片中胆固醇与糖原的余弦相似度概率分布小提琴图。
(c) 非AD与AD脑切片中胆固醇与糖原的余弦相似度概率空间分布图。
(d) 海马结构、皮层、丘脑及下丘脑区域中AD与非AD样本间胆固醇与糖原的余弦相似度概率中位数差异。
该论文作者开发了一个机器学习增强的拉曼(ML-Raman)框架,该框架将拉曼光谱与可解释的机器学习算法相结合,实现了具有亚微米空间精度和分子级分辨率的无标签成像,并构建了阿尔茨海默病(AD)小鼠脑切片的分子图谱。通过将高光谱拉曼数据与无监督及有监督学习模型相结合,该方法能够在无需外部标记的情况下,实现快速的疾病分类、区域映射和生物标志物识别。无监督方法有效地描绘了组织边界,并将脑切片分割成不同的解剖区域,揭示了分子组成的决策空间异质性。通过正余弦相似度分析,证实了AD样本中Aβ40和Aβ42特征的升高,且Aβ42与疾病进展表现出更强的关联。空间映射进一步揭示,Aβ42的积累主要集中在皮层(CTX)和海马体(HPF),而丘脑(TH)和下丘脑(HY)的变化极小 。通过对 COSSim-p分布的提琴图分析得出,AD大脑中的Aβ42/ Aβ40比值始终高于对照组,这突显了其在量化疾病严重程度方面的诊断相关性。
包括支持向量机(SVM)和峰值敏感逻辑回归(PSE-LR)在内的监督机器学习算法提供了高准确度的可解释分类。这些模型生成的特征重要性光谱识别了与疾病相关的拉曼峰,并产生了可视化区域病理的 AD 评分图。两种方法都一致强调皮层和海马体是 AD 分类置信度最高的区域,这与神经病学研究中将这些区域识别为淀粉样蛋白沉积早期部位的结果相吻合。
除了确认已建立的标志物外,ML-Raman 分析还发现了新的分子指标,包括胆固醇和糖原代谢的紊乱,且在皮层和海马体中表现出显著偏差。这些发现支持了新兴的证据,即脂质失衡和葡萄糖利用改变促进了神经退行性疾病的进展。
ML-Raman 框架作为一个通用的、可解释的平台,可用于构建连接光学光谱学和人工智能的分子图谱,能够以微米级空间分辨率和分子级特异性对组织进行同步可视化和分子分析。通过构建 AD 大脑的综合分子图谱,该研究为深入了解神经退行性疾病的机制以及识别代谢共病奠定了基础。此外,该框架的可扩展性和适应性使其应用范围能够从 AD 扩展到其他神经退行性疾病(如帕金森病和亨廷顿舞蹈症),以及异质生物和纳米结构材料系统,在这些领域,无标签、数据驱动的分子映射正变得日益重要。
Shengxi Huang (Rice University)
https://profiles.rice.edu/faculty/shengxi-huang
ACS Applied Materials & Interfaces 2026, 18, 1, 977–988
Publication Date: December 31, 2025
https://doi.org/10.1021/acsami.5c22623
Copyright © 2025 American Chemical Society
Xing Yi Ling
Nanyang Technological University
Peter Müller-Buschbaum
Technische Universität München
ACS Applied Materials & Interfaces为化学家、工程师、物理学家和生物学家等的跨学科领域提供服务,重点探索如何具体应用开发新材料和研究界面过程
Time to First Peer Review Decision