
长期以来,全基因组关联分析(GWAS)是用来寻找决定家犬体型、毛发和耳型等性状基因的重要方法。然而,传统的表型数据获取方式正面临两大瓶颈:极度依赖人工测量或专家评分。人为预定义的指标往往过于单一,难以捕捉到生物体复杂、连续且细微的整体形态特征。
为了打破这一局限,中国科学院昆明动物研究所王国栋团队近日构建了一个创新的跨学科研究框架。该研究巧妙地利用深度学习方法,直接从家犬图像中提取视觉特征,并成功将其映射到基因组上,精准定位到了决定家犬表型的关键基因。
论文链接:www.science.org/doi/10.1126/sciadv.aee1088
研究团队通过网络爬取与严格筛选,建立了一个包含181个犬种、共13,254张高质量图像的家犬数据集,涵盖了极其丰富的体型和外貌差异。
研究人员采用两种主流的视觉模型进行犬种识别训练,并从中提取出256维的高维特征。t-SNE可视化和相关性分析证实,这些由AI学习到的特征能够清晰地自发区分不同的犬种,高维特征虽然信息丰富,但直接用于遗传分析会带来“维度灾难”。
为此,研究团队引入UMAP算法对高维特征进行降维处理,将提取出的连续嵌入特征作为一种全新的嵌入表型。分析表明,两种不同模型提取的嵌入表型在信息上呈现出一定的交叠与一致性。

在上述自动的算法流程中,研究者并未输入任何具体的形态标签。那么,这些纯数字化、未经人工命名的特征,究竟反映了家犬品种间的什么形态差异?
带着这个疑问,研究者将这些表型与家犬真实的生物学性状进行了相关性分析。结果表明,提取的特征高度契合毛发长度、体型大小等真实的性状;由这些数字表型构建的表型树,也清晰地呈现出由具体性状驱动的演化分支——这意味着,AI在没有人类提示的情况下,自己“看懂”了犬种之间的外貌差异。

基于这些全新表型数据,研究团队开展了全基因组关联分析,结果重新发现了多个经典犬类形态基因,此外,还检测到多个与毛色形成、体型大小、外貌结构等紧密相关的全新遗传位点,验证了该方法的可靠性与发掘潜力。

作者总结道:“通过将AI的像素级视觉感知与严谨的遗传学分析相结合,我们不仅拓宽了对家犬演化和形态遗传机制的认知,也为未来其他物种的复杂表型研究提供了一种高效率、低成本的全新范式。”
王国栋(本文通讯作者):中国科学院昆明动物研究所研究员,中国动物学会动物行为学分会委员,中国动物学会生物进化理论专业委员会第四届委员会委员。荣获国家高层次人才特殊支持计划青年拔尖人才,云南省高层次人才培养支持计划支持;荣获中国科学院青年科学家奖,云南省中青年学术和技术带头人,中国科学院青年创新促进会优秀会员,2021年度优秀审稿人等奖项。长期致力于犬科物种行为和进化方面的研究。
俄广晓(本文第一作者):云南大学生命科学学院硕士研究生,主要研究方向为利用深度学习等多模态方法对家犬的行为和形态的研究。
本文由作者团队特邀供稿,文中观点仅为作者观点,不代表Science/AAAS立场。