跨祖先精细定位原图局部:MESuSiE定位结果

CGM第393期:跨种族的遗传因果变异精细化定位统计方法研究及应用

跨种族 GWAS 数据如何精细定位因果变异?报告介绍 MESuSiE 统计方法及其在多族群研究中的应用。
高博然
高博然

美国密歇根大学

美国密歇根大学生物统计专业周翔课题组的博士研究生。他的工作主要集中在开发统计方法和计算工具解决大规模和高维数据中的重要生物医学问题。这些数据包括生物银行级别的全基因组测序数据、功能注释数据、转录组学和蛋白质组学数据等。由于现有多组学相关研究大多集中在欧洲裔人群,他的工作特别关注一些代表性不足的人群,比如亚洲裔人群或者非洲裔人群,通过开发一系列统计方法和计算工具,运用多祖先来源的数据增强了对复杂疾病和性状遗传机制的理解,以此促进科学发现中的包容性和公平性。他的学术研究成果以独立第一作者发表在高水平期刊上,如Nature Genetics, PLoS Genetics等。 教育/工作经历: 2017-至今 密歇根大学安娜堡分校生物统计博士(其中2022年于23andME公司进行遗传统计实习) 2014-2017 密歇根大学安娜堡分校生物统计学硕士研究生、流行病学公共卫生硕士 2012-2013 唐山工人医院医务部 2006-2011 苏州大学临床医学本科

在 Bilibili 打开完整回放 ↗

全基因组关联研究(GWAS)旨在识别与各种疾病和疾病相关复杂性状有关的遗传变异。GWAS通过关联分析来检验单个遗传变异(SNP)与性状之间的关联。由于连锁不平衡(LD),关联分析往往识别出某个基因组区域内大量高度相关的SNPs,这使得难以识别真正的causal SNP(因果SNP)。精细定位 (fine-mapping) 方法将LD结构考虑在内,并依赖于稀疏性的先验概率来识别潜在的因果SNP。然而大多数现有的精细定位方法只能一次分析一个遗传祖先,忽略了跨祖先共有的遗传结构。以血脂为例,大约一半(52%-65%)的因果变异是跨祖先共享的,并且效应间存在强相关性。因此,利用多祖先共有的遗传结构,充分考量不同祖先间多样的LD结构,将会提高精细定位的分辨率和统计功效。然而,现有的多祖先精细定位方法(multi-ancestry fine-mapping) 假设所有因果变异在祖先间共有,忽视了近一半的因果SNPs并非跨祖先共有这一事实。此外,现有的多祖先精细定位方法要么不切实际地假设在基因组区域内只存在一个因果变异,要么依赖于MCMC进行推断,计算成本高昂。MESuSiE明确对跨祖先共有和特定的因果变异建模,考虑了不同祖先多样LD的结构,使用GWAS 汇总数据,扩展单一祖先精细定位变分推断算法SuSiE,以实现多祖先精细定位。MESuSiE可以捕捉并划分共有和特定祖先的因果变异,产生合理校准的统计量,实现高统计功效、高分辨率的精细定位,计算效率高。MESuSiE 的建模和算法特性,使其在多祖先精细定位方面特别有效。

具体地讲,MESuSiE首先采用了双变量正态混合模型,该模型允许MESuSiE将因果SNP分类为共有和特定祖先,从而利用跨祖先间的不同因果关联模式进行更有效的精细定位。其次,MESuSiE将单变量SuSiE变分算法推广到双变量及多变量,从而实现了高统计效力且计算可拓展的多祖先精细定位。重要的是,MESuSiE的算法和建模框架是通用的,可以进一步扩展在两个以上的祖先中进行精细定位,且明确模拟跨祖先的各种不同因果效应。

CGM第393期:跨种族的遗传因果变异精细化定位统计方法研究及应用 原文配图1

参考文献

  1. Gao Boran, Zhou Xiang. MESuSiE enables scalable and powerful multi-ancestry fine-mapping of causal variants in genome-wide association studies. Nature Genetics. 2024;56(1):170-179. DOI: 10.1038/s41588-023-01604-7

评论(0

登录后即可发表评论。

登录

暂无评论,来发表第一条评论吧!