跳至正文
3720 字
19 分钟

从候选基因到全基因组:GWAS 的起源、术语与分析流程

这是 GWAS 系列的第二篇。上一篇讲了群体遗传学和遗传力的基础——HWE、LD、群体结构那些概念。这篇换个角度:从历史讲起,把核心术语过一遍,然后走一遍完整的分析流程和质量控制。如果你只打算读一篇 GWAS 入门文章,可能是这篇。


GWAS 是怎么来的#

前 GWAS 时代的两种方法#

在 GWAS 出现之前,定位复杂性状的遗传位点主要靠两样东西:连锁分析候选基因研究

连锁分析利用家系中遗传标记与表型的共分离来定位致病基因。原理很直觉——同一条染色体上距离近的位点不容易被重组分开,倾向于一起传给后代。但这个方法需要收集多代家系样本,成本高,对复杂性状(多个微效基因加环境)功效很低,定位精度也粗糙,通常是 Mb 级别的区域。

候选基因研究则是基于已有的生物学认知,选几个”嫌疑基因”,在 case-control 群体中比较等位基因频率。问题在于:它依赖对性状生物学的先验知识,无法发现全新基因;早期研究普遍样本量只有几百例,统计功效低;大量结果无法被独立重复——可重复性危机。

2000 年代初,遗传学界逐渐认识到:复杂性状的遗传结构是高度多基因的,单个基因的效应极小。需要一种无假设驱动的、全基因组覆盖的关联分析方法。GWAS 由此诞生。

三个技术前提#

GWAS 能落地,靠的是三个基础设施在同期的成熟:

人类基因组计划(HGP, 1990–2003) 提供了参考序列,让变异检测成为可能。

国际 HapMap 计划(2002–2009) 系统性地绘制了人类常见 SNP(MAF > 5%)及其连锁不平衡结构。HapMap 的关键发现是:人类基因组以 LD block 为结构单元,每个 block 内的 SNP 高度相关,可以用少数 tag SNP 代表整个 block。这意味着只需分型 30 万~50 万个 tag SNP,就能覆盖基因组中大多数常见变异——直接降低了全基因组关联的成本。

高通量 SNP 芯片技术 让大规模人群的基因分型在经济上可行。Illumina 和 Affymetrix 开发了可并行检测数十万至数百万 SNP 的商业芯片。

三个条件缺一不可:没有参考基因组就不知道变异在哪,没有 HapMap 就不知道需要检测哪些位点,没有芯片就付不起全基因组分型的代价。

关键里程碑#

年份事件意义
2001人类基因组草图发布参考序列就位
2005首篇 GWAS(Klein et al., Science96 例 AMD 患者 + 50 例对照,发现 CFH 基因强关联 SNP(OR ≈ 4.6),证明 GWAS 范式可行
2007WTCCC(Nature7 种常见疾病、约 17000 样本,确立 case-control GWAS 设计范式和 p<5×108p < 5 \times 10^{-8} 显著性阈值
2008千人基因组计划启动为填补提供更完整的参考面板
2010LMM 引入 GWAS(EMMAX)解决群体结构和亲缘关系的混杂问题
2012LD Score 回归区分多基因信号和群体分层
2015UK Biobank 释放50 万样本,GWAS 进入 Biobank 时代
2018+样本量突破百万大量微效位点被发现,PRS 预测能力提升

2005 年 Klein 那篇论文值得一提。仅用 96 例患者和 50 例对照,就发现了 CFH 基因上一个效应量远超此前候选基因研究的 SNP。这在今天看来样本量小得不可思议,但它证明了全基因组无假设扫描的可行性——一个范式的确立往往不需要大样本,需要一个巧妙的研究设计。

WTCCC 则把 GWAS 推向了主流。它同期对 7 种疾病做了关联分析,建立了 case-control 设计的标准范式,并确立了 p<5×108p < 5 \times 10^{-8} 这个至今仍在使用的全基因组显著性阈值。

跨学科扩展#

GWAS 起源于人类疾病遗传学,但方法框架已被广泛移植到农业育种(作物产量、抗病性)、畜牧遗传(产奶量、肉质)、水产养殖(生长速率)、进化生物学(检测自然选择的基因组信号)等领域。不同物种面临不同挑战:参考基因组质量参差不齐,LD 衰减模式差异大(鸡和狗的 LD 范围远大于人类,鱼类则更小),群体结构可能更复杂。但核心分析逻辑是相通的。


核心术语速查#

在做 GWAS 的过程中,这些术语会反复出现。我按分析环节分组,方便查阅。关于 HWE、LD、群体结构的详细解释,见上一篇

基础概念#

术语含义
SNP单核苷酸多态性,基因组上单个碱基位点的变异(A→G 之类),GWAS 最常用的分子标记
MAF最小等位基因频率,群体中频率较低的那个等位基因的频率。MAF 过低则统计功效不足
等位基因(Allele)一个基因座上可能存在的不同序列形式,二倍体个体每个基因座有两个
基因型(Genotype)某基因座上两个等位基因的组合。加性编码中:0 = 参考纯合,1 = 杂合,2 = 交替纯合
单倍型(Haplotype)同一条染色体上倾向于共同遗传的一组等位基因组合,是 LD 和基因型填补的物理基础
表型(Phenotype)可观测性状。GWAS 中分为连续性状(身高)、二分类性状(患病/健康)、有序分类性状(疾病分级)
InDel / CNV插入缺失变异 / 拷贝数变异,除 SNP 外 GWAS 也可检测的变异类型

统计遗传#

术语含义
遗传力(h2h^2表型方差中由加性遗传因素解释的比例,详见上一篇
LMM混合线性模型,同时包含固定效应(SNP)和随机效应(多基因背景),用于校正群体结构和亲缘关系
GRM亲缘关系矩阵,基于全基因组 SNP 估计的个体间遗传相似度矩阵,在 LMM 中作为随机效应的协方差结构
Bonferroni 校正最保守的多重检验校正,阈值 α/m\alpha / m。GWAS 中 α=0.05\alpha = 0.05m106m \approx 10^6,得 5×1085 \times 10^{-8}
FDR错误发现率,所有显著结果中假阳性的期望比例。Benjamini-Hochberg 方法比 Bonferroni 更宽松
曼哈顿图以染色体位置为横轴、log10(p)-\log_{10}(p) 为纵轴的散点图,形似城市天际线
Q-Q 图观察 p 值排序后与均匀分布期望值的对比图,用于诊断系统性偏倚
λGC\lambda_{GC}基因组膨胀因子,1.0\approx 1.0 表示无偏倚,>1.05> 1.05 提示群体分层

分析环节#

术语含义
基因型填补(Imputation)利用参考面板的 LD 结构推断未直接分型的 SNP 基因型,可增加标记密度并整合不同芯片数据
精细定位(Fine-mapping)在显著位点区域区分因果变异和仅因 LD 而显著的标记
可信集(Credible Set)以一定概率(通常 95%)包含因果变异的一组 SNP
PIP后验包含概率,贝叶斯精细定位中某 SNP 为因果变异的后验概率
PRS多基因风险评分,所有风险等位基因效应量的加权求和
共定位分析检验 GWAS 信号与 eQTL 信号是否共享同一因果变异

数据格式#

格式说明
PED/MAPPLINK 标准文本格式,PED 存样本信息和基因型,MAP 存 SNP 位置
BED/BIM/FAMPLINK 二进制格式,BED 为基因型二进制文件,BIM 为 SNP 信息,FAM 为样本信息
VCF变异调用格式,基因组变异的通用交换格式
BGEN二进制基因型格式,支持 dosage 数据,UK Biobank 使用此格式

完整分析流程#

一个 GWAS 从零开始到拿到结果,大致经过以下步骤:

下面逐步展开。

第一步:明确生物学问题#

一切 GWAS 都始于一个问题:

什么物种什么表型进行关联分析?

这决定了后续所有环节:

决策维度需要考虑的问题
物种参考基因组质量如何?有几个版本的组装?
表型连续 / 二分类 / 有序分类?测量标准化程度?
效应量预期基于文献,该性状的遗传力大致多少?
研究目的发现新位点?验证已知位点?构建 PRS?

第二步:样本策略与统计功效#

GWAS 首选无关个体(unrelated individuals)。如果样本中存在隐性亲缘关系,应在关联检验阶段通过 LMM 中的 GRM 显式建模。

在开始实验前应估算所需样本量。统计功效取决于四个因素:样本量 NN(功效 roughly 与 N\sqrt{N} 成正比)、效应量、MAF、显著性阈值。经验法则:对于连续性状,要检测解释 0.1% 表型方差的 SNP(MAF = 0.3),在 α=5×108\alpha = 5 \times 10^{-8} 下达到 80% 功效约需 30,000 样本。功效计算可用 GAS Power Calculator 或 QUANTO。

对于 case-control 设计,对照应来自与病例相同的源人群。极端不平衡(如 1:100)会严重损害检验功效,可使用 SAIGE 等方法处理。

第三步:基因分型策略#

策略成本标记数填补需求适用场景
SNP 芯片50 万~250 万必需大规模人群
全基因组测序 WGS全基因组不需要小规模精细研究、稀有变异
低深度 WGS + 填补0.5x~4x必需折中方案,日益流行

人类 GWAS 常用 Illumina GSA(约 70 万 SNP,多民族优化)或 Infinium Omni 系列(约 250 万 SNP)。非模式生物通常选通用高密度芯片或定制芯片。

第四步:质量控制(QC)#

QC 是整个 GWAS 分析中最关键的步骤。设计不当或 QC 不足将直接导致下游结果不可靠。

样本层面 QC#

1. 样本检出率(Sample Call Rate)

每份样本成功分型的 SNP 比例,要求 > 95%。低检出率意味着 DNA 质量差或实验失败。

Terminal window
plink --bfile data --missing --out sample_missing
plink --bfile data --mind 0.05 # 移除缺失率 > 5% 的样本

2. 性别检查

基于 X 染色体平均杂合率验证记录性别。女性(XX)X 染色体杂合率接近常染色体水平(~0.3),男性(XY)趋近于 0。不匹配的样本应检查或剔除。

Terminal window
plink --bfile data --check-sex --out sex_check

3. 杂合率离群值

全基因组平均杂合率偏离均值 ±3 个标准差的样本,可能提示 DNA 污染或近交。

Terminal window
plink --bfile data --het --out het_check

4. 亲缘关系检查

基于全基因组数据计算两两个体间的 IBD 共享比例 π^\hat{\pi}。当 π^>0.1875\hat{\pi} > 0.1875(相当于二级亲属以上)时,随机移除其中一人,或用 LMM 建模。

Terminal window
king -b data.bed --related --degree 2

5. 群体分层 PCA 初筛

运行 PCA 可视化样本的遗传背景。明显偏离主要群体的样本可能是不同祖先来源或错误标记。

Terminal window
plink --bfile data --pca 10 --out pca_result

SNP 层面 QC#

1. SNP 检出率

每个 SNP 被成功分型的样本比例,要求 > 95%。

Terminal window
plink --bfile data --geno 0.05

2. 最小等位基因频率(MAF)

过滤低频 SNP。常用阈值 MAF > 1%(大样本)或 MAF > 5%(小样本)。低频 SNP 统计功效极低,且更容易受分型误差影响。

3. 哈代-温伯格平衡检验(HWE)

对照组中检验每个 SNP 是否符合 HWE。严重偏离通常提示分型错误。常用阈值:对照组 p>106p > 10^{-6},合并样本 p>1010p > 10^{-10}

Terminal window
plink --bfile data --hwe 1e-6 --out hwe_check

只在对照样本中测试 HWE。病例组可能因为真实的疾病关联而偏离 HWE,不应作为剔除依据。

4. 差异缺失率检验

检验 case 和 control 之间某 SNP 的系统性缺失率差异。显著差异提示分型技术问题。

第五步:群体分层处理#

QC 完成后,对清洁数据进行 LD 修剪后的 PCA,取前 5~20 个主成分用于可视化和后续校正。

Terminal window
plink --bfile clean_data --indep-pairwise 50 5 0.2 --out ld_pruned
plink --bfile clean_data --extract ld_pruned.prune.in --pca 20 --out pca_final

校正策略有三种选择:

策略说明
PCA 协变量在 GLM 中纳入前几个 PC 作为协变量,简单快速
基因组控制λGC\lambda_{GC} 缩放所有检验统计量,简单但不够精确
LMM通过 GRM 显式建模群体结构和亲缘关系,最灵活

当前最推荐的是 LMM + PC 协变量的组合。

第六步:关联检验#

经过 QC 和群体结构校正后,进入正式的关联检验。根据数据规模和性状类型选择工具:

工具模型特点
PLINKGLM基线工具,速度快,不处理亲缘关系
EMMAXLMM 近似高效近似,适合中等规模
GEMMA精确 LMM精确实现,中小规模首选
BOLT-LMM变分近似适合 Biobank 规模(数十万~百万)
SAIGE鞍点近似处理极端 case-control 不平衡
fastGWA谱分解GCTA 生态,大规模高效

第七步:可视化与下游分析#

关联检验的结果通过曼哈顿图和 Q-Q 图进行初步评估。达到全基因组显著性阈值(p<5×108p < 5 \times 10^{-8})的位点进入精细定位和功能注释。

精细定位通过贝叶斯方法(FINEMAP、SuSiE)计算每个 SNP 的后验包含概率(PIP),构建 95% 可信集,缩小因果变异范围。共定位分析(coloc)则检验 GWAS 信号与 eQTL 信号是否共享因果变异,为功能解读提供线索。


QC 标准速查表#

最后把 QC 的阈值整理成一张表,方便做分析时对照:

QC 步骤对象阈值工具
样本检出率样本> 95%(缺失率 < 0.05)PLINK --mind
性别检查样本X 染色体杂合率与记录性别一致PLINK --check-sex
杂合率离群样本±3 SDPLINK --het
亲缘关系样本对IBD > 0.1875 时移除一人KING
群体离群样本PCA 可视化判断EIGENSOFT / PLINK
SNP 检出率SNP> 95%(缺失率 < 0.05)PLINK --geno
MAFSNP> 1% 或 5%PLINK --maf
HWESNP(对照组)p>106p > 10^{-6}PLINK --hwe
差异缺失率SNPcase vs control 无显著差异PLINK --test-missing

从候选基因到全基因组扫描,从几十例样本到百万级 Biobank,GWAS 在不到 20 年间从概念验证发展成为发现复杂性状遗传基础的标准工具。核心逻辑其实不复杂:明确问题、严格质控、选对模型、看准信号。下一篇会深入讲统计建模——从 GLM 到 LMM 的推导过程。