从候选基因到全基因组:GWAS 的起源、术语与分析流程
这是 GWAS 系列的第二篇。上一篇讲了群体遗传学和遗传力的基础——HWE、LD、群体结构那些概念。这篇换个角度:从历史讲起,把核心术语过一遍,然后走一遍完整的分析流程和质量控制。如果你只打算读一篇 GWAS 入门文章,可能是这篇。
GWAS 是怎么来的
前 GWAS 时代的两种方法
在 GWAS 出现之前,定位复杂性状的遗传位点主要靠两样东西:连锁分析和候选基因研究。
连锁分析利用家系中遗传标记与表型的共分离来定位致病基因。原理很直觉——同一条染色体上距离近的位点不容易被重组分开,倾向于一起传给后代。但这个方法需要收集多代家系样本,成本高,对复杂性状(多个微效基因加环境)功效很低,定位精度也粗糙,通常是 Mb 级别的区域。
候选基因研究则是基于已有的生物学认知,选几个”嫌疑基因”,在 case-control 群体中比较等位基因频率。问题在于:它依赖对性状生物学的先验知识,无法发现全新基因;早期研究普遍样本量只有几百例,统计功效低;大量结果无法被独立重复——可重复性危机。
2000 年代初,遗传学界逐渐认识到:复杂性状的遗传结构是高度多基因的,单个基因的效应极小。需要一种无假设驱动的、全基因组覆盖的关联分析方法。GWAS 由此诞生。
三个技术前提
GWAS 能落地,靠的是三个基础设施在同期的成熟:
人类基因组计划(HGP, 1990–2003) 提供了参考序列,让变异检测成为可能。
国际 HapMap 计划(2002–2009) 系统性地绘制了人类常见 SNP(MAF > 5%)及其连锁不平衡结构。HapMap 的关键发现是:人类基因组以 LD block 为结构单元,每个 block 内的 SNP 高度相关,可以用少数 tag SNP 代表整个 block。这意味着只需分型 30 万~50 万个 tag SNP,就能覆盖基因组中大多数常见变异——直接降低了全基因组关联的成本。
高通量 SNP 芯片技术 让大规模人群的基因分型在经济上可行。Illumina 和 Affymetrix 开发了可并行检测数十万至数百万 SNP 的商业芯片。
三个条件缺一不可:没有参考基因组就不知道变异在哪,没有 HapMap 就不知道需要检测哪些位点,没有芯片就付不起全基因组分型的代价。
关键里程碑
| 年份 | 事件 | 意义 |
|---|---|---|
| 2001 | 人类基因组草图发布 | 参考序列就位 |
| 2005 | 首篇 GWAS(Klein et al., Science) | 96 例 AMD 患者 + 50 例对照,发现 CFH 基因强关联 SNP(OR ≈ 4.6),证明 GWAS 范式可行 |
| 2007 | WTCCC(Nature) | 7 种常见疾病、约 17000 样本,确立 case-control GWAS 设计范式和 显著性阈值 |
| 2008 | 千人基因组计划启动 | 为填补提供更完整的参考面板 |
| 2010 | LMM 引入 GWAS(EMMAX) | 解决群体结构和亲缘关系的混杂问题 |
| 2012 | LD Score 回归 | 区分多基因信号和群体分层 |
| 2015 | UK Biobank 释放 | 50 万样本,GWAS 进入 Biobank 时代 |
| 2018+ | 样本量突破百万 | 大量微效位点被发现,PRS 预测能力提升 |
2005 年 Klein 那篇论文值得一提。仅用 96 例患者和 50 例对照,就发现了 CFH 基因上一个效应量远超此前候选基因研究的 SNP。这在今天看来样本量小得不可思议,但它证明了全基因组无假设扫描的可行性——一个范式的确立往往不需要大样本,需要一个巧妙的研究设计。
WTCCC 则把 GWAS 推向了主流。它同期对 7 种疾病做了关联分析,建立了 case-control 设计的标准范式,并确立了 这个至今仍在使用的全基因组显著性阈值。
跨学科扩展
GWAS 起源于人类疾病遗传学,但方法框架已被广泛移植到农业育种(作物产量、抗病性)、畜牧遗传(产奶量、肉质)、水产养殖(生长速率)、进化生物学(检测自然选择的基因组信号)等领域。不同物种面临不同挑战:参考基因组质量参差不齐,LD 衰减模式差异大(鸡和狗的 LD 范围远大于人类,鱼类则更小),群体结构可能更复杂。但核心分析逻辑是相通的。
核心术语速查
在做 GWAS 的过程中,这些术语会反复出现。我按分析环节分组,方便查阅。关于 HWE、LD、群体结构的详细解释,见上一篇。
基础概念
| 术语 | 含义 |
|---|---|
| SNP | 单核苷酸多态性,基因组上单个碱基位点的变异(A→G 之类),GWAS 最常用的分子标记 |
| MAF | 最小等位基因频率,群体中频率较低的那个等位基因的频率。MAF 过低则统计功效不足 |
| 等位基因(Allele) | 一个基因座上可能存在的不同序列形式,二倍体个体每个基因座有两个 |
| 基因型(Genotype) | 某基因座上两个等位基因的组合。加性编码中:0 = 参考纯合,1 = 杂合,2 = 交替纯合 |
| 单倍型(Haplotype) | 同一条染色体上倾向于共同遗传的一组等位基因组合,是 LD 和基因型填补的物理基础 |
| 表型(Phenotype) | 可观测性状。GWAS 中分为连续性状(身高)、二分类性状(患病/健康)、有序分类性状(疾病分级) |
| InDel / CNV | 插入缺失变异 / 拷贝数变异,除 SNP 外 GWAS 也可检测的变异类型 |
统计遗传
| 术语 | 含义 |
|---|---|
| 遗传力() | 表型方差中由加性遗传因素解释的比例,详见上一篇 |
| LMM | 混合线性模型,同时包含固定效应(SNP)和随机效应(多基因背景),用于校正群体结构和亲缘关系 |
| GRM | 亲缘关系矩阵,基于全基因组 SNP 估计的个体间遗传相似度矩阵,在 LMM 中作为随机效应的协方差结构 |
| Bonferroni 校正 | 最保守的多重检验校正,阈值 。GWAS 中 ,,得 |
| FDR | 错误发现率,所有显著结果中假阳性的期望比例。Benjamini-Hochberg 方法比 Bonferroni 更宽松 |
| 曼哈顿图 | 以染色体位置为横轴、 为纵轴的散点图,形似城市天际线 |
| Q-Q 图 | 观察 p 值排序后与均匀分布期望值的对比图,用于诊断系统性偏倚 |
| 基因组膨胀因子, 表示无偏倚, 提示群体分层 |
分析环节
| 术语 | 含义 |
|---|---|
| 基因型填补(Imputation) | 利用参考面板的 LD 结构推断未直接分型的 SNP 基因型,可增加标记密度并整合不同芯片数据 |
| 精细定位(Fine-mapping) | 在显著位点区域区分因果变异和仅因 LD 而显著的标记 |
| 可信集(Credible Set) | 以一定概率(通常 95%)包含因果变异的一组 SNP |
| PIP | 后验包含概率,贝叶斯精细定位中某 SNP 为因果变异的后验概率 |
| PRS | 多基因风险评分,所有风险等位基因效应量的加权求和 |
| 共定位分析 | 检验 GWAS 信号与 eQTL 信号是否共享同一因果变异 |
数据格式
| 格式 | 说明 |
|---|---|
| PED/MAP | PLINK 标准文本格式,PED 存样本信息和基因型,MAP 存 SNP 位置 |
| BED/BIM/FAM | PLINK 二进制格式,BED 为基因型二进制文件,BIM 为 SNP 信息,FAM 为样本信息 |
| VCF | 变异调用格式,基因组变异的通用交换格式 |
| BGEN | 二进制基因型格式,支持 dosage 数据,UK Biobank 使用此格式 |
完整分析流程
一个 GWAS 从零开始到拿到结果,大致经过以下步骤:
下面逐步展开。
第一步:明确生物学问题
一切 GWAS 都始于一个问题:
对什么物种的什么表型进行关联分析?
这决定了后续所有环节:
| 决策维度 | 需要考虑的问题 |
|---|---|
| 物种 | 参考基因组质量如何?有几个版本的组装? |
| 表型 | 连续 / 二分类 / 有序分类?测量标准化程度? |
| 效应量预期 | 基于文献,该性状的遗传力大致多少? |
| 研究目的 | 发现新位点?验证已知位点?构建 PRS? |
第二步:样本策略与统计功效
GWAS 首选无关个体(unrelated individuals)。如果样本中存在隐性亲缘关系,应在关联检验阶段通过 LMM 中的 GRM 显式建模。
在开始实验前应估算所需样本量。统计功效取决于四个因素:样本量 (功效 roughly 与 成正比)、效应量、MAF、显著性阈值。经验法则:对于连续性状,要检测解释 0.1% 表型方差的 SNP(MAF = 0.3),在 下达到 80% 功效约需 30,000 样本。功效计算可用 GAS Power Calculator 或 QUANTO。
对于 case-control 设计,对照应来自与病例相同的源人群。极端不平衡(如 1:100)会严重损害检验功效,可使用 SAIGE 等方法处理。
第三步:基因分型策略
| 策略 | 成本 | 标记数 | 填补需求 | 适用场景 |
|---|---|---|---|---|
| SNP 芯片 | 低 | 50 万~250 万 | 必需 | 大规模人群 |
| 全基因组测序 WGS | 高 | 全基因组 | 不需要 | 小规模精细研究、稀有变异 |
| 低深度 WGS + 填补 | 中 | 0.5x~4x | 必需 | 折中方案,日益流行 |
人类 GWAS 常用 Illumina GSA(约 70 万 SNP,多民族优化)或 Infinium Omni 系列(约 250 万 SNP)。非模式生物通常选通用高密度芯片或定制芯片。
第四步:质量控制(QC)
QC 是整个 GWAS 分析中最关键的步骤。设计不当或 QC 不足将直接导致下游结果不可靠。
样本层面 QC
1. 样本检出率(Sample Call Rate)
每份样本成功分型的 SNP 比例,要求 > 95%。低检出率意味着 DNA 质量差或实验失败。
plink --bfile data --missing --out sample_missingplink --bfile data --mind 0.05 # 移除缺失率 > 5% 的样本2. 性别检查
基于 X 染色体平均杂合率验证记录性别。女性(XX)X 染色体杂合率接近常染色体水平(~0.3),男性(XY)趋近于 0。不匹配的样本应检查或剔除。
plink --bfile data --check-sex --out sex_check3. 杂合率离群值
全基因组平均杂合率偏离均值 ±3 个标准差的样本,可能提示 DNA 污染或近交。
plink --bfile data --het --out het_check4. 亲缘关系检查
基于全基因组数据计算两两个体间的 IBD 共享比例 。当 (相当于二级亲属以上)时,随机移除其中一人,或用 LMM 建模。
king -b data.bed --related --degree 25. 群体分层 PCA 初筛
运行 PCA 可视化样本的遗传背景。明显偏离主要群体的样本可能是不同祖先来源或错误标记。
plink --bfile data --pca 10 --out pca_resultSNP 层面 QC
1. SNP 检出率
每个 SNP 被成功分型的样本比例,要求 > 95%。
plink --bfile data --geno 0.052. 最小等位基因频率(MAF)
过滤低频 SNP。常用阈值 MAF > 1%(大样本)或 MAF > 5%(小样本)。低频 SNP 统计功效极低,且更容易受分型误差影响。
3. 哈代-温伯格平衡检验(HWE)
在对照组中检验每个 SNP 是否符合 HWE。严重偏离通常提示分型错误。常用阈值:对照组 ,合并样本 。
plink --bfile data --hwe 1e-6 --out hwe_check只在对照样本中测试 HWE。病例组可能因为真实的疾病关联而偏离 HWE,不应作为剔除依据。
4. 差异缺失率检验
检验 case 和 control 之间某 SNP 的系统性缺失率差异。显著差异提示分型技术问题。
第五步:群体分层处理
QC 完成后,对清洁数据进行 LD 修剪后的 PCA,取前 5~20 个主成分用于可视化和后续校正。
plink --bfile clean_data --indep-pairwise 50 5 0.2 --out ld_prunedplink --bfile clean_data --extract ld_pruned.prune.in --pca 20 --out pca_final校正策略有三种选择:
| 策略 | 说明 |
|---|---|
| PCA 协变量 | 在 GLM 中纳入前几个 PC 作为协变量,简单快速 |
| 基因组控制 | 用 缩放所有检验统计量,简单但不够精确 |
| LMM | 通过 GRM 显式建模群体结构和亲缘关系,最灵活 |
当前最推荐的是 LMM + PC 协变量的组合。
第六步:关联检验
经过 QC 和群体结构校正后,进入正式的关联检验。根据数据规模和性状类型选择工具:
| 工具 | 模型 | 特点 |
|---|---|---|
| PLINK | GLM | 基线工具,速度快,不处理亲缘关系 |
| EMMAX | LMM 近似 | 高效近似,适合中等规模 |
| GEMMA | 精确 LMM | 精确实现,中小规模首选 |
| BOLT-LMM | 变分近似 | 适合 Biobank 规模(数十万~百万) |
| SAIGE | 鞍点近似 | 处理极端 case-control 不平衡 |
| fastGWA | 谱分解 | GCTA 生态,大规模高效 |
第七步:可视化与下游分析
关联检验的结果通过曼哈顿图和 Q-Q 图进行初步评估。达到全基因组显著性阈值()的位点进入精细定位和功能注释。
精细定位通过贝叶斯方法(FINEMAP、SuSiE)计算每个 SNP 的后验包含概率(PIP),构建 95% 可信集,缩小因果变异范围。共定位分析(coloc)则检验 GWAS 信号与 eQTL 信号是否共享因果变异,为功能解读提供线索。
QC 标准速查表
最后把 QC 的阈值整理成一张表,方便做分析时对照:
| QC 步骤 | 对象 | 阈值 | 工具 |
|---|---|---|---|
| 样本检出率 | 样本 | > 95%(缺失率 < 0.05) | PLINK --mind |
| 性别检查 | 样本 | X 染色体杂合率与记录性别一致 | PLINK --check-sex |
| 杂合率离群 | 样本 | ±3 SD | PLINK --het |
| 亲缘关系 | 样本对 | IBD > 0.1875 时移除一人 | KING |
| 群体离群 | 样本 | PCA 可视化判断 | EIGENSOFT / PLINK |
| SNP 检出率 | SNP | > 95%(缺失率 < 0.05) | PLINK --geno |
| MAF | SNP | > 1% 或 5% | PLINK --maf |
| HWE | SNP(对照组) | PLINK --hwe | |
| 差异缺失率 | SNP | case vs control 无显著差异 | PLINK --test-missing |
从候选基因到全基因组扫描,从几十例样本到百万级 Biobank,GWAS 在不到 20 年间从概念验证发展成为发现复杂性状遗传基础的标准工具。核心逻辑其实不复杂:明确问题、严格质控、选对模型、看准信号。下一篇会深入讲统计建模——从 GLM 到 LMM 的推导过程。