1 基本概念

1.1 定义

单核苷酸多态性是指在群体中某一基因组位置上,单个核苷酸存在可观察到的常见差异。这里的“多态性”强调变异并非个体特有,而是在一定群体规模内反复出现,具有相对稳定的群体频率。SNP可以出现在基因组的不同区域,包括编码区、内含子、启动子以及其他调控序列,也可分布于远离基因的非编码区域。

1.2 命名与术语

SNP是英文 Single Nucleotide Polymorphism 的缩写,中文通常译为“单核苷酸多态性”。在具体研究中,还常见“位点”“等位基因”“变异”“突变”等相关术语。严格来说,SNP强调群体中的常见变异,而“突变”更侧重于新发生的序列改变;“变异”则是更宽泛的统称,可涵盖多种遗传差异。

1.3 与其他遗传变异的区别

SNP属于最小尺度的序列差异之一,但并不等同于所有基因组变异。它与插入缺失、拷贝数变化等在形成机制、检测方式和功能后果上均有区别。

1.3.1 单核苷酸变异

单核苷酸变异是对某一位点发生单个碱基改变的总称,既可指个体新出现的稀有改变,也可指群体中常见的多态位点。SNP通常被视为单核苷酸变异中的一个子集前提是其在群体中达到一定频率标准。

1.3.2 插入缺失变异

插入缺失变异是指基因组中发生若干碱基的增加或缺失,常简称为 InDel。与SNP相比,InDel更容易引起阅读框改变或局部序列长度变化,从而影响蛋白质编码和调控功能。

1.3.3 拷贝数变异

拷贝数变异是指大片段DNA在基因组中的重复或缺失,影响范围通常大于单个碱基。它与SNP的差异不仅在尺度上更明显,也常带来更复杂的结构效应和剂量效应。

1.4 发生频率与群体标准

在实际研究中,SNP通常指群体中频率较高、可稳定检测的位点。不同研究和数据库对“常见变异”的频率门槛可能略有差异,但一般要求某一等位基因在群体中的出现频率不低于一定比例。低于该范围的位点常被归入罕见变异或特异性变异,不一定都称为SNP。

2 形成与遗传基础

2.1 突变来源

SNP本质上源于DNA序列改变,其产生过程可来自复制、修复以及外界因素等多种机制。

2.1.1 DNA复制错误

在DNA复制过程中,DNA聚合酶偶尔会掺入错误碱基。如果这些错误未被及时纠正并被后续复制固定,就可能形成稳定的碱基替换,进而成为SNP来源之一。

2.1.2 DNA修复偏差

细胞具有多种DNA修复机制,用于识别并纠正损伤。然而在修复过程中,若模板选择或修复过程出现偏差,也可能引入新的碱基替换,形成可遗传的序列差异。

2.1.3 外界致突变因素

紫外线化学物质、氧化应激以及某些物理因素都可能损伤DNA,导致碱基结构改变或复制错误增加。若损伤在修复后被固定,就可能以SNP的形式保留下来。

2.2 遗传传递方式

SNP通常遵循孟德尔式遗传规律,在生殖细胞形成后可通过亲代传递给子代。位于常染色体上的SNP一般按常染色体显性、隐性或加性等方式表现;位于性染色体上的SNP则可能呈现与性别相关的遗传特点。

2.3 群体中的保留与消失

某一SNP是否在群体中长期保留,取决于其对生存、繁殖和随机抽样过程的综合影响。部分位点可因中性漂变而保留,也可能因适应性优势或劣势而发生频率变化。

2.3.1 自然选择

若某一SNP对个体适应度有正面或负面影响,携带该变异的个体在繁殖中可能具有不同优势,导致该位点频率上升或下降。自然选择因此是塑造SNP分布的重要力量。

2.3.2 遗传漂变

在小群体中,等位基因频率可能因随机抽样而发生波动,即使某些变异并不影响适应度,也可能在代际中逐渐丢失或固定。遗传漂变在群体规模较小时尤为明显。

2.3.3 突变-选择平衡

新的SNP不断由突变产生,而有害变异又会受到选择清除。两者之间的动态平衡可使某些位点在群体中维持较低但稳定的频率。

3 分类

3.1 按基因组位置分类

根据SNP所在的基因组区域,可大致分为编码区和非编码区两类。

3.1.1 编码区SNP

位于外显子中的SNP可能改变蛋白质编码信息,因此更常受到功能研究关注。

3.1.1.1 同义突变

同义突变是指碱基改变后,密码子所编码的氨基酸不发生变化。尽管它们不直接改变蛋白序列,但仍可能影响翻译效率、mRNA稳定性或剪接过程。

3.1.1.2 非同义突变

非同义突变会导致氨基酸替换,可能改变蛋白质的结构、活性或稳定性。其生物学影响取决于替换位置、氨基酸性质以及所在结构域的重要性

3.1.1.3 无义突变

无义突变会使原本编码氨基酸的密码子变为终止密码子,从而使翻译提前终止。此类变异常导致截短蛋白或触发无义介导的mRNA降解。

3.1.2 非编码区SNP

非编码区SNP不直接改变蛋白质序列,但可能通过调节转录、剪接和染色质状态影响基因功能。

3.1.2.1 内含子变异

内含子中的SNP可能影响剪接位点附近的识别、转录延伸或调控元件结合,从而间接改变基因表达。

3.1.2.2 启动子变异

启动子区域的SNP可改变转录因子结合能力,进而影响转录起始效率和表达水平。

3.1.2.3 增强子与其他调控区变异

增强子、沉默子及其他远端调控区中的SNP可能通过改变调控蛋白结合、染色质构象或远程互作,影响特定组织或时空条件下的基因表达。

3.2 按功能效应分类

按功能后果,SNP可分为中性、有害和有益三类。该分类具有相对性,常依赖具体环境和遗传背景

3.2.1 中性变异

中性变异通常不对生物体适应度产生显著影响,或其效应极弱,难以被选择明显区分。许多SNP在群体中主要表现为中性标记。

3.2.2 有害变异

有害变异可能降低蛋白功能、扰乱调控过程,或增加不良表型出现的概率。此类变异往往受到负向选择约束。

3.2.3 有益变异

有益变异能在特定环境下提高适应度,例如改善代谢效率或增强某些生理功能。不过其优势通常具有情境依赖性,并非在所有背景下都成立。

3.3 按等位基因状态分类

根据一个位点上存在的等位基因数量,SNP可进一步划分。

3.3.1 双等位SNP

大多数SNP为双等位位点,即群体中只观察到两种主要碱基形式。这是最常见、也是最便于分析的类型。

3.3.2 多等位位点

少数位点可在群体中出现三种或以上等位形式。多等位位点通常更复杂,统计分析和分型解释也更具挑战。

4 生物学影响

4.1 对蛋白质结构与功能的影响

位于编码区的SNP,尤其是非同义和无义突变,可能改变蛋白质一级结构,进而影响折叠、活性位点、稳定性或相互作用能力。某些改变十分微小,而某些则会造成明显功能缺失。

4.2 对基因表达的影响

SNP可通过影响启动子、增强子、转录因子结合位点或染色质可及性,改变基因的表达强度与时序。即使不改变蛋白序列,也可能导致较大的生理差异。

4.3 对剪接调控的影响

若SNP位于剪接信号附近,或改变剪接调控元件,就可能影响外显子选择、内含子保留或可变剪接模式。由此产生的不同转录本,常进一步影响蛋白质种类和功能。

4.4 对表型性状的影响

SNP可以影响身高、体型、代谢特征、色素沉着、生理节律等多种性状。多数表型通常由多个位点共同作用,并受环境因素调节,因此单个SNP往往只能贡献有限效应。

4.5 对疾病易感性的影响

某些SNP与特定疾病风险相关,但这种关联通常不是决定性的,而是增加或降低发病概率。其作用大小常受到遗传背景、环境暴露和生活方式等因素影响。

5 检测与分析方法

5.1 实验检测技术

SNP检测方法众多,选择依据通常包括样本规模、准确度要求、位点数量和成本。

5.1.1 PCR与分型技术

PCR可扩增目标区域,再结合特异性探针、限制性酶切、熔解曲线或等位基因特异扩增完成分型。此类方法适合少量位点的快速验证。

5.1.2 芯片杂交技术

基因分型芯片可同时检测大量已知SNP位点,具有通量高、成本相对可控的特点,常用于大样本研究和关联分析

5.1.3 测序技术

测序能够直接读取DNA序列信息,对已知和部分未知变异都较为敏感,是当前SNP发现与验证的重要手段。

5.1.3.1 Sanger测序

Sanger测序准确度较高,适合小范围位点确认和验证实验。它在早期SNP研究中占有重要地位,至今仍广泛用于结果复核

5.1.3.2 二代测序

二代测序可在较短时间内获取大量序列数据,适合全基因组或外显子组尺度的SNP发现。其优势在于通量大,但数据处理和质控要求也更高。

5.1.3.3 三代测序

三代测序可获得更长读长,在复杂区域、结构变异邻域以及单倍型解析方面具有优势。虽然在某些应用中错误模式和成本仍需关注,但其对SNP研究的补充价值持续上升。

5.2 生物信息学分析

5.2.1 变异识别

变异识别是从测序数据中找出与参考基因组不同的碱基位点,并判断其可靠性的过程。该步骤依赖比对、去重复、局部重比对和变异调用等环节。

5.2.2 质量控制

质量控制用于排除低覆盖、测序错误、样本污染或分型偏差带来的假阳性结果。常见指标包括测序深度、基因型质量、缺失率和群体一致性检验。

5.2.3 注释与功能预测

注释过程将SNP映射到基因、转录本、调控区和已知功能信息上,并结合保守性、蛋白结构或调控特征预测其潜在效应。该环节有助于从大量位点中筛选出优先研究对象。

5.3 数据库与资源

5.3.1 公共SNP数据库

公共数据库汇集了大量已知SNP及其位置信息、等位基因类型和参考编号,为检索与比对提供基础。它们是遗传研究和临床注释的重要工具。

5.3.2 群体频率数据库

群体频率数据库记录不同人群或物种中各SNP的出现比例,可用于判断变异的常见程度、群体差异和研究样本背景。

5.3.3 功能注释数据库

功能注释数据库整合基因功能、保守性、表达模式和调控信息,帮助研究者评估SNP可能产生的生物学后果。

6 研究与应用

6.1 群体遗传学研究

SNP是群体遗传学中最常用的标记之一,可用于估计遗传多样性、群体结构、基因流动以及历史迁移模式。由于位点数量丰富,它适合进行高分辨率分析。

6.2 连锁分析与关联分析

在家系研究和病例对照研究中,SNP可用于定位与性状相关的基因区域。连锁分析侧重于家系中的共遗传模式,关联分析则关注群体中位点与表型之间的统计联系。

6.3 法医学与个体识别

SNP可用于个体识别、亲缘关系推断以及部分法医学分析。与传统短串联重复相比,SNP位点通常更稳定,且适合与其他分型信息联合使用。

6.4 农业育种与品种改良

在农业领域,SNP可作为选育标记,用于筛选产量、抗逆性、品质和发育性状相关的优良基因型。它在作物和家畜的分子育种中应用广泛。

6.5 个体化医疗与药物基因组学

SNP可影响药物代谢酶、转运蛋白和受体的功能,从而改变药物疗效与不良反应风险。基于SNP的分型有助于优化剂量选择和治疗方案。

6.6 进化生物学研究

SNP为研究物种分化、适应性演化和选择信号提供了丰富材料。通过比较不同群体或物种中的位点差异,可推断进化过程中的遗传变化轨迹。

7 相关概念与扩展

7.1 单倍型与连锁不平衡

单倍型是同一染色体片段上多个位点的组合模式,连锁不平衡则描述不同位点等位基因之间的非随机联合分布。SNP常被联合分析,以提高定位效率和解释能力。

7.2 标记位点与遗传图谱

SNP可作为标记位点用于构建遗传图谱,辅助定位基因或性状相关区域。高密度SNP图谱在现代遗传学中具有重要地位。

7.3 基因组宽关联研究

基因组宽关联研究是一种利用全基因组SNP进行大规模统计筛查的方法,旨在寻找与复杂性状相关的位点。它已成为解析多基因性状的重要策略之一。

7.4 多态性与遗传多样性

多态性反映群体内部存在多个遗传状态,而遗传多样性则是这一现象在更宏观层面的表现。SNP数量和分布常被用来衡量群体的遗传丰富程度。

7.5 未来研究方向

未来SNP研究将继续向更高分辨率、更大样本规模和更精细功能解析发展。单细胞水平分型、长读长测序、多组学整合以及人工智能辅助注释,可能进一步提升对SNP功能与演化意义的理解。