1 基本概念与历史

1.1 DNA结构与化学组成

脱氧核糖核酸(DNA)是一种由核苷酸重复单元组成的线性高分子聚合物。每个核苷酸由三部分构成:一个含氮碱基(腺嘌呤A、鸟嘌呤G、胞嘧啶C或胸腺嘧啶T)、一个脱氧核糖分子以及一个磷酸基团。核苷酸之间通过3',5'-磷酸二酯键连接形成长链,两条反向平行的脱氧核糖-磷酸主链通过碱基间的氢键配对(A-T、G-C)螺旋缠绕,形成经典的双螺旋结构。DNA的化学稳定性极高但并非不可破坏,高温、酸、碱及酶(如DNase)均可导致其变性或降解。

1.2 关键发现与里程碑

1.2.1 双螺旋结构模型的提出

1953年,詹姆斯·沃森和弗朗西斯·克里克基于罗莎琳德·富兰克林的X射线衍射图像,提出了DNA双螺旋结构模型。这一模型不仅解释了DNA的自我复制机制,也为遗传信息的存储与传递奠定了基础。该发现被公认为分子生物学革命的起点,沃森克里克与莫里斯·威尔金斯共同获得1962年诺贝尔生理学医学奖。

1.2.2 限制性内切酶的发现

20世纪70年代初,汉密尔顿·史密斯和丹尼尔·内森斯等科学家从细菌中分离出限制性内切酶,能够在特定序列位点切割DNA。这一发现使DNA分子可以进行精确的酶切与重组,极大地推动了基因克隆与分子杂交技术的发展。

1.2.3 PCR技术的诞生

1983年,凯利·穆利斯发明了聚合酶链式反应(PCR),通过热循环驱动的DNA聚合酶复制机制,可在数小时内将特定DNA片段扩增数百万倍。PCR技术使微量DNA样本的分析成为可能,穆利斯因此获得1993年诺贝尔化学奖。它几乎改写了所有DNA分析领域的工作方式。

1.2.4 人类基因组计划的启示

1990年启动、2003年完成的人类基因组计划(HGP)首次解码了人类全部约30亿碱基对的参考序列。这一计划催生了高通量测序技术、大规模数据存储与计算能力的发展,并确立了“开放获取”的科学数据共享模式,为后续的精准医学与群体遗传学研究提供了基础框架。

1.3 主要分析方法分类

1.3.1 物理化学分析

包括紫外分光光度法(检测纯度和浓度)、琼脂糖凝胶电泳(按大小分离片段)、熔解曲线分析(评估DNA双链稳定性)以及高效液相色谱(HPLC)等。这些方法主要利用DNA的物理或化学性质进行测定,操作简便、成本较低,适用于初步评估。

1.3.2 分子杂交分析

基于互补碱基配对原理,用已知序列的探针(放射性或荧光标记)与靶DNA结合,通过检测杂交信号实现定性或定量分析代表性技术包括Southern印迹、Northern印迹、荧光原位杂交(FISH)及微阵列芯片。分子杂交分析常用于基因定位、表达检测及病毒DNA鉴定。

1.3.3 测序分析

直接读取DNA分子中碱基的顺序。从经典的Sanger法第一代测序,到大规模并行化的第二代测序(Illumina、Ion Torrent),再到单分子级别的第三代测序(PacBio、Oxford Nanopore),测序技术不断突破,使全基因组、全转录组分析成为常规操作。

2 核心实验技术

2.1 样本采集与核酸提取

2.1.1 不同生物材料的处理

2.1.1.1 血液、组织与毛发

血液样本常用EDTA或枸橼酸抗凝管采集,分离白细胞层后提取DNA;组织样本需先剪碎并用蛋白酶K消化去除蛋白质;毛发需取毛囊根部(含有核细胞)进行裂解。不同样本的细胞壁(如植物、细菌)及抑制物(如血红素、黑色素)需采用不同的裂解液与纯化策略。

2.1.1.2 化石与古DNA

古DNA样本(如骨骼、牙齿、沉积物)通常高度降解、含量极低且易受现代DNA污染。提取需在超洁净环境中进行,使用特殊缓冲液(如EDTA脱钙、蛋白酶处理)并引入阻断剂以控制污染。提取后通常进行文库构建与鸟枪测序,依赖生物信息学手段过滤外源序列。

2.1.2 纯化与质量控制

纯化方法包括酚-氯仿抽提、硅胶膜柱纯化、磁珠法及沉淀法等。纯化后需通过紫外分光光度计(测A260/280比值)评估纯度,用荧光染料法(如Qubit)精确定量,并进行琼脂糖凝胶电泳检查完整性。合格的DNA样本应无蛋白质、RNA及杂质污染,片段长度满足后续实验要求。

2.2 聚合酶链式反应(PCR)

2.2.1 常规PCR与引物设计

常规PCR由三个温度步骤循环组成:变性(94~98℃)、退火(50~65℃)和延伸(72℃)。引物设计的关键参数包括长度(18~25bp)、GC含量(40%~60%)、Tm值相近(58~60℃)以及避免自身互补与发夹结构。引物与模板的匹配性直接影响扩增效率与特异性,常用BLAST或Primer-BLAST进行验证。

2.2.2 实时定量PCR(qPCR)

qPCR通过在反应中加入荧光染料(如SYBR Green)或荧光探针(如TaqMan),实时监测扩增产物的累积量。通过比较Cq值(循环阈值)即可对初始模板进行绝对或相对定量。该技术常用于基因表达分析、病原体载量检测及拷贝数变异评估。

2.2.3 数字PCR与单分子检测

数字PCR(dPCR)将反应体系分割为成千上万个独立的微反应单元(微滴或微孔),每个单元中模板分子服从泊松分布,通过终点荧光阳性的比例直接计算模板绝对数量。dPCR无需标准曲线,对低拷贝靶标(如稀有突变、病毒微量核酸)的检测灵敏度显著高于qPCR,同时耐受PCR抑制物的能力也更强。

2.3 测序技术

2.3.1 第一代测序(Sanger法)

Sanger测序基于双脱氧核苷酸(ddNTP)链终止原理:在DNA聚合酶参与下,随机掺入荧光标记的ddNTP使合成终止,生成一系列不同长度的片段,通过毛细管电泳分离并读取碱基序列。单次读长可达800~1000 bp,准确率超过99.99%,至今仍是基因突变验证与小规模测序的“金标准”。

2.3.2 第二代测序(NGS平台)

2.3.2.1 Illumina桥式扩增

Illumina平台采用“桥式PCR”在流动槽表面原位扩增单分子DNA,形成数千个克隆簇。随后通过“边合成边测序”(SBS)技术,加入带有可逆终止子的荧光核苷酸,每轮合成后扫描图像获取碱基信息。其测序通量极高(单次运行可达数Tb数据),读长一般150~300 bp,适合全基因组、外显子组及转录组测序。

2.3.2.2 半导体测序(Ion Torrent)

Ion Torrent技术利用DNA合成释放氢离子(H⁺)作为检测信号:每个核苷酸聚合释放一个质子,引起pH值变化,通过半导体传感器直接转化为电信号完成碱基识别。该平台无光学检测系统,成本较低、运行速度快,但同聚物区域(如AAAA)容易出现错误,准确率略低于荧光检测类平台。

2.3.3 第三代测序(长读长)

2.3.3.1 PacBio单分子实时测序

PacBio SMRT测序将单个DNA聚合酶固定在零模波导(ZMW)孔底部,实时观测荧光标记核苷酸的掺入过程。其读长平均10~20 kb,最长可达100 kb以上,尤其擅长跨越重复区域与结构变异。虽然单分子测序的原始错误率较高,但通过环形一致性测序(CCS)可大幅提升碱基准确度。

2.3.3.2 Oxford Nanopore纳米孔测序

Nanopore技术使单链DNA分子穿过嵌入在膜上的蛋白纳米孔,通过检测不同碱基通过时引起的电流变化实时读取序列。其最大优势在于超长读长(可达2 Mb以上)、实时数据传输以及对设备小型化的高度支持(如MinION便携式测序仪)。目前准确率仍在持续提升,适用于快速诊断、野外基因组测序与宏基因组分析。

2.4 分子标记与指纹图谱

2.4.1 限制性片段长度多态性(RFLP)

RFLP利用限制性内切酶消化基因组DNA,由于序列差异(突变或重排)导致酶切位点分布不同,产生不同长度的DNA片段,经电泳分离和探针杂交即可检测多态性。该方法操作繁琐、样本要求高,但曾在法医学与遗传图谱构建中发挥重要作用,现已逐步被更高效的技术取代。

2.4.2 微卫星(STR)分析

短串联重复序列(STR)由2~6 bp的重复单元串联而成,在个体间呈高度多态性。通过PCR扩增多个STR位点(如CODIS系统中的13个核心位点)并利用毛细管电泳分析片段长度,即可实现“DNA指纹”匹配。STR分析是法医个体识别与亲子鉴定的主流技术,准确率极高。

2.4.3 单核苷酸多态性(SNP)分型

SNP指单个核苷酸变异(如A→G),在全基因组中分布广泛且遗传稳定。SNP分型方法包括TaqMan探针法、KASP(竞争性等位基因特异性PCR)、基因芯片及测序等。SNP标记适用于大规模群体遗传学、全基因组关联研究(GWAS)及祖先推断。

2.5 核酸杂交与可视化

2.5.1 Southern印迹

Southern印迹将经限制性酶切和电泳分离的DNA片段转移至硝酸纤维素膜或尼龙膜上,再与标记探针杂交,通过放射自显影或化学发光检测靶序列。该技术用于特定基因定位、DNA甲基化分析及重排检测,是分子生物学经典方法之一。

2.5.2 荧光原位杂交(FISH)

FISH使用荧光标记的DNA探针与固定在玻片上的染色体或细胞核DNA杂交,在荧光显微镜下直接观察靶序列在染色体或细胞核中的位置。FISH常用于染色体异常(如易位、缺失、扩增)检测、基因定位及肿瘤细胞遗传学分析。

2.5.3 微阵列(芯片)技术

微阵列将成千上万条已知序列的寡核苷酸探针固定在固相载体表面,与荧光标记的样本DNA或RNA杂交后通过扫描仪获取信号强度。该技术可同时检测基因表达水平、SNP分型、拷贝数变异及甲基化状态。随着测序成本下降,芯片在部分应用领域已逐步被NGS取代,但仍广泛应用于临床细胞遗传学筛查。

3 数据分析与生物信息学

3.1 序列组装与比对

3.1.1 从头组装与参考基因组比对

从头组装(de novo assembly)针对无参考基因组序列的物种,通过短读长或长读长之间的重叠关系构建重叠群(contigs)和支架(scaffolds)。常用工具包括SOAPdenovo、Velvet、Canu及Flye。参考基因组比对(mapping)则需将测序读长匹配到现有参考序列上,以识别变异或定量表达,主要软件有BWA、Bowtie2、STAR和minimap2。组装与比对的质量直接影响后续变异检测的准确性。

3.1.2 局部比对工具(BLAST、Bowtie)

BLAST(基本局部比对搜索工具)通过seeding-extension策略在数据库中搜索与查询序列高度相似的局部片段,支持蛋白质与核酸序列比对,广泛用于序列注释、物种鉴定及同源性分析。Bowtie与Bowtie2是为短读长比对设计的高效索引工具,基于Burrows-Wheeler变换(BWT),内存占用低、比对速度快,适用于大规模NGS数据。

3.2 变异检测与注释

3.2.1 单核苷酸变异(SNVs)

SNVs指单个碱基的替换。检测流程通常包括:比对→去除PCR重复→局部重比对(realignment)→碱基质量校正(base quality score recalibration)→变异识别(GATK HaplotypeCaller或FreeBayes)。变异需通过硬过滤(如覆盖率、质量得分)或VQSR模型筛选,随后进行功能注释(如VarScan、ANNOVAR、SnpEff)以判断其是否影响编码或调控区域。

3.2.2 插入缺失(Indels)

Indels为长度1~50 bp的小片段插失,由DNA复制滑脱或断裂修复错误导致。其检测难度高于SNVs,需要局部重组装以提高准确度。GATK的 IndelRealigner 及后续的 HaplotypeCaller 可有效提升Indel识别率。若Indel引起移码,常导致基因功能丧失。

3.2.3 结构变异(SVs)与拷贝数变异(CNVs)

结构变异涵盖>50 bp的大片段缺失、插入、倒位、重复及易位。长读长测序与光学图谱(Bionano)在此类变异的检测中具有显著优势。常用短读长SV检测工具包括DELLY、LUMPY、Manta及BreakDancer。CNVs通过读长深度(read depth)变化识别,主要工具包括CNVnator、PennCNV和XHMM。SVs/CNVs与多种遗传病及癌症相关。

3.3 群体遗传学分析

3.3.1 哈迪-温伯格平衡检验

哈迪-温伯格定律指出,在随机交配、无选择、无突变、无迁移且群体无限大的理想条件下,等位基因频率与基因型频率在世代间保持平衡。对人群SNP数据的哈迪-温伯格检验(通常用χ²检验或Fisher精确检验)可识别基因分型错误或自然选择信号,p值小于0.05通常被视为偏离平衡的证据。

3.3.2 连锁不平衡与重组检测

连锁不平衡(LD)指同一染色体上不同位点等位基因间的非随机关联。LD分析可用于基因定位(精细作图)与重组率估计。常用统计量包括D'(标准化系数)和r²(相关系数)。通过LD衰减图谱可推断种群历史(如有效群体大小变化)。数据通常利用Haploview、PLINK或LDlink进行可视化。

3.3.3 系统发育树构建

系统发育树利用分子序列间的差异推断物种或个体间的进化关系。构建方法可分为距离法(如邻接法NJ、最大简约法MP)、最大似然法(ML)和贝叶斯推断法(BI)。常用软件包括MEGA、RAxML、PhyML及MrBayes。系统发育分析已在病毒溯源、物种进化及人类迁徙研究等领域广泛应用。

3.4 数据库与在线资源

3.4.1 GenBank、dbSNP

GenBank由美国国家生物技术信息中心(NCBI)管理,是国际核酸序列数据库之一(另包括EMBL与DDBJ),收录来源于全球研究者提交的DNA和RNA序列。dbSNP是专门收录单核苷酸多态性(SNPs)及小插入缺失的数据库,每个变异具有唯一的rs编号(如rs53576)。这些数据库是序列比对、变异注释及群体遗传研究的基础资源。

3.4.2 ClinVar、1000 Genomes Project

ClinVar由NCBI运营,收集人类变异与表型之间的关系(如致病性、良性),为临床遗传解读提供权威参考。1000 Genomes Project(千人基因组计划)于2008~2015年间完成了来自26个种群的2504个人类基因组低覆盖度测序,是群体遗传学研究的标准参考,为估算等位基因频率与LD模式提供了海量数据。

4 应用领域

4.1 法医学与身份鉴定

4.1.1 个体识别与亲子鉴定

法医DNA分析采用多重复合STR分型系统(如全球主流的CODIS 20个核心位点、欧洲的ESS系统),通过比对犯罪现场样本与嫌疑人/数据库样品的STR图谱,实现唯一性匹配(匹配概率可达万亿分之一)。亲子鉴定则根据孟德尔遗传定律,计算父子/母子之间的亲权指数(PI)与累积亲权概率,准确率超过99.99%。

4.1.2 混合样本与低拷贝DNA分析

混合样本(多人DNA混合)需用概率统计模型(如LRmix、STRmix)进行解卷积,以推断各贡献者的基因型及比例。低拷贝DNA(LCN,<100 pg)分析易受等位基因丢失、杂合不平衡及随机扩增噪声(stutter峰)影响,需在超净台操作,并结合多次独立PCR与合并分析结果。

4.1.3 法医系统发育与地理溯源

通过分析线粒体DNA(母系遗传)或Y染色体STR/SNP(父系遗传),可以推断样本的母系或父系单倍群(haplogroup)。再结合群体频率数据库(如EMPOP、YHRD)即可推测嫌疑人或遗骸可能的祖先地理来源。该技术常用于无名尸体身源鉴定与历史人物遗骸确认。

4.2 医学遗传学与临床诊断

4.2.1 遗传病基因检测

单基因遗传病的诊断可通过Sanger测序(已知突变)或NGS靶向基因包(panel)进行。对于表型不明确者,全外显子组(WES)或全基因组测序(WGS)可提高检出率。检测到的变异需根据ACMG/AMP指南进行致病性评级。临床遗传咨询师需结合家族病史与共分离分析给出最终诊断。

4.2.2 肿瘤基因组学与液体活检

肿瘤组织的高通量测序可检测驱动突变、拷贝数变化及染色体易位,为靶向治疗(如EGFR抑制剂、免疫检查点抑制剂)提供依据。液体活检通过分析血液中游离DNA(cfDNA)来捕获肿瘤特异性突变,实现早期筛查、耐药监测及微小残留病灶跟踪。该技术具有无创、可重复采样等优势。

4.2.3 药物基因组学(个体化用药)

药物基因组学旨在阐明基因变异对药物代谢、疗效及不良反应的影响。例如,CYP2C9和VKORC1基因型影响华法林剂量,TPMT基因型与硫唑嘌呤的骨髓毒性相关。通过检测患者相关基因型,临床可调整给药方案以降低毒副风险、提高疗效,实现个体化用药。

4.3 进化生物学与生态学

4.3.1 物种鉴定与条形码技术

DNA条形码利用标准化的短基因片段(如动物COI、植物rbcL+matK、真菌ITS)实现物种的快速鉴定。将未知样本的条形码序列与公共参考库(如BOLD、GenBank)进行比对即可完成物种分类。该方法广泛应用于食品安全检测、濒危物种保护及生物多样性调查。

4.3.2 环境DNA(eDNA)监测

环境DNA技术从水体、土壤或空气中提取环境样本中的总DNA,利用通用引物(扩增条形码区域)或宏条形码(metabarcoding)检测目标物种的存在状况。该方法无需直接观察或捕捉生物个体,尤其适用于入侵物种早期预警、稀有物种监测及古生态重建。

4.3.3 古DNA(aDNA)与人类迁移史

古DNA提取自化石、古代遗骸或沉积物,通过高深度靶向捕获或全基因组鸟枪测序获得古代基因组。通过与现代人群及古代种群数据的比较,可以重建人类迁徙路线(如丹尼索瓦人、古欧洲人群)、杂合事件及疾病演化(如鼠疫耶尔森菌)。古DNA研究曾揭示现代欧亚人中含有尼安德特人与丹尼索瓦人的基因印记。

4.4 农业与畜牧业

4.4.1 作物品种鉴定与分子育种

利用SSR、SNP或DArT标记构建作物指纹图谱,用于品种纯度鉴定、亲本分析及品种权保护。分子标记辅助选择(MAS)将目标性状(如抗病性、耐旱性)的连锁标记应用于育种筛选,大幅缩短传统表型选择周期。随着全基因组预测技术的成熟,基因组选择(GS)正大幅提升育种效率。

4.4.2 动物亲缘关系与系谱验证

畜禽养殖中利用微卫星或SNP芯片分析个体间的亲缘关系,以确定亲本-子代对应关系、避免近亲交配并优化配种方案。此法在奶牛、猪、家禽等经济动物的育种场中广泛使用。结合基因组估计的育种值(GEBV)还可实现早期选择。

4.4.3 转基因生物(GMO)检测

GMO检测通过实时定量PCR或数字PCR扩增针对特定的外源基因(如CaMV 35S启动子、NOS终止子)或品系特异性边界序列,以定性或定量判定样本是否为转基因生物。此外,全基因组测序可检测新的或非预期的插入事件。检测结果服务于进出口贸易监管、食品标识及风险评估。

5 伦理、法律与社会影响

5.1 隐私权与数据保护

DNA承载最私密的个人生物信息,包括疾病易感性、亲缘关系及祖先构成。随着大规模基因组测序与生物银行建设,如何保护参与者的个人隐私成为关键课题。现有措施包括数据去标识化、加密共享、知情同意的分级授权以及禁止未经同意的DNA数据二次使用。多个国家和地区已出台了《基因组数据保护法》或类似法规。

5.2 基因歧视与就业/保险争议

基因检测可能揭示携带某些疾病风险(如亨廷顿病、BRCA突变),雇主或保险公司利用此类信息进行不公正筛选(基因歧视)已成为社会隐忧。许多国家(如美国的GINA法案、欧洲多国的相关法律)明确禁止在就业、健康保险中基于基因信息的歧视。但仍存在生命保险等非健康险种的监管空白。

5.3 法医DNA数据库的争议

各国为打击犯罪建立了包含嫌疑人、服刑人员以及部分普通公民的DNA数据库(如美国CODIS、英国NDNAD)。其争议核心在于:数据库的纳入范围(是否涵盖无辜者及未成年人)、数据保留期限、检索权限(是否允许家属搜索及全基因组扫描)以及潜在的数据滥用风险。平衡执法效率与公民隐私权之间的张力始终是公共讨论的重点。

5.4 基因编辑(CRISPR)的伦理监管

CRISPR/Cas9技术的精准与高效使得对人类基因组进行编辑成为可能,其应用于体细胞(治疗疾病)已进入临床试验,但生殖细胞编辑(可遗传至后代)因涉及人类胚胎改造而引发巨大伦理争议。2018年的“基因编辑婴儿”事件促使国际社会呼吁暂停可遗传的生殖系编辑。目前多国规定人类胚胎的生殖细胞编辑在实验层面就被严格禁止,相关临床转化普遍被否决。

6 未来趋势与挑战

6.1 单细胞DNA分析

单细胞DNA测序可在单个细胞水平上解析基因组突变、拷贝数变异及染色体重排,对揭示肿瘤异质性、早期胚胎发育及神经细胞多样性具有不可替代的价值。目前主要挑战包括:扩增偏差(全基因组扩增如MDA、MALBAC)、捕获效率及数据噪声的控制。随着微流控与自动化技术的发展,单细胞DNA分析正变得更加高效与可靠。

6.2 长读长与实时测序技术

长读长测序(平均>10 kb)弥补了短读长在重复区域、结构变异和单倍型定相上的不足。未来技术动向包括进一步提升原始准确率、降低单位碱基成本,并实现实时分析。Oxford Nanopore的连通性流式测序与PacBio HiFi的环形一致性测序正在朝着“一键获取完整基因组”的目标迈进,有望使单基因组测序常态化。

6.3 便携式现场分析设备

以MinION为代表的手持式纳米孔测序仪已可用于荒漠、雨林甚至国际空间站。便携式qPCR设备(如Biomeme)和微流控DNA提取芯片使即时检测(POCT)成为可能。这类设备可在疫情暴发时(如埃博拉、寨卡、新冠病毒)快速部署,也可用于转基因作物田间检测与濒危物种野外监测。未来更小的集成芯片(lab-on-a-chip)有望实现从样本到结果的全流程微型化。

6.4 AI与深度学习在DNA分析中的应用

人工智能已在以下方面展现出强大潜力:通过卷积神经网络从测序图像中直接识别碱基(如Nanopore的Basecalling)、利用Transformer模型预测基因功能与调控元件、基于随机森林/支持向量机进行致病性变异预测,以及利用图神经网络构建群体遗传结构的非参数估计。未来,AI与新一代测序的深度融合可能彻底改变基因组解读的自动化程度与精确性。但黑箱模型的生物学可解释性、过拟合风险及数据隐私仍需审慎对待。