想象一下,你手里有一本被撕碎的日记,需要把它拼回去。
二代测序(NGS)的做法是:把每一页纸再切成无数个小碎片,通过统计每个小碎片上的字,利用重叠关系把整本书重新拼出来。它速度快、便宜,但如果日记里有很多重复的句子(比如“我今天很开心,我今天很开心”),你就不知道这一句到底该放在哪里,拼出来的书可能会有错乱。
长读长测序(PacBio/Nanopore)的做法是:尽量保持句子完整,甚至能读出整段话。它虽然每句话的识别错误率可能稍微高一点(早期版本),但它能告诉你这句话的前后文是什么,能跨过那些重复的“坑”。
作为在这个领域摸爬滚打多年的“老手”,我见过太多人拿着同样的样本,却因为选了错误的测序策略,最后发现数据根本没法用。今天,我们不讲枯燥的定义,而是把这两种技术的底层逻辑、真实优缺点、以及到底该怎么选,掰开揉碎了讲清楚。
一、 先厘清概念:谁是谁?
在讨论“选哪个”之前,我们必须明确市面上所谓的“长读长测序”主要指两家:
- PacBio(SMRT测序):属于单分子实时测序。它的核心优势是HiFi读长——通过循环测序(CCS),同一个DNA分子可以被读多次,从而将错误率降到极低(>99.9%),同时保持长读长(10kb-25kb+)。简单说,PacBio是又长又准的贵族。
- Oxford Nanopore(纳米孔测序):属于纳米孔测序。DNA分子直接穿过蛋白质纳米孔,通过电流变化识别碱基。它的最大优势是读长极长(可以轻松读出100kb甚至1Mb以上的片段),且设备小巧(有USB大小的MinION)。早期错误率较高(~5-10%),但通过最新的化学试剂(R10.4.1孔+超高速测序)和算法,准确率已大幅提升,且实时出数据。
而二代测序(NGS),通常指Illumina平台。它的核心特点是短读长(150bp-300bp),但通量极高、成本极低、准确率极高(>99.9%)。
二、 深度对比:从原理到数据的真实表现
为了让你有直观感受,我们用一个表格来对比,但别急着看,看完表格后我会用具体的例子解释。
| 维度 | 二代测序 (Illumina) | 长读长测序 (PacBio HiFi) | 长读长测序 (Nanopore) |
|---|---|---|---|
| 读长 | 短 (150-300 bp) | 中长 (10-25 kb) | 极长 (可达 Mb 级) |
| 准确性 | 极高 (~99.9%) | 极高 (HiFi模式 >99.9%) | 中等~高 (原始读段~97-99%,经过纠错可更高) |
| GC偏好性 | 有偏好(高GC或低GC区域覆盖不均) | 几乎无偏好 | 几乎无偏好 |
| 启动时间 | 慢(建库+上机需1-2天) | 中等 | 极快(可直接测原生DNA,甚至野外实时测) |
| 成本 | 最低(尤其对于高覆盖度重测序) | 较高 | 中等(设备便宜,但试剂成本不低) |
| 检测能力 | SNV, Indel, CNV, 融合基因 | SNV, Indel, CNV, 结构变异(SV), 复杂重排 | SNV, Indel, CNV, SV, 表观遗传修饰(直接测) |
| 主要短板 | 无法跨越重复区域,组装碎片化 | 通量相对较低,核酸提取要求高(需要长片段) | 原始错误率较高,对计算资源有一定要求 |
三、 场景化解析:为什么有时候NGS够用,有时候必须上长读长?
场景1:癌症肿瘤Panel检测或常见遗传病筛查
结论:首选二代测序(NGS)。
如果你只是想知道一个基因里有没有某个已知点的突变(比如EGFR 21号外显子突变),或者筛查几十种遗传病的常见突变,NGS是绝对王者。
- 为什么? 因为你需要的是准确性和成本。NGS的单碱基准确率是最高的,而且可以同时测几百个样本,成本摊薄到每个样本可能只要几百块钱。
- 长读长在这里有用吗? 基本没用。你不需要知道这个基因上下游几千个碱基的序列,只需要知道那一个点变没变。用PacBio测这个,就像用波音747去送外卖——性能过剩且昂贵。
场景2:从头组装(De Novo Assembly)—— 植物或复杂基因组
结论:必须用长读长测序,NGS几乎无法独立完成任务。
假设你要组装一个新的水稻品种,或者一个具有大量重复序列的松树基因组。
- NGS的困境: 植物的基因组里充满了转座子、重复序列。NGS读长只有150bp,而重复序列可能长达10kb。这就好比你要用1厘米的小积木块去拼一个有10公里长完全相同的图案,你根本不知道拼到哪里了。组装出来的结果会是一堆碎片(Contigs),N50值极低,毫无参考价值。
- 长读长的解法:
- PacBio HiFi:能读出15kb以上的连续序列,直接跨越重复区域,组装出的Contig N50可以达到染色体水平。
- Nanopore:如果能获得高质量的长片段DNA,读出几百kb的序列,可以填补HiFi无法覆盖的极端重复区域。
- 专家建议: 现在最主流的基因组组装策略是 HiFi + Hi-C 或 Nanopore Ultra-long + Hi-C。这种组合能把基因组组装到染色体级别,并确定每条染色体上基因的顺序和方向。
场景3:结构变异(SV)的检测 —— 尤其是不明原因的罕见病
结论:长读长测序(PacBio或Nanopore)优势巨大。
这是近年来医学遗传学的一个爆发点。传统认为,如果一个孩子的表型异常,但全外显子测序(WES)和染色体微阵列(CMA)都没发现问题,那就没办法了。
- 真相是: 很多致病突变不是点突变,而是结构变异——比如大段的插入、缺失、倒位、易位。这些变异往往发生在重复序列区域,NGS读段太短,比对不到唯一位置,直接被过滤掉了。
- 数据说话: 研究表明,在疑似罕见病但WES阴性的家庭中,全基因组长读长测序(特别是PacBio HiFi)可以发现10%-20%的额外致病变异。这些变异往往是NGS漏掉的。
- 例子: 一个患者有严重的肌肉萎缩,NGS没发现异常。PacBio测序发现,在DMD基因(杜氏肌营养不良基因)内部,有一个约50kb的大片段重复插入,这个插入发生在高度重复区域,NGS完全测不出来。这就是长读长的价值。
场景4:HLA分型与免疫组库
结论:长读长测序是金标准。
HLA基因是人类最复杂的基因区域,具有极高的多态性和长的重复序列。传统的短读长测序很难准确区分HLA的单倍型(即哪两个等位基因在同一染色体上)。
- 长读长的优势: 可以直接读出整个HLA基因座(约30-40kb),准确判断顺式/反式关系。这对于器官移植配型和自身免疫疾病研究至关重要。
场景5:微生物宏基因组与物种鉴定
结论:看需求。Nanopore在实时现场检测无敌,PacBio在完整质粒/耐药基因解析上更强。
- 现场爆发疫情: 如果是在埃博拉疫情前线,或者需要快速鉴定食物中毒病原体,Nanopore的MinION可以带到现场,几小时内出结果,甚至能直接检测mRNA。
- 耐药基因机制: 如果想知道一个细菌的耐药基因是在染色体上还是质粒上,以及周围还有什么其他耐药基因,PacBio HiFi可以组装出完整的质粒序列,揭示水平基因转移的线索。
四、 一个容易被忽视的关键点:DNA质量要求
选技术之前,先问自己:我的样本DNA质量怎么样?
- NGS: 对DNA片段长度要求不高,100-500bp的片段即可。所以,即使是FFPE(福尔马林固定石蜡包埋)的老旧病理切片,或者降解严重的古代DNA,NGS也能做。
- 长读长测序: 极度依赖长片段高质量DNA。
- 要想PacBio跑出HiFi数据,你需要完整的、高分子量的DNA(>20kb,最好>50kb)。如果DNA提取过程中剪切过度,HiFi效果会大打折扣。
- 要想Nanopore跑出超长读长,你需要极其温和的提取方法(如MagBeads法,避免涡旋震荡)。
- 教训: 如果你手头只有一些保存多年的血痕或尸检样本,DNA已经断裂成小片段,强行上长读长测序只会得到一堆废数据。这时候,老老实实做NGS是唯一出路。
五、 成本与时间:现实的经济账
不要只看单样本成本,要看总体项目成本。
NGS:
- 建库成本低,上机速度快(一天可测多个样品)。
- 数据分析流程成熟,自动化程度高。
- 适合: 大样本量研究(如千人基因组、大规模队列研究)。
PacBio HiFi:
- 建库相对复杂,需要长片段DNA。
- 测序时间较长(SMRT Cell可运行30小时)。
- 数据分析需要较强的计算资源进行纠错和组装。
- 适合: 需要高精度长读长的项目,如新物种基因组、复杂SV检测。
Nanopore:
- 设备门槛低(MinION仅需USB供电)。
- 测序时间灵活(几小时到几天均可)。
- 数据产出随测序时间线性增长。
- 适合: 需要快速结果、便携现场、或超基因组结构解析。
实际案例对比: 假设你要对100个癌症样本做体细胞突变检测(找肿瘤特异性突变):
- NGS方案: 设计一个500基因Panel,深度1000x,单样本成本约500元,总成本5万元。结果:能检出99%的SNV和小的Indel。
- PacBio方案: 全基因组测序,深度30x,单样本成本约3000元,总成本30万元。结果:能检出SV,但点突变检出灵敏度可能略低于高深度NGS(因为深度不如NGS高),且成本是NGS的6倍。
- 决策: 除非你特别关注SV,否则选NGS。
六、 未来的趋势:混合测序与多组学整合
现在的趋势不是“二选一”,而是“混搭”。
- 短读长纠错长读长: 用便宜的NGS数据(如30x全基因组)来纠错Nanopore或PacBio的长读长数据,最终得到一个既长又准的基因组。这种方法在植物基因组学中非常流行,成本比纯HiFi低,质量比纯Nanopore高。
- HiFi + Nanopore整合: 用HiFi保证编码区的准确性,用Nanopore超长读长跨越极端重复区域和端粒着丝粒。
- 表观遗传学的加持: Nanopore和PacBio(通过kinetics信号)可以直接检测DNA甲基化(5mC),而不需要额外的实验(如Bisulfite测序)。这意味着你可以在一次测序中同时获得序列变异和表观遗传信息,这对于研究癌症和发育生物学非常有价值。
七、 给科研新手和临床医生的终极建议
如果你还在纠结,请按照以下步骤自检:
你的目标是什么?
- 找点突变、表达量差异、已知位点筛查 -> NGS。
- 组装新基因组、找结构变异、解析复杂区域(HLA、KIR、rDNA)-> 长读长。
- 现场快速病原鉴定 -> Nanopore。
你的样本质量如何?
- DNA完整、高分子量 -> 长读长可行。
- DNA降解、FFPE样本、古DNA -> NGS,长读长慎用或需特殊处理。
你的预算有多少?
- 预算有限、样本量大 -> NGS。
- 预算充足、追求极致信息量 -> PacBio HiFi 或 长读长+短读长混合。
你的生物信息学能力如何?
- 如果团队只熟悉BWA/GATK流程,突然转长读长可能会在数据处理上卡住半年。建议先从小规模测试开始,或者寻求专业服务商的帮助。
最后说句心里话:
技术没有绝对的优劣,只有适不适合。我见过太多人为了追逐“新技术”而盲目上长读长,结果因为DNA质量不好或数据分析受阻,既浪费了钱,又没得到想要的结果。也见过有人固守NGS,忽略了结构变异的价值,导致研究结论不完整。
作为研究者,我们需要做的是:明确科学问题,评估样本条件,权衡成本收益,选择最合适的工具。 有时候,简单的NGS能解决90%的问题;而剩下的10%,正是长读长测序大展身手的舞台。
希望这篇解析能帮你理清思路,做出最明智的选择。如果有具体的项目背景,欢迎进一步交流,我们可以一起探讨更细致的方案。
