想象一下这个场景:你是一位临床遗传学家,手里拿着一份来自偏远地区的患儿样本。孩子有不明原因的发育迟缓,疑似罕见病,但基因检测结果模棱两可。更棘手的是,送检的唾液样本里可能混入了口腔菌群,甚至存在病毒载量较高的混合感染。这时候,是继续用成熟的二代测序(NGS)“凑合看”,还是咬牙上昂贵的三代测序(TGS)?
这不仅仅是技术选型的问题,这是在“成本”与“准确性”之间走钢丝。今天我们就来扒一扒,在罕见病基因诊断遇上混合感染样本时,如何做出最明智的选择。
一、 先别急着选技术,看看你的样本是什么“货色”
在讨论二代还是三代之前,我们必须先明确一个核心矛盾:罕见病诊断需要高分辨率的单倍型定相(Phasing),而混合感染样本引入了巨大的背景噪音和基因组复杂性。
1. 罕见病诊断的特殊需求
罕见病(尤其是单基因遗传病)的诊断难点往往不在于“发现突变”,而在于:
- 确定突变来源:是新发突变(de novo)还是遗传自父母?
- 复合杂合 vs. 杂合:两个突变是在同一条染色体上(顺式),还是分别在两条染色体上(反式)?这直接决定疾病是否发病。
- 非编码区变异:很多致病突变藏在剪接位点或调控区,NGS的短读长很难覆盖完整结构。
2. 混合感染的“干扰”
如果样本中存在细菌、病毒或共生菌的核酸,测序数据里就会夹杂大量非人源序列。
- 背景噪音:NGS会产生大量无意义的短reads,浪费测序深度。
- 组装碎片化:如果试图从头组装,混合基因组会让Assemblers(组装软件)崩溃,产生无数碎片。
- 假阳性风险:短读长可能将感染源的序列误认为是人类基因组的重复序列或拟基因(pseudogene)。
二、 二代测序(NGS):成熟但“近视”的选手
NGS(如Illumina平台)是目前临床诊断的金标准,但它面对混合感染时,有几个天然的短板。
优势:成本低、准确性高、流程成熟
- 单碱基准确率:高达99.9%以上,适合检测SNP(单核苷酸多态性)和小indel。
- 成本可控:全外显子组测序(WES)或全基因组测序(WGS)的成本已经降至几百美元级别。
- 覆盖深度深:可以轻松达到100x-300x深度,检测低频嵌合突变很有优势。
劣势:短读长的致命伤
NGS的读长通常只有150-300bp。在混合感染背景下,这会导致:
- 无法定相:你看到了两个突变,但不知道它们是否在同一条染色体上。对于常染色体隐性遗传病,这几乎无法确诊。
- 重复序列盲区:人类基因组中大量重复序列(如ALU元件),短读长无法唯一比对,容易误判。
- 感染源污染难以区分:如果感染菌的序列与人类基因组有部分相似性,短读长可能错误比对,造成假阳性致病突变报告。
实战案例:
一个疑似线粒体病的儿童,WGS数据显示mtDNA有异质性突变(50%)。但由于唾液样本含有口腔链球菌,NGS数据中混杂了大量细菌DNA,导致线粒体基因组的覆盖深度不均,难以判断是真正的组织异质性还是测序偏差。
三、 三代测序(TGS):昂贵但“远见卓识”的破局者
PacBio(HiFi模式)和Oxford Nanopore(ONT)是三代测序的代表。它们的核心优势是长读长,这恰恰能解决NGS在混合感染场景下的痛点。
优势:长读长带来的三大红利
- 单倍型定相(Phasing):
- HiFi读长可达15-25kb,ONT甚至可达100kb+。
- 这意味着一个读长可以覆盖整个外显子甚至整个基因,直接告诉你两个突变是在同一条染色体还是不同染色体上。这对罕见病诊断是决定性优势。
- 简单粗暴的“去背景”:
- 长读长可以跨越重复区域和同源序列,将人类序列与感染源序列清晰分开。
- 你不需要复杂的去宿主算法,因为长片段的人类序列不会与短小的细菌contaminate混淆。
- 结构变异(SV)检测:
- 罕见病中约15-20%的病例由结构变异引起,NGS几乎看不到,而三代测序一目了然。
劣势:成本与复杂性
- 成本高昂:HiFi测序成本仍是NGS的3-5倍。
- DNA投入量要求高:需要高质量、高分子量DNA,而混合感染样本往往DNA降解严重。
- 生信分析门槛:长读长比对和组装需要更多算力,且缺乏NGS那样标准化的临床报告流程。
实战案例:
同一个线粒体病患儿,使用ONT长读长测序。全长线粒体基因组(16.5kb)被一个读长完整覆盖,准确计算出异质性水平为45%,并排除了口腔细菌序列的干扰。同时,检测到一个核基因中的大片段的缺失-重复结构变异,最终确诊为Pol3基因相关的综合征。
四、 混合感染样本的“第三条路”:并非二选一
现实中,我们很少只做NGS或只做TGS。针对“罕见病+混合感染”这一复杂场景,专家级的工作流通常是分层策略:
策略一:宿主富集 + NGS(经济型)
如果预算有限,可以先用探针杂交捕获(如Agilent SureSelect)富集人类基因组,再结合RNase H处理去除rRNA,大幅降低背景噪音。
- 优点:成本低,深度高。
- 缺点:依然无法解决定相问题,且捕获效率受序列变异影响。
策略二:WGS + 生物信息学去污染(平衡型)
先做低深度的WGS(NGS),用工具(如Kraken2, BlobTools)快速鉴定感染源。然后针对性地深度测序目标区域。
- 关键步骤:
- 初步测序,识别主要感染菌。
- 设计探针,只捕获人类基因组及已知常见病原体。
- NGS测序,提高灵敏度。
- 适用:已知感染源,且主要关注编码区SNP。
策略三:HiFi WGS 作为“终极裁决者”(精准型)
如果患儿病情复杂、既往NGS阴性、或疑似结构变异/非编码区突变,直接上PacBio HiFi WGS。
- 为什么是HiFi而不是ONT?
- HiFi准确率高达99.9%,接近NGS,适合临床诊断。
- ONT虽然更长,但错误率较高(虽在改善),在临床报告中需谨慎验证。
- 流程:
- 提取高分子量DNA。
- HiFi测序,平均读长20kb。
- 生物信息学分析:
- 使用
minimap2比对人类参考基因组。 - 未比对的长读长直接用于微生物组分析(Metagenomics),一举两得:既诊断了罕见病,又鉴定了感染源。
- 使用
Hifiasm进行全基因组组装,实现全基因组范围内的单倍型定相。
- 使用
五、 实操建议:如何确保结果准确?
1. 样本预处理是关键
- 物理分离:如果可能,尽量获取纯化的细胞(如淋巴细胞),避免唾液、粪便等天然混合样本。
- DNase处理:对于细胞外DNA较多的样本,可用DNase I处理游离DNA,保留细胞内基因组DNA。
2. 生物信息学流程必须双轨并行
不要只用人类基因组比对。推荐流程:
# 伪代码示意:双轨分析流程
1. 原始数据质控 (fastp)
2. 宿主去除 (BWA-MEM 比对 hg38, 保留未比对reads)
3. 轨道A: 人类变异检测 (GATK/Hail) -> 寻找致病突变
4. 轨道B: 微生物组分析 (Kraken2/Bracken) -> 鉴定感染源
5. 关键整合: 将轨道B发现的感染源序列,反向比对回轨道A,排除假阳性
6. 三代特有: 使用WhatsHap进行长读长定相
3. 验证策略
- Sanger测序:对关键SNP进行验证。
- PCR + 长读长测序:对复杂区域(如HLA区、重复序列)设计特异性PCR,再用三代测序验证结构。
- 家系分析:如有父母样本,进行 trio 分析,有助于区分新发突变和遗传变异,同时验证感染源是否来自环境而非样本污染。
六、 总结:何时选谁?
| 场景 | 推荐技术路线 | 理由 |
|---|---|---|
| 预算充足,样本复杂,疑似SV或需要定相 | PacBio HiFi WGS | 一次测序,同时解决罕见病诊断和感染源鉴定,准确率与读长兼得。 |
| 预算有限,疑似SNP/小Indel,感染源已知 | WES + 探针富集 | 成本低,深度高,通过富集减少背景噪音干扰。 |
| 急性感染期,需快速鉴定病原体,罕见病暂缓 | ONT 宏基因组测序 | 速度快,读长最长,可全面覆盖病原体,人类基因组数据可作为副产品后续分析。 |
| NGS阴性,但临床高度怀疑 | 加测 HiFi WGS | 作为“救援技术”,解决NGS无法覆盖的复杂性区域。 |
最终建议: 在罕见病诊断遇上混合感染时,不要低估三代测序的价值。虽然成本高,但它提供的单倍型信息和对复杂基因组的解析能力,往往能带来“一锤定音”的诊断结果,避免了患者因误诊或漏诊而经历的漫长求医之路。从卫生经济学角度看,一次准确的诊断远比多次失败的NGS复查更划算。
记住,技术是工具,临床需求是导向。当NGS的“短视”成为瓶颈时,三代测序的“远见”正是破局的关键。
