嘿,我是 Agnes。作为一名深耕基因组学多年的“老炮儿”,我经常被问到一个看似简单却困扰无数临床医生和科研人员的问题:“既然二代测序(NGS)那么成熟、便宜,为什么有些罕见病患者做了全套检查还是查不出病因?”
今天,我想抛开那些晦涩的术语,用一种更直白、甚至有点像在聊天的方式,带你深入理解为什么长读长测序(第三代测序)正在成为解开罕见病诊断“黑匣子”的关键钥匙。这不仅仅是一次技术的迭代,更是我们重新审视基因组“黑暗地带”的一次革命。
先聊聊“拼图游戏”:二代测序的辉煌与局限
要理解为什么需要三代测序,我们得先承认二代测序(NGS,比如 Illumina 平台)的伟大。在过去十年里,它是罕见病诊断的绝对主力。
你可以把二代测序想象成把一本厚厚的英文小说撕成无数个碎片,然后只读这些碎片上的几个单词。
- 二代测序的工作方式:它读的是短序列,通常只有 150-300 个碱基对(bp)。虽然准确率高(>99.9%),但它缺乏“上下文”。
- 它的困境:当基因组中出现大片重复序列、插入、缺失或复杂的重排时,这些短片段就像是一堆拼图中混杂了相同颜色的碎片,计算机很难知道它们到底应该放在哪里。
举个真实的例子:
假设一个罕见病患者表现出典型的神经发育迟缓症状。医生做了全外显子组测序(WES),结果报告是“未发现致病性变异”。患者和家属都很困惑:“难道我的病是查不出来吗?”
其实,问题可能出在SMN1 基因或FMR1 基因这类含有高重复序列或高度同源区域的基因上。二代测序的短读长无法跨越这些重复区域,导致比对错误,变异被漏掉或误判。
关键洞察:二代测序擅长发现点突变(SNV)和小片段插入缺失(Indel),但在面对结构变异(SV)和重复序列扩张时,它往往“睁眼瞎”。
三代测序:拉长视角,看清“模糊地带”
第三代测序(如 Oxford Nanopore Technologies 的 Nanopore 或 Pacific Biosciences 的 HiFi)的核心突破在于长读长。
- 长读长的优势:一次可以读取数千甚至数万个碱基对。这意味着一个读长可以覆盖整个基因,甚至跨越大片重复区域。
- 类比:如果说二代测序是看碎纸片,那么三代测序就是把整页文字完整地拍下来。你不仅能看到字,还能看到段落、章节,甚至整篇文章的结构。
为什么长读长能解决罕见病难题?
1. 破解“重复序列扩张”的谜题
许多罕见病是由三核苷酸重复序列扩张引起的,例如:
- 亨廷顿病(HTT 基因 CAG 重复)
- 脆性 X 综合征(FMR1 基因 CGG 重复)
- 强直性肌营养不良(DMPK 基因 CTG 重复)
二代测序的短读长根本无法准确计数这些重复次数。比如,一个正常的 HT
