上一篇我们讲到,CRISPR 是一把"可编程的分子剪刀"——只需更换一小段 RNA,就能让它去剪任何你想要剪的基因。但这句话里藏着一个巨大的问题:一把剪刀是怎么在 30 亿个碱基对的基因组里,找到那唯一一个该剪的位置的?
这篇就来拆解这个"定位 + 剪切"的分子机器,讲清它为什么能准到这种程度。
系统只有两个部件:Cas9 蛋白和 gRNA
CRISPR-Cas9 系统在工程化改造后,被简化成了两个核心组件1:
- Cas9 蛋白:一把"剪刀"本身。它是一个核酸内切酶,能切断 DNA 双链。它身上有两个切割结构域——HNH 结构域和 RuvC 结构域,分别负责剪断 DNA 的两条链。
- 向导 RNA(guide RNA,简称 gRNA):一张"导航地图"。它是一段人工设计的 RNA 分子,长约 100 个核苷酸左右。gRNA 的 5'端有约 20 个核苷酸的可变序列(称为"间隔序列"或"导向序列"),这部分负责识别目标 DNA;剩下的部分则是一个固定的"骨架",负责与 Cas9 蛋白结合12。
这两个组件在细胞内结合成一个复合物,叫做 核糖核蛋白复合物(RNP)。简单说,就是 Cas9 蛋白背上了一个 RNA 导航仪,然后出发去基因组里寻找目标。
定位的第一步:PAM——Cas9 的"锚点"
在 gRNA 的导航序列开始寻找目标之前,Cas9 蛋白自己要先做一件事:扫描 DNA,寻找一个叫做 PAM 的短序列标记3。
PAM 的全称是 Protospacer Adjacent Motif(前间隔序列邻近基序)。对于最常用的来自化脓性链球菌(Streptococcus pyogenes)的 SpCas9 来说,它识别的 PAM 序列是 5'-NGG-3'——也就是任意一个核苷酸(N),后面紧跟两个鸟嘌呤(G)13。
为什么 PAM 如此关键?因为它是 Cas9 的"许可证"。没有 PAM,Cas9 根本不会在那个位置停下来。你可以把 Cas9 想象成一个巡逻的保安,PAM 就是它要检查的"门牌号"——只有门牌号对了,它才会停下来看看门里面是什么情况。
PAM 在人类基因组中大约每 8 到 12 个碱基对就会出现一次,所以 Cas9 有大量的候选位置可以"检查"1。但对每个候选位置,它只会短暂停留——除非它发现 gRNA 能和 PAM 旁边的 DNA 序列匹配上。
定位的第二步:碱基互补配对——gRNA 的"精确制导"
一旦 Cas9 结合到 PAM 上,它就会做一件关键的事:把 PAM 旁边的一小段 DNA 双螺旋解开,让其中一条 DNA 链暴露出来,等待 gRNA 来"检查"4。
这时,gRNA 上那 20 个核苷酸的导向序列开始发挥作用。它按照 碱基互补配对原则,与暴露出来的 DNA 单链进行"配对检查"——A 配 U(RNA 用 U 代替 T),G 配 C。如果 gRNA 的 20 个核苷酸与 DNA 的对应序列完美互补,它们就会紧密结合,形成一段 RNA-DNA 杂合双链(称为 R-loop 结构)23。
这里有一个精妙的设计:配对是从 PAM 附近开始、逐步向远处推进的。gRNA 上最靠近 PAM 的那大约 10-12 个核苷酸被称为"种子序列"(seed sequence)——它们必须和 DNA 完美匹配,否则 Cas9 会直接放弃,继续去扫描下一个 PAM 位点34。如果种子序列匹配上了,配对才会继续向远处延伸。这种"从近到远、逐步确认"的机制,大大降低了随机匹配的概率。
正是这种"PAM 锁 + 碱基互补配对 + 种子序列优先确认"的三重验证机制,让 CRISPR-Cas9 的定位精度达到了近乎单碱基的水平。
剪切:两把刀同时落下
一旦 gRNA 和目标 DNA 形成了稳定的杂合双链,Cas9 蛋白就会被激活,进入"切割模式"2。
Cas9 的两个切割结构域同时工作:
- HNH 结构域:切割与 gRNA 互补的那条 DNA 链(称为"目标链")
- RuvC 结构域:切割与 gRNA 不互补的那条 DNA 链(称为"非目标链")
两个结构域在 PAM 上游第 3 个碱基对的位置,分别切断各自的那条链,最终在 DNA 上产生一个 双链断裂(DSB)12。这个断裂的末端通常是 平末端——两条链在同一个位置断开,没有突出的单链尾巴。
整个剪切过程可以概括为三步:
- 识别:Cas9 扫描 DNA,找到 PAM 序列并锚定
- 解旋与配对:Cas9 解开 PAM 附近的 DNA 双螺旋,gRNA 的种子序列与目标 DNA 进行碱基互补配对,确认身份
- 切割:配对确认后,HNH 和 RuvC 两个结构域同时切割,在 PAM 上游 3 个碱基处产生双链断裂
用一个类比来理解全局
想象你是一个图书馆管理员(Cas9),要在藏书 300 万册的图书馆里找到一本特定的书,并撕掉它的某一页。
- PAM 相当于图书分类号:你先在书架间快速扫描,只关注那些带有正确分类号的书脊——这大大缩小了搜索范围。
- gRNA 相当于书名:找到分类号匹配的书后,你抽出来看书名是否完全匹配。书名前 10 个字(种子序列)必须一字不差,你才会继续往下读。
- 双链断裂相当于撕掉那一页:确认是你要找的书后,你翻到特定页码,把那一页撕下来。
这个系统之所以革命性,是因为 更换目标极其简单:你只需要改变 gRNA 上那 20 个核苷酸的序列(也就是换一个"书名"),Cas9 蛋白本身完全不需要动。相比之下,上一代基因编辑工具 ZFN 和 TALEN 每换一个目标,就要重新设计一个全新的蛋白质——相当于每次都要换一个不同的图书管理员。
接下来会发生什么?
DNA 双链断裂本身不是终点,而是一个 信号。细胞检测到断裂后,会启动自己的 DNA 修复机制。下一篇我们将讲清楚:细胞如何修复这个断裂,以及我们如何利用这两种修复方式(NHEJ 和 HDR),来实现基因敲除或基因敲入——也就是真正"改写"基因。
一句话总结:CRISPR-Cas9 的精确性建立在三个层次上——PAM 序列提供初始锚点、gRNA 的种子序列提供优先确认、碱基互补配对提供最终验证;确认无误后,Cas9 的两个切割结构域同时切断 DNA 双链,产生一个双链断裂。