
如果你对Hi-C还不甚了解,首先推荐一篇中文综述
陶婧芬, 谢婷, 郑觉非, 等. 基于染色质交互数据的基因组组装方法[J]. 生物技术通报, 2015, 31(11): 43-50.
Hi-C技术的大致流程为:
1) 通过甲醛交联固定,将细胞内由蛋白质介导的空间上邻近的染色质片段进行共价连接。
2) 限制性内切酶进行酶切
3) 使用生物素标记末端标记
4) 将连接的DNA纯化后超声打断,并用生物素亲和层析,将生物素化的DNA片段分离,加上接头进行高通量测序

图 1 Hi-C测定染色质交互的基本原理及技术流程
Lieberman-Aiden E, Van Berkum N L, Williams L, et al. Comprehensive mapping of long-range interactions reveals folding principles of the human genome[J]. science, 2009, 326(5950): 289-293.
Hi-C数据分析的分析流程简述如下:
首先对下机数据进行质控去接头获得高质量的clean reads,然后将数据比对到已经组装的基因组序列上并去除PCR重复。利用去噪矫正之后的交互数据,构建染色质交互矩阵,针对其染色质三维空间结构特征,选取合适的聚类模型将未定位scaffolds锚定到染色体上,并采用相应的排序算法确定挂载scaffolds的正确顺序和方向,组装出染色体水平的全基因组序列。

图 2 Hi-C数据预处理分析流程图
Durand N C, Shamim M S, Machol I, et al. Juicer provides a one-click system for analyzing loop-resolution Hi-C experiments[J]. Cell systems, 2016, 3(1): 95-98.
好文推荐:
LACHESIS (ligating adjacent chromatin enables scaffolding in situ),华盛顿大学Jay Shendure医生带领的研究人员最新研发出一种基因组组装方法,它在染色质相互作用基础下从头基因组组装。这一成果有助于提高快速经济组装基因组的质量。相关文章发表于2013年11月3日的《Nature Biotechnology》杂志上。该分析工具可是分析Hi-C数据的经典工具,分析步骤可分为:聚类(确定所属染色体)----》排序(确定其在染色体上的排列顺序)-----》定向(确定其在染色体上的排列方向)三个步骤。算法示意图如下:

图 3 LACHESIS算法示意图
Burton J N, Adey A, Patwardhan R P, et al. Chromosome-scale scaffolding of de novo genome assemblies based on chromatin interactions[J]. Nature biotechnology, 2013, 31(12): 1119.
研究人员开发出了一种Hi-C数据的新算法3D de novo assembly (3D DNA) pipeline
(https://github.com/theaidenlab/3d-dna),用这一改良的Hi-C数据分析技术来组装人类基因组,发现99%的基因序列符合人类基因组的标准参照,93%的scaffolds定向均是正确的。联合已有的埃及伊蚊数据采用Hi-C数据(40X序列覆盖度)来分割,锚定,排序,定向和合并10kb以上的2534个Scaffolds。其中,鉴定了1422个Scaffolds中明显的错配。组装后的AaegL4版本基因组含有三个染色体长度的Scaffolds(长度分别为307Mb、472Mb和404Mb)占总输入序列的94%,合并剩下的3981个短的Scaffolds(N50为65kb,最长为474kb)获得最终与三条染色体对应的Scaffolds。
数据分析流程图如下:

图 4 计算流程图
算法处理描述:
1) 首先过滤小的Scaffolds,由于其片段长度过小,Locus互作频率相对较少,分析结果不可靠。
2) 对剩余的Scaffolds进行Locus互作频率一致性分析,具有错误拼接的Scaffolds分割成段,分割后保留具有远程互作模式一致性的Scaffolds片段,去掉不具一致性的部分。
3) 根据一对互作序列之间的互作强弱来锚定,排序和定向所得到的序列,建立初步可信的染色体长度的Scaffolds。
4) 基于序列同源性和远距离互作模式高度相性鉴定基因组重叠区域,根据重叠区来合并Scaffolds和Contig,获得最终的染色体长度的Scaffolds。这一步骤对于高杂合的基因组组装至关重要。

图 5 算法解析
Dudchenko O, Batra S S, Omer A D, et al. De novo assembly of the Aedes aegypti genome using Hi-C yields chromosome-length scaffolds[J]. Science, 2017, 356(6333): 92-95.
大麦虽然只有7条染色体基因组的重复序列比例高达84%,同时基因组大小在5.1 Gb,相比于人,水稻等简单基因组,技术上存在很大的难度。初版基因组在2012年才发布,在2017年研究者们结合BAC+Illumina+BioNano+HiC+Genetic Map,得到了4.79 Gb基因组序列,最终利用HIC和遗传图分别将95%和97%的序列挂到了染色体的水平,相比较于初版组装的只有1.9 Gb contig序列有了很大的提高。但是由于contig N50只有79kb, 依据现在大基因组发表的文章来看,如果使用三代测序+HiC这样的技术组合,在组装指标上还会有更大的提高。
Mascher M, Gundlach H, Himmelbach A, et al. A chromosome conformation capture ordered sequence of the barley genome[J]. Nature, 2017, 544(7651): 427.
SALSA2是最近新开发的一种Hi-C数据分析软件。该文章发表在生信权威杂志《Bioinformatics》上。其算法示意图如下:

图 6 SALSA2 算法分析流程示意图
该分析软件并不需要预先输入染色体的数目,另外在精确度上与以往的分析软件(3D-DNA)也有了较大的提高。此外在数据输入上还兼容GAF的数据拼接格式。此外SALSA2还利用Hi-C数据对错误的组装结果进行矫正,例如:

模拟数据情况下3D-DNA的组装错误率是SALSA2错误率的2-4倍。

Ghurye J, Rhie A, Walenz B P, et al. Integrating Hi-C links with assembly graphs for chromosome-scale assembly[J]. bioRxiv, 2018: 261149.
-END-
才子 撰文
TC 、一棵麦子 整理编辑
本文系欧易生物原创
欢迎转发到朋友圈
转载请注明本文转自欧易生物返回搜狐,查看更多