冰岛泛基因组参考
人类基因序列的主要分析主要基于映射到单一参考基因组的短序列读取,结果由于参考序列中的缺口和对参考等位基因的强偏倚而导致不准确或不完整的映射。目前的人类参考基因组(GRCh38)自首次发布以来经过多次更新,增加了代表与其主要支架不同的染色体序列的替代序列。尽管这些额外序列增加了GRCh38的多样性,但通常因与主要支架的相似性而被丢弃,从而导致映射歧义,从而降低变体调用灵敏度。此外,GRCh38仍然不完整,因为其主要支架中包含约151 Mb的缺口和9 Mb的错误重复或崩溃区域。近期长读测序的进展使得人类基因组的首次无缺口组装成为可能,T2T-CHM13包括22条常染色体和X染色体的近乎无错误组装,随后又补充了Y染色体的组装。尽管T2T-CHM13相较于GRCh38增加了超过182 Mb的序列,包括99个新编码蛋白质的基因,但它未捕捉到单倍型或个体之间的序列差异。计算泛基因组学是一个致力于共同分析和利用基因组序列集合而非传统线性参考的研究领域。为此,HPRC对来自不同族群的47个个体进行了基因组测序,并将其组装成连续的高质量单倍型解析组装。这些个体的遗传变异已从其组装中提取并组合成图形表示的泛基因组。总体而言,HPRC泛基因组为GRCh38贡献了额外的90 Mb非参考序列,源自结构变异和119 Mb的常染色质序列。尽管如此,由于其结构复杂性、新文件格式的使用和比线性参考映射所需的更高计算需求,泛基因组的广泛采用受到阻碍。在这里,我们使用Emblask管道组装了698个高质量的冰岛单倍型,并将其与HPRC组装结合,创建了HPRC-ICE泛基因组参考,由788个单倍型组成。Weaver映射到由数百个单倍型组成的泛基因组参考,如HPRC-ICE,并在诸如GRCh38或T2T-CHM13等线性坐标系统中输出读取映射。由于Weaver使用现有文件格式,它可以简单地替代现有分析管道中的任何线性参考映射器。内置于泛基因组参考中的线性坐标系统可直接访问可用的基因组注释并使其与线性参考调用集进行比较。我们展示了Weaver在57630名冰岛人群体中的HPRC-ICE映射结果,可靠调用变异比线性映射增加了6.17%,包括与疾病相关的变异,展示了恢复了先前被参考偏倚伪装的变异。图1:研究概述。来自测序的冰岛个体的长短读被用来创建冰岛泛基因组参考。为此,我们开发了Emblask,以使用父母-子代三元组的ONT R9.4和Illumina读取组装单倍型解析的双重组装。在质量控制后,698个冰岛单倍型组装与HPRC、GRCh38和T2T-CHM13组装结合形成HPRC-ICE泛基因组参考。我们开发了Weaver,将57630名冰岛人的短读映射到HPRC-ICE,并随后共同标注了9896万个小变异。我们使用182338名芯片基因型冰岛人的长距离分相对这些变异进行插补,得到了6542万个良好插补的变异。WGS,整个基因组测序。地图下载自https://mapsvg.com/ (CC0 1.0)。Emblask:混合双重组装管道。Emblask是一个二倍体基因组组装管道,从父母-子代三元组数据产生两个单倍型组装,也称为双重组装。与大多数单倍型解析双重组装工具主要依赖于准确长读取不同,Emblask是一种混合方法,使用来自父母-子代三元组数据中所有三个成员的嘈杂的长读取和准确的短读取,具体来说,在本研究中为牛津纳米孔技术(ONT)R9.4和配对结束的Illumina读取。Emblask首先使用Ratatosk对长读取进行全基因组和靶向纠正,使用由短读取构建的图作为参考。这将长读取错误率减少到1%以下,同时保持每个读取的相位。接下来,纠正后的长读取与Flye组装成为未知父源的单倍型解析序列。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡