返回

文章详情

人类转录因子DNA结合特异性的扩展代码手册

Nature2026年8月5日 00:00

2018年对假定人类转录因子(TFs)的主要调查得出的结论是,估计的1,600个转录因子中有超过四分之一缺乏已建立的结合基序。这一比例显示出一种显著的不足,因为人类基因组中大多数保守DNA是非编码的,而非编码DNA的主要功能假设是基因调控。此外,大多数未被表征和推测的转录因子与任何已知的转录因子并非近亲。因此,尽管它们可能具有文献证据表明其DNA结合或通常用以结合DNA的蛋白质结构域(DNA结合结构域(DBDs)),但其结合基序尚无法轻易推断。然而,不能排除这些假定转录因子完全缺乏DNA序列特异性。转录因子的DNA结合基序通常被建模为位置权重矩阵(PWMs),描述转录因子在结合位点对每个核苷酸碱基对的相对偏好。用于测量转录因子结合的方法,以及从结果数据中推导PWMs的方法,各自存在不同的固有局限性和偏见。关于转录因子的固有序列特异性对其细胞绑定的贡献与染色质和辅因子影响之间的关系,也存在长期的争议。这些不确定性代表了基因调控分析和基因组分析中许多相关任务的基本障碍,包括对保守基因组元素和序列变体的解释。为了解决这些问题,我们对大多数未被表征的人类转录因子(在这里定义为没有可信的已知结合基序)和几个以前研究过的对照转录因子进行了分析,采用了一组提供不同DNA序列特异性视角的实验室检测。我们将这一国际合作项目称为‘代码手册–GRECO-BIT合作’。试剂集和实验室实验以‘代码手册项目’的形式启动,这表明转录因子在基因组中解码单个‘词’的事实。同时,由基因调控联盟发起的基准测试倡议GRECO-BIT,深根于GRECO,参与了大部分的数据分析。在本文中,我们提供了代码手册数据的概述、研究的主要结果以及普遍现象和应用的示例。我们讨论如下发现:332个假定(即,代码手册)转录因子中刚超过一半(177个)展现出DNA序列特异性,大多数在体外和活细胞中观察到相同的基序。结果显示的177个基序在很大程度上彼此不同,也不同于以前研究过的转录因子的基序。这些转录因子的数万个基因组结合位点在基序匹配上显示出净化选择的证据,这表明它们是有功能的。这些保守的结合位点在编码基因的启动子中非常丰富,且代码手册转录因子的启动子结合位点可预测各个组织和细胞类型的基因表达。许多转录因子结合于基因组“黑暗物质”中,如转座子,或源自转座子,这表明它们可能在适应性进化中发挥了作用。随文稿和补充信息提供了更大的技术细节和深度,包括生物学发现、新的实验以及值得注意的转录因子家族,以及识别和基准测试PWMs的方法。代码手册项目概述如图1所示。我们使用多达5种不同的实验对393种蛋白质(332种假定代码手册转录因子和61种对照转录因子)进行分析,这些实验涵盖体外和活细胞环境:HT-SELEX、SMiLE-seq、蛋白结合微阵列(PBMs)、ChIP-seq(与在HEK293细胞中诱导标记转基因一起)和GHT-SELEX,这是HT-SELEX的一种变体,其中选择使用的是片段化的基因组DNA,而不是随机序列。GHT-SELEX、SMiLE-seq和ChIP-seq数据自己生成了显著且广泛的生物学见解,这些见解在随文稿中进行了详细说明。此处总结了重点和共同结论。不同的实验适应不同的蛋白质标签和表达系统,许多转录因子使用多个构建体(例如,全长和DBDs)和多个表达系统进行了分析,导致每种蛋白质分析的构建体数量和实验次数有所不同。该研究在代码手册转录因子和对照中分别使用622和93个蛋白编码插入克隆到1,267和118个蛋白表达构建体中。在总共实施的4,804个实验中,有4,377个为代码手册蛋白质,427个为对照转录因子。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡