用于设计新病毒的大型基因组模型
病毒幻觉 该人工智能系统生成了基因上相距较远的细菌杀灭病毒的版本。人工智能在生物学上的许多工作集中在设计蛋白质上。这部分是因为蛋白质承担着生命的大部分功能,催化有趣的化学反应并构造细胞。因此,弄清楚如何合成一种新蛋白质可以直接影响生物化学,提供新的、潜在有用的功能。由于遗传编码在DNA和蛋白质之间提供了一层抽象,因此不明显由DNA训练的模型能够做什么。然而,人们还是继续制作了一个大型基因组模型,结果发现它能够输出可以在细菌中编码功能性蛋白质的DNA序列,并模仿复杂细胞中发现的基因结构。现在,这些相同的模型已被用于输出感染细菌的病毒基因组。这并不是科幻小说——所有模型生成的病毒都与现有病毒密切相关。但它们确实具有一些独特的特征,这些特征在进化上会带来挑战。参与这项工作的研究人员来自斯坦福大学,并建议我们现在可能需要开始考虑准备应对潜在的情况,即可能有人开发出相关的人工智能,能够设计针对脊椎动物的病毒。 大型基因组模型 大型语言模型本质上是通过预测下一部分语句,在尽可能多的由人类生成的文本汇编上进行训练。大型基因组模型则是将相同的方法应用于DNA。在某种程度上,这简化了问题,因为DNA仅使用四个“字母”:A、T、C和G。但是,它更复杂,因为基因组通常有一些区域,下一字母非常重要,夹杂着下一碱基可能是任何值而不重要的序列。所以大型基因组模型需要在许多情况下识别它们输出序列的生物学背景,而这些情况我们人类尚未弄清楚。然而,如果我们提供足够的基因组序列,它们似乎能够做到。与相关功能的细菌基因往往聚集在一起。给大型基因组模型提供一部分簇的序列,它将输出编码相关功能的蛋白质的DNA序列——这些蛋白质可能包括我们迄今识别的内容完全不同的工作蛋白质。但我们自身的知识缺乏限制了我们能利用这些模型做什么。如果我们用复杂细胞的某个序列提示它,它将回应一串看似基因和调控DNA的碱基。但是,由于大多数基因在真核基因组中的位置几乎是任意的,我们无法知道这些幻觉基因可能执行什么功能(如果有的话),因此我们无法以任何方式对它们进行测试。尽管如此,在训练这些名为Evo 1和Evo 2的模型时,研究人员并未向其提供任何来自于针对复杂细胞的病毒的序列。即使我们无法理解它们的输出,它们也有可能输出某些危险的东西。然而,存在一个针对细菌且无法感染人类的病毒世界。Evo的开发者认为这些是“合法目标”。因此,他们并没有关注Evo 1和Evo 2是否能够输出看起来合理的基因,而是决定测试它们是否能够输出完整的基因组。 从混沌中有序 他们选择作为测试案例的模型病毒是引人注目的名称ΦX174,它是感染大肠杆菌的病毒大家族的一部分。除了使用地球上研究最透彻的细菌进行测试的便利性之外,ΦX174还具有一些显著特征。它相当简单:在大约5400个碱基上分布着11个基因,而这11个基因都有已知功能,且该病毒的感染周期得到了很好的描述。此外,从与大型基因组模型合作的角度来看,它也有一个有用的特征:病毒末端始终有相同的短序列。所以,如果你使用这些碱基作为提示,大型基因组模型应该能够识别出它需要以某种方式回应,输出与ΦX174相关的序列。为了进一步准备他们的模型,Evo 1和Evo 2被输入了超过200万的来自细菌感染病毒(称作噬菌体)的DNA序列,并随后用特定于ΦX174所属的微病毒科的序列进行了微调。在此之后,他们对不同的提示进行了实验。若提示借用了太多的ΦX174起始序列,它将简单地把其余的基因组返回回来。若太少,它将生成大量无关的序列。研究人员最终发现,使用四到九个碱基的起始序列提示效果最佳。虽然输出被调整为返回看似ΦX174的内容,但其实际上可以是任何东西——从与正常病毒几乎完全相同的副本到仅模糊为病毒的序列。为了解决这个问题,研究团队在预设条件上进行了大量研究。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡