利用Raygun对天然蛋白质进行微型化和改造
主要的蛋白质设计最近取得了重大进展,特别是在根据特定功能或结构进行de novo蛋白质的创造上。然而,进化展示了另一种策略:基于现有蛋白质构建,这种方法我们称之为模板引导设计(图1a–c)。这类似于对建筑进行翻新,而不是从头开始建造,这种策略实现了蛋白质的微型化、传感器和报告器的再工程,同时保留功能,以及为了病毒递送限制而适应基因负载。目前的基于模板的方法主要依靠替换,并且随着变化的增加而变得无效:仅25个替换位点就产生了10^32种可能,使得计算预测变得不切实际。从更根本的角度来看,自然进化不仅通过替换生成新的蛋白质,还通过插入和缺失(indels)。在没有添加或删除整个房间的能力的情况下修改蛋白质就像在没有能力进行房屋改造的情况下对建筑进行翻新,而现有方法无法大规模利用这些变化,同时保持蛋白质的核心结构。一种能够同时处理组合替换和大规模插入与缺失的设计方法将极大扩展从单一模板可推导的蛋白质的宇宙。图1:Raygun模型的描述。a,与条件受结构或功能约束设计全新蛋白质的de novo模型不同,Raygun使用现有蛋白质作为模板,并在模板引导设计中引入适当的替换和indels。b,Raygun有三个输入:模板序列、噪声参数和目标长度。c,Raygun在生物研究中具有直接和广泛的应用,从蛋白质传感器设计到基因治疗的蛋白质微型化。图示由BioRender创建;Singh, R. https://BioRender.com/mjecsx1 (2026)。d,Raygun被设计为一个自编码器模型。编码器将可变长度的序列输入转换为固定维度的表示,这个空间近似于多元正态分布。Del,删除;ins,插入;seq,测序;sub,替换。e,与基于扩散的模型不同,可以通过此分布进行单次采样。f,Raygun参数提供对插入、缺失和替换的精细控制。g,它是以自我监督的方式进行训练的。在推断过程中,我们建议使用微调版本,其中仅更新解码器块。h,生成和过滤管道。Raygun生成速度快(每次生成0.3秒),并可以与下游过滤步骤结合,以有效生成高质量候选者。蛋白质语言模型(PLMs)将蛋白质编码为丰富的每个残基的表示,学习自进化数据。这些嵌入捕捉每个残基的局部和全局上下文,并推动蛋白质相互作用、结构和功能特性的预测。从设计的角度来看,PLM嵌入提供高保真、计算上可处理的表示:对于点替换,在残基嵌入附近采样已经产生保持功能的变体。序列和嵌入空间之间的双向转换现在足够准确,可以完全在具有结构意识的嵌入空间中执行设计操作。我们在这里使用PLMs进行模板引导设计,通过将序列空间设计减少为嵌入空间操作。然而,PLM嵌入与序列长度成比例,导致不同尺寸的蛋白质的表示不兼容。我们的关键见解是将每个蛋白质表示为固定维度的概率分布,而不是高维空间中的点序列。这使得任何长度的蛋白质可以直接进行比较,从而无需迭代精炼即可单次生成多样候选者。我们引入了Raygun,一个实现该方法的生成框架。Raygun采用编码器-解码器架构,接受三个输入:模板序列、控制替换率的噪声参数和控制indels的目标长度。我们显示Raygun在生成微型化、改造和扩大蛋白质变体的同时保留预测结构,开启现有方法无法访问的设计可能性。应用于荧光蛋白,我们生成的候选者序列比已知96%的荧光蛋白要短,其中6个表现出荧光。设计的TurboID微型化变体(一种合成生物素连接酶)显示出连接酶活性;放大的EGF变体比野生型具有更高的EGFR结合亲和力。这些结果表明,蛋白质功能可以独立于序列长度被可靠地表示,表明能够协调插入、缺失和替换的进化能力可以从所学习的序列中进行计算上的再现。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡