返回

文章详情

在人工智能驱动的药物发现中闭合数据循环

MIT Tech Review2026年7月27日 11:40

药物发现是一项高成本、高风险的事业,正面临着越来越多的市场压力,该市场日益受到先发优势的定义。自20世纪50年代以来,开发新药物的成本大约每九年翻一番,这一现象被称为Eroom法则。如今,推出一款新药平均需要10到15年,成本在10亿到25亿美元之间,而失败率高达90%。人工智能已成为制药行业希望提高成功率和缩短时间的最大赌注。制药公司识别、测试和优化新化合物的速度越快,后续开发中发生失败的风险就越低。全球生命科学公司Cytiva的蛋白质研究战略总监保罗·贝尔彻表示:“药物发现中主要的成本仍然是在临床阶段,因此尝试降低风险并提高成功率显然是极其有利的。人工智能是一种方法,制药公司希望这种方法不仅能节省时间和缩短时间表,而且能使更优质的候选药物进入临床。”早期在药物发现中使用人工智能显示出潜力,但也突出了对强大和真实数据的需求,以及与实验室系统的整合。人工智能为实验室带来了效率。在药物发现中,人工智能最有前景的早期应用之一是在击中识别中。这涉及将分子实体的库筛选到与疾病相关的目标(例如蛋白质)上,以找到与其结合的分子。成功的击中为研究人员提供了进一步测试和完善的起点,目标是最终开发出可行的药物。贝尔彻看到从经验筛选到预测设计的转变:制药公司现在使用人工智能从头设计药物候选者,并预测它们如何与疾病目标相互作用,而不是进行物理筛选。这意味着公司不再受限于能够在物理上筛选出多少候选者。“人工智能消除了这个问题,”贝尔彻说道。“它可以帮助在你必须进行物理测试之前就消除低质量候选者,从而节省时间和资源。”贝尔彻表示,目前人工智能还不能可靠地预测新化合物的动力学或可开发性。这意味着每个人工智能生成的候选者仍需要在实验室中进行验证。传统的筛选工作流程是为了在规模上识别击中,而不是详细绘制大量复杂候选者。这给实验室团队带来了更多压力,他们现在必须测试、表征和纯化不断增长的多样化、人工智能生成的化合物。“目前用于击中识别的技术能够筛选成千上万,甚至数百万个化合物,使用基于二进制或阈值的技术产生低保真度数据——是或否的回答,”贝尔彻解释说。“人工智能可以增加你药物发现的击中数量,并可能提供更高质量的击中。这增加了对更高通量、信息丰富的技术的需求,以便验证和表征这些击中。”模型需要完整、高质量的数据。随着人工智能加速对数据丰富实验室系统的需求,它也突显了对更好、更完整数据的基本需求。许多早期的人工智能模型是在公开可用的数据集上训练的,现在正面临贝尔彻所称的数据墙。因为模型可以访问相同的数据,所以它们都得出相似的结论,随着时间的推移收益递减。此外,这些数据集并不是为人工智能构建的,这意味着它们缺乏保持模型准确和无偏见所需的结构、标签和多样性。出版偏见加剧了这一问题。“大多数公开可用的数据集和科学出版物都专注于积极结果,”贝尔彻表示。“没有人愿意分享他们的失败。这种偏见就像是把一只手绑在背后。人工智能模型可以识别与成功相关的模式,但它们缺乏对失败的全面理解,使得预测更加可靠。”贝尔彻认为可以显著改善模型的数据——失败的实验、未结合的化合物——仍然让人感到沮丧。“我们常常开玩笑说应该有一本负面数据的期刊,”他说。“这些数据通常埋藏在实验室笔记本中,几乎从未用来告知或指导未来的研究。”这种缺乏负面数据造成了一个根本性的问题:如果无法获得广泛的数据,模型无法得到充分训练以避免偏见。“在所有机器学习应用中,模型的表现在很大程度上依赖于训练数据的质量和范围,”贝尔彻指出。随着人工智能的普及,数据造假的可能性也变得更容易,加剧了数据完整性方面的担忧。以西方印迹为例。这是识别血液或组织样本中蛋白质的标准技术的一部分,也是最常见的目标之一。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡