返回

文章详情

科学中的人工智能需要推理,而不仅仅是数据

MIT Tech Review2026年8月10日 09:00

每隔几十年,就会有人宣布科学已到尽头。1903年,被尊敬的物理学家阿尔伯特·米歇尔逊写道:“物理科学的事实已经全部被发现。”在1980年代,斯蒂芬·霍金预测理论物理在世纪末可能会结束。随着人工智能的爆炸性到来,这种感觉再次弥漫——这次伴随着诺贝尔奖的颁发。2024年,谷歌深Mind的德米斯·哈萨比斯和约翰·贾姆珀因他们的神经网络AlphaFold获得部分诺贝尔化学奖,该网络通过学习数千种实验测量的形状,预测蛋白质的三维结构。这个棘手的问题在半个世纪的时间里一直未能系统解决;AlphaFold似乎一次性解决了这个问题,世界也因此对其方法的前景产生了极大关注。哈萨比斯和他的团队称AlphaFold是“人工智能如何将所有科学加速到数字速度的模板”。一波正在构建生物、化学和材料发现基础模型的初创企业获得了数十亿美元的资金,得益于DeepMind的成功。AlphaFold显示了人工智能与充足数据的结合能够实现突破性发现(即使我们不理解相关的底层机制),似乎再次为我们铺好了通往其他科学领域的道路。可以肯定的是,人工智能将给科学带来非凡的变化,但越来越明显的是,AlphaFold以及类似的成果可能并不是这种变革的最佳模板。尽管它是一个深刻的成就,但产生AlphaFold这类成果的条件是稀有的,满足这些条件所需的时间在其他领域将以数十年为单位,而不是以年为单位。相反,科学的加速将通过另一种方法实现:AI代理。AlphaFold成功的主要条件是存在蛋白质数据银行,这是一个约170,000个经过实验验证的蛋白质结构的数据集,DeepMind团队用这个数据训练其模型。创建蛋白质数据银行并非简单:它需要53年的国际科学合作,最近的估计显示,组建这些数据约耗资210亿美元。这样的规模的努力在资金上非常困难,协调几乎是不可能的,执行起来也极为耗时;因此,它们通常未能成功。但即使在具有所需凝聚力和资源的领域,并且相关数据不会因为商业所有权而变得无法访问,另一个较少讨论的障碍是生成可比较数据的科学不可能性。在蛋白质结构的情况下,关键的实验技术——蛋白质晶体学是一种异常可复制和可靠的工具,以至于超过25个诺贝尔奖依赖于此。但在大多数实验科学中,结果往往往有所不同。细胞系会漂移。化学品有微量污染物。实验室湿度变化。创建足够一致、准确、精确并且可扩展的数据集,以训练生物学或大多数化学领域的现代神经网络,需要新的测量方式和新的标准化方法——而这些都不会很快就绪。当然,一些领域满足这些要求:天气预测、大部分基因组学、非常有限的化学领域。如果这些领域尚未取得突破,可能会很快看到AlphaFold式的突破。正如美国国家安全委员会有关新兴生物技术所论证的,政府支持数据集的生产和协调将是关键。但对于大多数科学中的开放问题,我们需要不同的计划,至少在短期内。幸运的是,一些更安静和更谦逊的东西已经开始显现出潜力。科学家们一直在不确定性中进行推理。生物学家在寻找新的药物靶点时,永远不能拥有完美的数据集。相反,他们结合对接计算和已知结构,考虑分子动力学,进行少量结合实验,并利用他们的判断根据每种方法的特点和失败点评估每种方法。科学的技能不在于任何单一的工具;而在于合成多种工具的产出,并在证据不断涌现时修订结果。这就是大多数实际研究的进行方式。但直到最近,没有软件能做到这一点。现在,代理可以做到。简单地说,代理是一个人工智能推理引擎,它获得了访问工具(数字或物理)和使用这些工具的能力。在过去的几年里,人工智能的根本架构转变使得这些程序的迅速涌现成为可能,这些程序以大型语言模型为动力,极大地减少了对科学专门数据集的需求。对于科学而言,这一技术进步代表了一种基础性的变化:它有潜力...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡