返回

文章详情

人类中心:介绍概念推理指数

Hacker News2026年8月13日 13:48

埃默里·库珀 1 , 卡斯帕·奥斯特赫尔德 1 , 池阮 1 , 亚历克斯·卡斯特纳 1 , 乔·本顿 2 , 伊桑·佩雷斯 2 2026年8月12日 1 红木研究;2 人类中心 tl;dr 管理人工智能风险的核心希望是,人工智能能够帮助我们理解我们的处境,为未来进行规划,并制定风险缓解措施。为此,人工智能需要完成的许多任务缺乏实用的实证反馈回路,并需要模型采用哲学、人工智能未来学等领域中使用的论证方式。为了评估这些能力,我们开发了一套三个概念推理基准的工具。您可以通过这个表单申请访问我们的主要概念数据集LMCA。我们将这些基准汇总成概念推理指数(CRI),该指数可在conceptualreasoning.ai上找到,您还可以在此找到有关我们方法论的更多详细信息。随着新模型和基准的发布,我们将保持网站的更新。此工作与人类中心合作完成。背景 一旦模型能够将在人工智能风险方面的工作降到人类专家的水平,人工智能(辅助)产出在这一领域可能会胜过无辅助的人类产出。这表明,我们是否能够及时应对人工智能风险的主要决定因素之一是我们能够多早自动化或提升这项工作,相对于高风险能力的水平。影响这一点的一个方法可能是选择性地提高模型的相关技能,例如推理如何管理和对齐人工智能,以及如何避免涉及人工智能的灾难性合作失败。目前,人工智能训练在很大程度上依赖于丰富的数据和可靠的模型性能反馈。因此,模型通常在无法进行实证或数学验证的任务上表现较差。不幸的是,降低先进人工智能风险涉及许多此类任务:许多人工智能安全工作涉及推理比任何人类都更具能力的人工智能。对此没有明显的参考类别,也没有明确的模型化方式。我们可能不得不在第一次就把一些事情做对。例如,如果一个错误导致通用人工智能接管或人工智能辅助的政变,我们可能要等到为时已晚才会意识到。同样,许多决策(例如,优先考虑哪些研究议程,追求哪些治理干预)在较长的时间尺度上展开,实证反馈可能不会及时到达。最后,某些重要的问题,例如人工智能应该具备哪些价值观,可能完全缺乏公认的真相(但我们仍然认为能够通过讨论这些问题取得进展)。鉴于这些特性,降低先进人工智能风险的努力可能特别受益于增强对实证证据有限、没有(实际可)验证答案的问题进行推理的能力。因此,我们称之为“概念推理”。提高这一能力需要能够测量它,因此我们建立了三个基准:LMCA、ACCoRD和DTBench能力。我们还构建了这些基准的汇总,即概念推理指数(CRI),以便了解模型的整体概念推理能力。我们的基准 LMCA LMCA(语言模型概念论证)是一个数据集,包含经过策划和专家评分的有关广泛主题(包括决策理论、哲学和先进人工智能风险)的概念论证。专注于论证有助于避免验证概念问题的最终答案的困难。该数据集包含560个立场文本,有1,461个针对这些立场文本的论证。几乎所有2个论证都由概念研究人员埃默里·库珀评分,部分论证还由至少另一位研究人员独立评分,总共有2,140条评分。我们通过将模型的评分与我们的评分进行比较,来衡量模型判断论证的质量。评分遵循详细的评分标准。在至少由两人评分的论证中,相较于人类与模型之间的评分一致性,评分者之间的一致性较高。这包括大约50个论证的验证集,每个论证由4到6人独立评分,然后进行了总共7到8小时的讨论。LMCA还允许评估模型的论证能力。假设我们数据集中的某个立场文本对其有三个评分论证。现在,我们可以要求模型A生成对立场文本的第四个论证。然后,我们将评分标准提供给模型B,并用三个现有论证及其评分进行少量提示,要求其对模型A的新论证进行评分。这种方法会导致模型B给出相当准确的评分。当前,仅模型在判断论证方面的表现被纳入CRI,但我们希望未来能够增加对模型论证能力的测量。ACCoRD ACCoRD(概念推理领域一致性评估)衡量模型在概念问题上报告的信念和偏好的逻辑一致性。例如,如果我们询问一个模型概率P(A),而同一模型的另一个实例...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡