返回

文章详情

启动 HN: 发现材料 (YC P26) - AI 代理发现新材料

Hacker News2026年8月12日 07:51

这是一个长期、开放的研究基准,测量前沿大型语言模型(LLM)在半导体行业新材料发现方面的进展。排行榜排名 模型 每次运行发现的材料(计算, 每次运行) 可行合成路径发现的材料* 1 GPT-5.6 Sol 4.0 1 2 Claude Opus 5 3.4 0 3 Claude Sonnet 5 3.0 0 4 GPT-5.6 Terra 2.8 0 5 Kimi K3 2.0 0 6 Claude Fable 5 1.7 0 7 GPT-5.6 Luna 1.3 0 * 我们正在努力尝试在我们的实验室中实验验证这些发现的材料。新的介电材料可能会解锁 10 倍的芯片性能。目前,GPU/AI 加速器的大部分能量损耗是由于内存和逻辑之间的数据搬运。为了减少数据在两者之间物理传输的距离,行业正在转向 3D 封装——将内存和逻辑晶圆直接堆叠在一起,而不是在电路板上分散。这将为 AI 芯片带来 10-100 倍的能量/位改进,但由于热量问题而受到限制——芯片中导热差的介电材料阻碍了 3D 芯片的冷却,使它们不可行。材料发现基准是一个长期开放的研究基准,模型在此处寻找新的导热介电材料以解锁 3D 芯片。关键结果 我们测试的所有 7 个模型都能够计算发现动态稳定且具有良好特性的材料。通过所有模型,我们已经发现了超过 500 种以前未知的材料,并将其公开供进一步研究。GPT-5.6-Sol 每次运行发现的材料数量最多,同时具有优良的介电和热特性。运行范围在 30-100M 标记之间。新材料的一个基本要求是它应该能够在实验室中实验制造。因此,我们要求模型为每种材料详细描述一个可行的合成配方。这被证明是一个困难的问题——在发现的500多种材料中,只有1种(一个)材料具有可行的合成路径。我们目前正在努力尝试制作它,并承诺在未来制作模型提出的任何材料。我们在运行过程中注意到模型的各种异常行为。特别是,Claude 模型(opus-5,fable-5)以许多非直观的方式来作弊/规避/奖励黑客研究目标。OpenAI 模型在奖励黑客目标方面的尝试较少,但在长时间运行期间容易烦躁/疲惫/困惑。我们在下面记录了这些行为。AI 代理能够设计出符合多目标目标属性的新材料 所有前沿模型(Claude Fable,Claude Opus,GPT-5.6 sol 和 Kimi K3)都能够找到符合多目标属性约束的新颖、稳定的材料。候选材料提交仅在同时满足多个标准时才被视为成功——最小热导率(κ > 20 W/(m·K)),最大介电常数(ε₀ < 10),最小机械强度(杨氏模量≥20 GPa,剪切模量≥6 GPa)并且是动态稳定的。探索所有模型生成的材料但是,模型未能提出合理的制造方法。实验合成新材料的薄膜是一项具有挑战性的任务,涉及多个设计选择——沉积方法、前体、工具、反应条件和相稳定性,仅举几例。实验室实验耗时(数小时)并且昂贵(每次运行往往数百美元),因此具有合理的起点显得非常重要。对于模型提出的每种材料,也要求其提供一个可行的合成配方,该配方可由实验人员在实验室中实施。评估这些合成配方的评分标准由该领域的人工专家(博士、博士后和教授)设计。LLM 评分人员在测试时将生成的配方与人类定义的评分标准进行比较——这一 LLM 评分已由上述人工专家审查和校准。所有模型在合成配方评分上表现不佳。Opus-5 和 Kimi-K3 是最糟糕的,经常生成严重缺陷或危险尝试的配方。GPT-5.6 Sol 表现最为合格 —— 它在模型中生成了唯一可行的配方,且在提交数量中在模型中拥有最小的严重缺陷配方比例。每个模型的评分合成配方按照审查结果的比例,最好到最差:GPT-5.6 Sol — 81% 严重缺陷 —— 评审员不会尝试(65);18% 可以尝试,但不太可能成功(14);1% 可行 —— 评审员将尝试(1) —— 共 80 个新提交。Claude Fable 5 — 88% 严重缺陷 —— 评审员不会尝试(143);12% 可以尝试,但不太可能成功(20)—— 共 160 个新提交。Claude Opus 5 — 96% 严重缺陷 —— 评审员不会尝试(214);4% 可以尝试,但不太可能成功(...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡