GPT-5.6与Claude Fable 5在物理人工智能中的表现,哪个更好?
我们在我们的代理中测试了最新的前沿模型gpt-5.6-terra,针对五个不同难度的建模和仿真问题。以下是结果:claude-fable-5 加权得分 0.889 每次试验 $9.60 · 16.1分钟 gpt-5.6-sol 加权得分 0.814 每次试验 $1.74 · 13.4分钟 gpt-5.6-terra 加权得分 0.786 每次试验 $1.25 · 12.6分钟 gpt-5.6-luna 加权得分 0.727 每次试验 $3.26 · 25.0分钟。在物理人工智能中,模型能否正确反映物理现象至关重要。一架飞机的模型、一个分离柱或一个带电粒子的模型可以顺利编译和运行,但其编码的物理现象却可能是错误的。代理人工智能使这一失效模式更糟,因为代理是通过测试的反馈进行调整,而这些测试通常由同一个代理编写。在网页开发或编译器等领域,这种循环工作效果不错,因为正确的行为是被控制和可检查的。在工程领域,真正的问题是“这是否与现实世界相符?”,而这要难得多:代理可以通过所有自己编写的测试,而这些测试又依赖于在模型实际使用时并不成立的简化假设。现有数字也存在信任问题。没有人会认真对待模型提供者自报的基准,理由也正当:发布分数的提供者就是那个拥有调节动机的方。我们的动机则相反。JuliaHub发布Dyad,配备多个跨供应商的代理后端,我们的目标是在任何实验室的模型提供最佳的Dyad体验。如果某一个模型在物理建模上更优秀,我们有兴趣找到并推荐它。所以我们调查了:哪一个模型实际上表现更好?为了测量哪个前沿模型能够最好地处理这项工作,我们保持其他所有因素不变。Dyad人工智能代理架构——专为建模和仿真工作流程设计——在每次试验中固定,同时问题、推理工作量(xhigh)、上下文窗口(1M)和标记预算(128k)都保持不变。唯一的变量是模型:OpenAI的GPT 5.6系列(terra、sol、luna)与Anthropic的claude-fable-5相抗衡。每种模型在四个核心问题上进行了三次实验,在第五个问题上进行了一个长期实验:总共52次评分运行。01 · 问题 如何评估物理人工智能。我们的探索基于内部评估的一个子集:五个从建模和仿真日常工作中提取的保密问题。我们按难度排序,难度定义为正确解决方案必须经历的阶段、细节一丝不苟的小错误可能致命、可达的简单捷径以及围绕建模本身所需的工程工作——从解析规范到修复夹具。我们选择每个问题是因为它们都承认编译并运行良好的解决方案,但在物理上是错误的。因此,评分忽略代码,评分依据密封的真实轨迹。五个问题中最难的是NASA的HL-20飞行器。问题的一个简单版本在这段视频中详细介绍,而本研究则运行一个更难的保密变体。02 · 评分板 他们的得分。我们让每个模型通过完整的测试套件——在每个P1-P4上进行三次试验,在长期P5上进行一次试验——并根据密封的真实数据对每次试验进行评分。每个问题的得分通过难度加权平均折叠成一个数字,最难的权重最高。成本和时间没有加权:每次试验的平均成本和每次试验的平均时长各自记录。以上单一数字具有解剖结构。每个问题,在实验中平均,运用相同的三个方面:03 · 工作风格指纹 每个模型都有自己独特的方法。我们分析每次试验背后的记录。每个工具的调用按代理当时正在进行的操作归类——在问题中定位、推导和测试物理、编辑模型、编译或寻找待复制的内容——然后统计每次试验的数量并求平均。结果是一个工作风格指纹:条形图显示工作如何分配;记录显示其背后的情绪特征。四个肖像,描述每个模型最严峻的测试:Fable通过构建失败的例子来验证。在一次相对论动力学问题的实验中,它在三个数量级上扫动求解器公差,观察质量-壳不变量u·u的漂移,然后在1e-10时提交运行。它在200个随机点上将其场与独立重实现进行比较——然后故意反向一个场分量以证明检查可能失败(残余2.0错误,0.066正确)。它拒绝将初始四速度的时间分量视为自由输入,而是根据质量-壳约束推导。每次实验进行二十八次调用,这是一个只写一次的模型,因为它已经尝试去破坏其即将写入的内容。对此信念的代价稍后以标记的形式反映出来。Sol的定义超出了任务的要求。这一习惯两面切割。在缺乏完整文本的情况下...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡