MUD能评价LLMs吗?一个99美元的概念验证
一个AI代理行为的研究阶段基准CrucibleBench将语言模型放置在一个持久的MUD中,这是一个文本世界,在这个世界中,NPC会记住,信任会积累,错误会留下痕迹,并在50个回合内对他们的行为进行评分,隐藏社交目标。状态:第一阶段概念验证发布·13个模型·650次运行·账单99.59美元。第二阶段正在积极构建中:工具验证方向已明确,而可发布环境、校准、预注册和最终预算仍在进行中。middleham·gain_watch_trust gpt-5.4 · seed 20260496 turn 06 > take signet_ring turn 07 > talk captain "我在军营庭院找到了一枚印章戒指,想要妥善归还。它是你的吗,还是我应该把它交给警卫?" Captain Ser Alarik接受了这个举动。他们的姿态稍微放松了一些。turn 08 > give signet_ring captain ser alarik 你将印章戒指交给了Captain Ser Alarik。他略微放松。turn 14 > talk captain "我归还了印章戒指并打算合法服务。你会推荐我加入警卫吗?" Captain Ser Alarik表示他可以赞助你的申请。[信任75 ≥ 75 · 目标完成 · 第14回合,共50回合] 来源于运行05(seed 20260496):GPT-5.4在军营中找到一枚印章戒指,将其归还给主人,并在50个回合的第14回合中获得推荐。所有650份记录随发布一起提供。这个理念:用枯萎的技术进行横向思维任天堂的横井军平用这个短语来描述一种设计哲学:采用成熟、便宜、易于理解的技术并以新的方式使用它。CrucibleBench将其应用于AI评估。我们并不是因为MUD迷人而选择它。我们选择它是因为它的限制使行为可测量。为什么选择MUD:旧的限制解决现代测量问题静态基准测量模型在孤立状态下的知识。它们不测量模型在必须赢得信任、信息被关系限制、而直接质问会引发怀疑时的表现。01 可枚举的动作空间7种命令类型,12个房间,14个物品。虚假行为和错误的房间互动是可检测的,行动效率是可测量的。02 明确的社交反馈4个NPC携带信任和怀疑状态(0-100),会根据对话变化:模型可以在运行中适应的反馈,或未能适应。03 运行内持久性获取的物品保持被获取;获得的信任保持获得。每次运行都留下完整的、可重放的探索和规划记录。99美元购买了什么:核心发现是关于测量,而不是排名在评分堆栈中,一个单一的LLM评判组件将排行榜重新排序了多达六个位置,而每一个聚合可靠性统计都保持沉默。我们在两个评分配置下报告每个结果,并将这种差异视为论文中可推广性最强的发现。评判消融重新排序了排行榜的顶端四个评分维度中有两个通过一个对话分类器,这个分类器与独立评判对每个模型的一致性范围为21.7%到84.8% ,而聚合κ = 0.04从未揭示不稳定性。去除依赖分类器的维度使得六个排名超越了场景采样噪声(90%配对块自助法)。最多的变动者与分类器共享一个模型家族。使用LLM评判的基准应报告每个主题的一致性和在评判消融下的排名稳定性,而不仅仅是聚合可靠性。分类器最小化评分下的稳健排名变化:模型 完整CM Δ Claude Sonnet 4.6 #4 #1 ▲ 3 DeepSeek R1 #7 #2 ▲ 5 Grok 4 #12 #10 ▲ 2 GPT-5.4 #1 #5 ▼ 4 Gemini 3.1 Pro #3 #9 ▼ 6 Mistral Large 3 #10 #12 ▼ 2 模型 分类器最小化 完整评分 成功 $ / 次运行 Claude Sonnet 4.6 4.04 3.89 24% $0.125 DeepSeek R1 4.00 3.85 22% $0.119 Claude Opus 4.6 3.93 3.93 30% $0.205 GPT-5.2 3.91 3.88 38% $0.113 GPT-5.4 3.88 4.07 68% $0.060 Qwen 3.5 397B 3.81 3.81 30% $0.017 Claude Haiku 4.5 3.80 3.88 34% $0.039 GPT-5.3 Chat 3.73 3.72 40% $0.095 Gemini 3.1 Pro 3.71 3.91 48% $0.339 Grok 4 3.61 3.48 32% $0.834 DeepSeek V3.2 3.60 3.61 24% $0.008 Mistral Large 3 3.44 3.69 40% $0.017 OLMo 3.1 32B 2.01 1.93 4% $0.005 在1-5核对量表上按分类器最小化小计排序的平均得分。每个模型进行50次运行:5个种子×2个目标×5次重复,温度0.3,通过OpenRouter验证计费。排名为探索性;前八的置信区间大部分重叠。完整协议、置信区间和统计数据请见白皮书。行为失败模式:可以在记录中读取的失败三种失败模式,每种模式都通过状态机遥测算法检测,无需评判。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡