返回

文章详情

SWE Atlas上的大黄瓜 - 代码库问答

Hacker News2026年8月16日 00:10

任务解决率:50.8% (63/124) - big-pickle,OpenCode Zen上的免费隐形模型,在Scale AI的SWE Atlas代码库问答基准上进行评估,使用mini-swe-agent脚手架。于2026-08-11在官方开源工具、任务数据和评估模型上运行。结果在上下文中与官方SWE Atlas问答排行榜(更新于2026-07-28)对比: 模型(脚手架) 任务解决率 Opus 5 (Claude Code, xHigh) 63.17 Opus 4.8 (Claude Code, xHigh) 57.26 big-pickle (Mini-SWE-Agent) - 本次运行 50.81 GLM 5.2 (Mini-SWE-Agent) 48.12 GPT-5.6-Sol (Codex, xHigh) 46.00 GPT 5.5 (Codex, xHigh) 45.43 在Mini-SWE-Agent脚手架类别中 — 同类比较 — 本次运行在官方排行榜上的每个条目得分更高,并且也超过了Codex脚手架的GPT条目。仅有两个运行在其原生Claude Code脚手架上的Claude模型得分更高。在将此视为排行榜等效数字之前,请注意下面的警告。 按语言 语言 解决率 TypeScript 18/31 58.1% Python 16/29 55.2% Go 19/38 50.0% C 10/26 38.5% 按类别 类别 解决率 代码入门 17/28 60.7% 架构与系统设计 23/44 52.3% 根本原因分析 17/37 45.9% 安全 5/11 45.5% API与库的使用/集成 1/4 25.0% 方法 一切尽可能按照Scale发布的协议进行: 任务:来自scaleapi/SWE-Atlas的所有124个代码库问答任务(Apache-2.0),未修改 - 包括Scale提供的mswea_qa_config.yaml代理配置(系统/实例模板,step_limit: 250)。 工具:Harbor v0.18.0与Modal沙箱,按照SWE-Atlas README。 脚手架:mini-swe-agent固定在2.4.6 — 与Scale在排行榜上使用的非首方模型相同的最小bash-only脚手架。 模型:通过OpenCode Zen的OpenAI兼容端点(https://opencode.ai/zen/v1),litellm路径openai/big-pickle。 总消耗:674M输入/4.3M输出tokens,费用为$0(该模型在隐形期间免费)。 评估:claude-opus-4-5-20251101 — Scale指定的确切评估模型 - 通过Anthropic的OpenAI兼容端点(https://api.anthropic.com/v1)访问,EVAL_MODEL被覆盖为bare Anthropic模型ID。 评分:基准的自定义评分标准,未修改。只有当每个评分必须的评估标准都通过时,任务才算解决。 警告 在引用该数字之前请阅读这些信息: 每个任务单次试验(-k 1)。正式协议执行3次试验并报告均值。在n=124时,单次试验的标准误差约为±4.5分 — 可与排行榜自己报告的误差条(±5)相比。 沙箱资源减少。任务声明为16 CPU / 16 GB;本次运行使用4 CPU / 8 GB以适应个人预算。较慢的命令执行只能降低代理的分数(通过命令超时或OOM杀死),而不能提高它。根据经验,这里似乎没有影响:对所有124个代理轨迹的扫描发现没有命令超时和没有exit-137的杀死 - 没有命令达到900秒上限或内存限制。 自我报告。Scale没有运行或验证此评估。该存储库中的每个任务验证器日志允许独立审计,并且该运行可以从这里的配置和公共SWE-Atlas存储库重现。 模型身份未知。big-pickle尚未正式确认;泄露的提供商错误和API响应签名表明它目前由DeepSeek基础设施提供。基础模型可能会在没有通知的情况下更改,因此该结果是2026-08-11时背后别名的快照。 数据曝光。OpenCode声明在其免费期间对big-pickle的提示可能用于改进模型。基准的任务内容(已公开,由Scale标示)必然发送到该端点。两个已解决任务有未评分的评估标准。在任务-...ba9ad(11个评估标准中的5个)和任务-...baa1d(1个评估标准)中,评估者通过所有8次重试返回不可解析的输出;根据设计,基准的验证器将未评分的评估标准从通过计算中排除。将未评分视为失败则严格下限为61/124 = 49.2% — 仍高于每个Mini-SWE-Agent排行榜条目。所有验证器日志均已包含,因此您可以应用任一约定。 重现命令 git clone https://github.com/scaleapi/SWE-Atlas && cd SWE-Atlas git clone --branch v0.18.0 --depth 1 https://github.com/laude-institute/harbor.git uv tool install ./harbor --with modal && uv tool install modal && modal setup # 从此存储库:复制run_config/qa,run_config/tw,run_config/rf到 # SWE-Atlas/run_config/(保留子目录 — 脚本解析 # .env和Scale的mswea_*_config.yaml相对于其自身位置), # 复制preflight.sh和.env.example到SWE-Atlas根目录, # 从.env.example创建.env,然后: # ./preflight.sh # bash run_config/qa/big-pickle_smoke.sh # 三任务烟雾测试第一 # bash run_config/qa/big-pickle_miniswe.sh # 完整的124个任务运行 艰难的注意事项配置已经处理: 不要传递 --ak reasoning_effort 与openai/-pre

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡