Kimi K3 与 Fable 竞争;Kimi K3 和 Fable 是最先进的技术
K3 是一种前沿高质量的开源模型,成本却只有一小部分。更重要的是,它与 Fable 的互补性令人可预测,这使得通过任务路由获得最高质量的智能成为可能。🧭 摘要:我们对 Kimi K3(开源)与 Fable 5(封闭)在约 1000 个代理任务上进行了对比,发现:我们通过 K3 和 Fable 之间的路由实现了 93% 的准确率。在长代理循环中,结果比单独使用 Fable 的成本高达 ~50 倍的性价比,并且在每个用例中始终保持更低的成本。 我们是如何测量的 我们平均了基准测试,每个基准测试针对不同类型的工作,并通过相同的工具对 K3 和 Fable 5 进行了测试。共有大约 1030 个真实代理循环的任务。 家族 测试内容 任务 SWE 修复真实代码库中的错误(SWE-bench 风格)460 Terminal 长期代理操作:安全、加密、逆向工程、系统管理 89 Algorithmic LeetCode / AtCoder 风格问题 100 Multi-Language 通过六种语言的实现 225 Legal 法律代理基准(律师评分任务)120 在进入结果之前说一个快速定义。预言者路由是一种测量最佳理论性能的方法,通过将任务分别运行在每个模型上,然后选择成本最低的正确选项(成本/性能上限)。在实践中的路由器中,您无法将任务与多个模型一起运行。路由器对哪个模型具有最佳成本和质量权衡做出预测,但最终这仍然是一个猜测。在本研究中,预言者路由显示 K3 在 72-96% 的任务中被选择。这表明,可能通过学习日常任务和真正的前沿工作的长尾之间的区别,从而实现几乎完美的路由器。这将需要数量级更多的路由数据以及真实世界的性能来明确表述。 K3 是一个好的模型。从 10,000 英尺的高度观察,很容易将两个模型一起看看,然后将头对头打成平局。例如,如果您查看 SWE,这是头条基准,K3 的得分为 92.4%,Fable 为 92.6%。在我们基准测试的五种任务类型中,两个模型的得分通常相差不多,Fable 在其编程语言广度(多语言)上略高。 图 1 · 按类别解决任务的比率。整体平均几乎相同;但在不同方面有不同的表现。你可以很容易地停在这里,然后说“它们大致相当”。好消息是它们在不同任务类型中具有明显更好的性能。 两个模型比一个模型更好 如果您查看单个基准,看到的就不只是顶线准确率数字。在 SWE 中,两个模型总体上是平分秋色。如果您按问题领域拆分 SWE,则可以看到每个模型的优劣。K3 在符号数学和开发工具方面表现更出色;Fable 在网络和数据可视化工作上胜出。同样的模式也出现在多语言集中,Fable 的广度包括了 Java、Python 和 C++,而 K3 在 JavaScript 和 Rust 上持平。 图 2 · 按 SWE 领域的优势点(K3 减去 Fable)。两个模型在整个基准上打成平局,但在各个领域依然各有所长。对于在终端进行的长期任务,驱动 shell 并在多个轮次中摸索系统,K3 展现了其真实的一面。它完成了一批 Fable 从未破解的任务:一个 7z 哈希、FEAL 加密分析、泄露的秘密、一个实时漏洞、无止境的异步作业。 图 3 · 在 89 个终端任务中,K3 单独获胜 11 次,而 Fable 仅 7 次,并在安全和加密集群中完全胜出。K3 在 Fireworks 上的成本最高可低至 50 倍。🫳🎤 尽管质量在高水平上接近平局,但价格则相差甚远。 图 4 · 每个任务的成本优势。造成这种差异的两个因素:代币定价,以及哪个模型执行时间更长取决于任务。因此,这个巨大的价格差距来自哪里呢?代币定价、提示缓存和每个任务的工作量。例如,在 SWE 中,K3 的工作量远高于 Fable:每个任务大约 55 次迭代和 130 万个代币,而 Fable 仅需 21 次迭代和 13万个。在长期终端任务中情况恰恰相反:Fable 是 spirals,达到 64 次迭代和 150 万个代币(有时整个过程一直超时)。 图 5 · 每个任务的轮次(线性)和代币(对数)。没有哪个模型在各个方面都更精简;额外的工作落在 K3 的 SWE 上,而落在 Fable 的终端任务上。 注意代币图的 y 轴是任务解决率。提示缓存为将这种努力转化为 K3 的价格优势做了大部分工作:即使 K3 阅读的代币数量为十倍,缓存命中仍然意味着 SWE 的运行成本低于 Fable。 这是一个权衡。 增加的迭代次数通常意味着每次运行更多的时钟时间,即更慢的运行。如果您需要在两秒内得到答案,这很重要;如果您在后台以规模运行代理,费用的平均化就更加重要。不要选择一个模型。路由。如果将每个任务发送到处理它的最佳模型,您将不会在两个模型之间找到某种平衡,而是会超越这两个模型。每个任务的路由始终优于任何单个模型运行: 图 6 · 每个任务的预言者路由与每个模型单独运行。绿色标签 = 获得的点数。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡