展示 HN: Echo – 以三分之一的成本获得类似 Fable 的结果,使用开放权重模型
我正在构建 Echo (https://echo.tracerml.ai/),这是一个将开放权重模型池转化为一个 AI 系统的实验,而不是选择单一模型并为每个任务使用它。该实验始于一个简单的实验。我取了一组模型,包括 GLM-5.2、Kimi K2.7 和其他模型,并对它们进行了相同的评估。然后,我测量了如果在每个问题上,你 somehow 事先知道哪些模型会有用以及如何组合它们的输出,将会发生什么。那个假设的系统在池中的任何单一模型中表现得好得多。当然,这并不是一件实际可用的事情,因为它依赖于在看到结果后知道哪些决策是好的。Echo 是我试图在没有提前获得这些信息的情况下恢复一些优势的尝试。对于每个请求,Echo 决定分配多少计算,哪些模型应参与,以及如何组合它们的工作。一些提示可能只需要相对少量的推理,而其他提示则需要多个模型在问题的不同部分工作。在构建它的过程中让我惊讶的一件事是模型之间的互补性。一个整体上明显较弱的模型,在特定问题上仍然可以非常有用或作为组合的一部分。在我第一次评估的组合中,Echo 的表现始终优于池中最好的单一模型。它还达到了与 Fable 大致相同的总结果,我将其用作一个更强的比较系统,推理成本大约为其三分之一。虽然仍然存在一些情况下,Echo 会做出错误的分配或组合决策。如今,我正在花很多时间理解这些失败,以及测试这种方法在编码和代理任务中的效果,因为在这些情况下测量每个决策的质量变得更加困难。我构建了一个聊天接口 (echo.tracerml.ai) 和一个兼容 OpenAI 的 API (https://echo.tracerml.ai/docs/api),以便可以在评估设置之外测试该系统。这里有一个关于它如何工作的简短/高层次视频:https://www.youtube.com/watch?v=lJFJSvOdXhg 我在这里写下了评估方法、单个模型结果、成本和当前限制:https://echo.tracerml.ai/eval 我希望你能试试它!特别是当你遇到任何奇怪的失败案例或分配看起来不直观的地方时。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡