介绍Toast 1
Toast 1,我们首个专门的搜索代理,今天推出。它提供前沿搜索质量,匹配或超过Claude Opus 5和GPT-5.6 Sol,同时价格高达便宜10倍,速度快12倍。它在Mixedbread Search中效果最佳,但也可以与任何搜索后端合作。如今,前沿模型能够执行真正的知识工作。它们可以推理、分析并在复杂文档集合中查找信息。但它们也是堆栈中最昂贵的模型。随着智能需求的不断增加,能够以较低成本匹配其能力的专门代理需求比以往任何时候都更强烈。Toast 1可以作为独立的专门检索代理运行,或作为您前沿模型已经依赖的众多子代理之一。它完全接管搜索循环:给定初始查询,它将其分解为子查询,收集证据,检查来源,并在返回之前策划相关上下文。这使得您的代理可以在需要通才、前沿级别模型的任务上支出其上下文和计算能力:推理、行动和生成最终答案。Toast 1代理搜索的瀑布追踪:在刚超过5秒的时间内,回答了一个就业率比较查询,进行了16次工具调用,跨越3轮。扩展追踪,然后选择一步查看此时生成的子查询、grep模式或计划。代理劳动的这种专业化导致搜索成本大大降低,同时在许多现实任务上获得更好的端到端结果。我们发现,Toast 1在每个任务成本和每个任务速度的代理工作负载中建立了一个新的帕累托前沿。金融分析:OfficeQA Pro V2链接至部分OfficeQA Pro V2,由Databricks发布,评估在复杂的企业金融场景中90个问题的答案准确性。在Codex中以子代理身份提供的GPT-5.6 Sol达到了约1.15美元每任务的70%答案准确性:这是Databricks在OfficeQA v2发布中评估的系统中的最高得分,树立了质量和效率的新一流表现。OfficeQA Pro V2上的答案准确性与每个回合的成本的散点图,采用对数尺度成本。运行于Codex中的GPT-5.6 Sol,使用Toast 1作为子代理,在约1.20美元每任务的情况下达到70%准确率,超过Databricks评估中的前一个帕累托前沿,其中Claude Fable 5在Databricks Genie上以约4美元的价格达到了60%准确率。在OfficeQA Pro V2上答案准确性与每个回合的成本的比较。Genie和harness的数字由Databricks报告;Codex + Toast 1的运行为我们所为。阴影区域位于前一个帕累托前沿之下。相比之下,之前的最佳表现者,Claude Fable 5在Databricks Genie上以约4美元的任务达到了60%准确率,而在Codex中没有Toast 1的GPT-5.6 Sol仅达到了33%的准确率。这种改进源于证据收集经济学的重新格式化。Toast 1的专业化使其能够生产高质量、令牌效率高的证据包,为推理过程留出充足的资源来得出最终答案。法律代理基准 - 法律知识链接至部分Harvey LAB的律师事务所知识基准旨在评估代理在大规模、现实性的法律知识搜索和使用的能力。法律工作本质上是重视上下文的。你不能用更好、更相关的先例和细节去驳斥某人。但它也很嘈杂:许多情况相似,但细节上略有差异,导致在没有大量错误积极性的情况下难以收集高质量的证据包。在随机选择的33个任务子集上,我们发现GPT-5.6 Sol的答案质量在搜索方法间保持恒定。Harvey LAB法律知识基准上使用的总令牌数的条形图。一个普通代理在每个任务中使用了8060万个令牌,21.7次回合。添加Mixedbread Search将其削减了42%,降至4700万个令牌,14.6次回合。将Toast 1作为子代理添加进一步削减51%,降至2300万个令牌,11.2次回合。这三种配置达到了相同的任务得分为55,因此最终结果是在3.5倍更少的令牌下达到相同的性能。令牌为33个任务基准的总计;回合为每个任务的代理循环迭代。然而,提升搜索质量极大地提高了令牌效率:用Mixedbread Search替换普通代理的文件系统搜索将令牌使用量从8060万削减到4700万,得分相同。随后,将Toast 1作为专用搜索子代理再一次减少到2300万,并让它在普通代理所需的回合数的一半内完成。由Mixedbread Search驱动的Toast 1的引入保持了答案质量,同时消耗了3.5倍更少的令牌,导致超过60%的成本减少。Toast 1解放了上下文窗口。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡