余烬-1
余烬-1:一半的令牌,相同的答案 余烬-1是Fireworks Research推出的新专业模型,以比Kimi K3少40%的令牌提供相同的质量。它建立在Kimi K3的基础上,学会了减少不必要的推理,同时保留重要的思维。我们在外部基准测试、实时客户A/B测试以及我们自己的编码和代理工作负载中进行了测试,结果在每种设置下质量都得到了保证。余烬-1现已推出,标志着Fireworks正在进行的一系列专业模型的启动,这些模型是根据开发人员的需求而塑造的。余烬只是使用Fireworks Training平台可以构建的开始。 Fireworks Research如何构建余烬-1 我们从用户那里了解到,他们需要以更低的成本获得K3的编码能力,因为其长时间的推理路径使得大规模自动编码成本高昂。降低K3的推理努力并没有解决这个问题。较低的努力设置会导致质量下降。为了保持质量并减少令牌数量,模型必须学会更有效地推理,而这意味着需要进行训练。实现这一目标需要严谨的研究。我们的团队进行了50多次训练实验和200多次评估,并在此过程中开发了新的训练算法,以缩短推理时间而不影响准确性。我们在Fireworks Serverless Training上完成了这一切。因为我们不需要配置或管理GPU,所以我们可以在有想法后立即启动实验,按实际运行的数量付费,并在通常时间和成本的一小部分内从研究转向发布。我们在一系列广泛的任务上进行了训练,以确保令牌节省能够应用于许多工作负载。然后,我们在专业智能指数、公开基准和实时生产流量上评估了余烬-1,以确认它的令牌使用量较少且质量没有下降。余烬-1是Fireworks自主研发的模型,也是Fireworks Research推出的一系列模型中的第一款。 问题:思考模型思考过多 像Kimi K3这样的推理模型将生成令牌的大部分时间,甚至超过90%,用于内部推理而不是答案本身。这种思维结构在单一请求时代价高昂,但在多轮代理工作负载中情况更糟。每一轮都将所有先前的推理重新传递回模型,因此随着轮数的增加,上下文大致呈现二次增长。早期轮次的长推理路径在每个后续调用中都会被重新读取(并重新收费)。所有这些推理真的有必要吗?我们的实验结果是否定的。Kimi K3产生的推理远远超过任务所需,并且可以在不触碰答案的情况下去除多余的部分。这就是我们创造余烬-1的方式,它是Kimi K3的一种经济版,建立在专业智能之上。 从观察到高级模型 并不是K3的所有推理都是浪费的。其中一部分是自我反思:重新审视假设、应对反馈或将结果追溯到早期决策可以帮助模型从错误中恢复。机会在于保留这种能力,同时减少不必要的推理,避免无效循环。我们相信,从任务和环境反馈中学习可以教会模型在维持其能力的同时更有效地推理。对于代理任务,这种学习贯穿整个交互过程。模型探索可能的行动,结合新的观察,并在进展中精炼其推理。反馈将决策与后果相连,鼓励在整个任务中进行有用的反思。我们将这些见解带入了覆盖数学、编码、遵循指令、对话、搜索、工具使用和软件工程的训练集合,涵盖独立问题和扩展交互,以强化对观察和结果的适应。 任务反馈指导政策规划和学习,强调在这一系列设置中保持能力。 公共基准和实时A/B测试的结果支持这一方向:在七个基准和两个客户的生产流量中,Kimi K3的推理可以缩短35-50%,而不牺牲准确性。内化的行为也显示在不成功的尝试中令牌使用受到控制,减少了冗长且无效的推理。 专业智能指数:余烬-1为床边基准设定了帕累托前沿 本周早些时候,我们推出了专业智能指数(SII),以基准测试开放、封闭和专业模型与行业专家创建的真实世界任务。我们在Doximity的床边基准上评估了余烬-1,这是一个医生验证的基准,涵盖了10个专业类别的500个临床案例。结果?余烬-1在成本/任务上为床边基准设定了新的帕累托前沿,超越了包括GPT-5.6 Sol、GPT-6 Astra和Claude Opus 5在内的开放和封闭模型。 图1:SII在床边基准上的帕累托前沿 图2:床边基准上的分数与持续时间图 SII评估在更多行业基准上的帕累托
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡