将 GLM-5.3-Flash 转换为类似 Jev 的决策模型
2026年9月24日 使用概率为每个选项进行类型化决策,仅需一次前向传播:与 LLM 匹配 Jev 的准确性和速度。 Johannes Hötter VP Growth Marko Rosenmüller 博士 技术负责人 AI TL;DR: 在这篇文章中,我们展示了如何使用现成的 LLM 在一次前向传播中做出类型化决策。这种方法使得将 LLM 转变为类似 Jev 的决策模型成为可能。我们使用在 Privatemode 上运行的 GLM-5.3-Flash 评估该方法。通过使用从公共数据集中构建的基准,我们展示了该设置在决策准确性/正确性和速度方面提供的结果与 TypeSafe 的 Jev 相当。作为额外好处,GLM-5.3-Flash 的设置使得对图像的类型化决策成为可能,而这是 Jev 无法做到的。它的工作原理 操场 基准 为什么选择类型化决策 许多软件向 LLM 提出的请求都是一个决策。“哪个团队应该处理这个工单?”或“这份合同条款是否属于责任条款?”在这种情况下,软件通常要求 LLM 的响应遵循某种格式,例如 JSON,并且它来自于预定义的集合,例如“是”和“否”。在给定正确的指令时,LLM 通常可以可靠地满足这一要求。然而,在基本方法中,速度和成本问题变得突出:对于每个决策,LLM 需要写一个完整的 JSON 对象,而推理模型可能在此之前要考虑数百个标记。此外,您也不会了解到模型的信心(除非您明确询问)。所有这些方面在实践中可能非常重要,并且至今阻止了人们在高容量/高吞吐量场景中使用 LLM 进行决策。诸如 Jev 和 Laya 的专门决策模型(或“系统一”模型)旨在解决这个问题。您输入一个状态和一组命名选项,您将得到所选选项及其对应的置信值(即概率)。 将 LLM 转变为决策模型 起初,我们问自己:LLM 是否可以转变为具有类似 Jev 特性的决策模型?简短的回答是:“可以”。接下来,我们展示它的工作原理。要理解我们的方法,了解 LLM 的工作原理很重要:LLM 从来不会直接写文本。在给定提示的情况下,LLM 输出其整个标记词汇的概率分布。在文本生成中,在最简单的情况下,最高概率的标记被选择为下一个标记。然后,所选标记将附加到提示中,整个过程重复。如上所述,如果您只是想设置 JSON 对象中的几个字段,这种方式是成本高且缓慢的。我们的核心见解是,LLM 不必预测整个 JSON 对象,因为我们已经知道它的结构。我们只对 LLM 对于给定输入的类型化判断感兴趣。我们意识到,通过精心设计提示,可以使我们在 LLM 的一次运行中获得类型化判断—无需微调,模型完全按出厂设置工作。这与为此目的训练的 Jev 和 Laya 模型有所不同。基本步骤如下: 为选项编号。状态、问题和输出选项作为 JSON 输入提示,每个选项都有索引。指令要求模型以 choice_index: 后跟一个索引来回答。 预填答案。提示以 choice_index: 结束。因此,模型生成的第一个标记将是预定义选项的索引。 评估输出。我们不读取模型发出的标记,而是读取模型在该单一位置分配给所有选项索引的概率。对选项进行归一化后,这些概率为每个答案提供了一个概率,我们简单地选择最有可能的答案。在答案内部结束提示 用户 {"state": "我为我的订单被收取了两次费用.", "question": "哪个团队?", "options": [ {"index": 0 , "name": "支付"} {"index": 1 , "name": "投诉"} {"index": 2 , "name": "技术"} ]} 助手 choice_index: 读取一行 logits 0 1 2 …整个词汇 max_tokens: 1 temperature: 0 allowed_token_ids 保持选项,进行重新归一化 0 支付 62.1% 1 投诉 37.7% 2 技术 0.2% 答案 支付 置信度 0.39 ,其中 1 表示确定,0 表示选项同样可能 提示对选项进行编号,并且在助手的答案已经开始为 choice_index: 的情况下结束,因此下一个标记是索引。词汇上的掩码仅允许选项索引,API 返回它们的对数概率,归一化后为每个答案提供概率。中间面板中的对数值是说明性的。我们为在 vLLM(在 Privatemode 中)上运行的 GLM-5.3-Flash 实现了上述步骤。我们使用 /chat/completions 端点与 continue_final_message 以及 add_generation_prompt: false ,因为这些让模型可以继续步骤 2 中预填的助手回合,而不是启动新的助手回合。它们还允许我们在文本旁传递图像,这正是使对图像进行类型化决策成为可能的原因。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡