返回

文章详情

DFlash 2:保持并行草拟

Hacker News2026年8月19日 20:28

2026年8月18日,推理是代理时代的瓶颈。代理们阅读、计划并调用工具,常常需要几个小时或几天。他们以聊天从未接近的速度消耗令牌。每一个令牌都需要对模型进行一次完整的前向传递。在Inco AI,我们正在构建适应未来令牌经济的推理堆栈。本文是一个预览。我们的团队在1月发布了DFlash;它现在在SGLang、vLLM、TensorRT-LLM和llama.cpp中运行。NVIDIA在Blackwell GPU上测量到高达15倍的吞吐量;谷歌报告在TPU上每秒产生3倍于此的令牌;CoreWeave生产环境的Kimi K2.7代码端点,作为《人工分析》中该模型最快的选项,默认运行DFlash。生态系统现在以它为基础:NVIDIA、红帽公司和Modal都发布了DFlash草拟工具;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)和NVIDIA(Nemotron 3.5 Lightning)也与他们的模型一同发布了官方草拟工具。在Hugging Face上,DFlash模型的下载次数已超过350万次(截至2026年8月)。投机解码是现代推理堆栈的核心部分。一个小的草拟模型猜测一块令牌,目标模型在一次前向传递中验证整块。良好的猜测将一次传递转变为多个令牌;糟糕的猜测则会被丢弃。不过,多年来,草拟本身仍然保持自回归:每次一个令牌。DFlash使其变为一次性:整块所有位置并行预测。DFlash 2在苹果M5 Max上为Qwen3.8-27B进行草拟,与自回归解码并排进行。DFlash 2将并行草拟更进一步:每次验证传递的输出增加超过20%,大约增加1%的周期延迟,输出在证明上保持不变。通过基准,增益为16%至25%。随着今天发布的Qwen3.8-27B草拟工具,SGLang在批大小为1时的吞吐量是自回归解码的2.7-3.4倍。独立预测每个位置在两个地方留下了余地:选择正确的令牌和在块结束时保持准确性。DFlash 2在不放弃一次性设计的情况下恢复了这两者。立即运行 DFlash 2已经在主流推理引擎中运行: pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 pip install -U "vllm @ git+https://github.com/vllm-project/vllm.git@refs/pull/52816/head" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' git clone https://github.com/ggml-org/llama.cpp.git cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 # NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j # Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 下载并安装支持DFlash 2的预构建oMLX。要运行Qwen3.8-27B与DFlash 2:打开oMLX模型下载器并下载: mlx-community/Qwen3.8-27B-4bit incoai/Qwen3.8-27B-DFlash2 打开模型管理器并编辑mlx-community/Qwen3.8-27B-4bit。使用以下设置配置DFlash: DFlash :启用 草拟模型 :incoai/Qwen3.8-27B-DFlash2 草拟量化 :启用 运行时块大小 :5 验证模式 :dflash 保存设置并加载目标模型。正确的令牌已经在这里 DFlash独立并行预测每个位置。每个选择在其自身上都是合理的。然而,没有任何东西将它们结合在一起,而不连贯的块在验证时被缩短。最近的方法,如Domino和DSpark,通过时序头重写每个位置的全词汇分布来获得连贯性。但是,这种代价高昂的自回归修正真的必要吗?不。证据已经在DFlash自己的候选列表中。以第一个位置为例:DFlash的最佳选择在85.4%的情况下是正确的,但在99.5%的情况下,正确的令牌位于其前16个候选中。即使最佳选择错误,正确的令牌通常仍在列表中。 指标 0 1 2 3 4 5 6 接受长度 Recall@1 85.4% 80.3% 79.4% 78.3% 77.5% 75.9% 72.9% 4.27 Recall@16 99.5% 97.3% 94.8% 92.6% 90.8% 89.4% 87.8% 6.79 表 1. 在每个草拟位置,基于每个早期位置为正确条件, Recall@1(最佳选择正确的频率)和Recall@16(正确的令牌出现在前16个中的频率)。五层Qwen3-4B DFlash在GSM8K上。接受长度包括验证器的下一个令牌。一个总是从前16名中选择正确候选的神谕会将接受长度从4.27提升到6.79。这个差距就是纯选择余地。我们只需要选择正确的路径。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡