vLLM v0.28.0
v0.28.0 亮点 本次发布包含来自 270 位贡献者的 584 次提交(76 位新贡献者)!Kimi-K3 性能提升:对 Kimi-K3 进行全面优化的重大努力——解码上下文并行(DCP)支持(#50484),融合的 FlashKDA 解码和预填充内核(#50654,#51311,#52458),MegaMoE 支持 SiTU 激活(#50510),序列并行的 GEMM-RS(#52079),1.5~3 倍内核级加速的组合全收集(#51070),提供 ~60% 更好 DSpark TTFT 的自适应推测令牌预算(#51725),以及每个 GPU 节省 ~17 GiB 内存的可选共享专家分片(#50912)。Kimi-K3 现在还支持带有 V2 模型运行器的 ROCm(#51653)。DeepSeek V4:稀疏 MLA 现在可在普通解码、MTP 和 DSpark 推测解码中端到端工作(#51538),此外支持 AMD Quark NVFP4(#47972),推理努力提示和映射(#50580),稀疏 top-k 元数据内核优化(#52084,#51967),缩小的急切 CUDA 图区域(#51430,#52401),以及 gfx11 和 gfx950 上的 ROCm 启用(#47017,#52212)。推测解码进展:具有局部卷积和候选选择器的 DFlash2(#52816),DSpark 自信调度验证(#47808),为草稿模型启用异步调度(#48341)。模型运行器 V2 成熟:E/P/D 解耦(#38390),权重卸载(#51413),多层 MTP KV 缓存支持(#50062),编码器 CUDA 图(#49852),解码器逐令牌池化(#50931)以及 Transformers 池化模型(#52425),无注意力模型(#52374),和思考令牌预算支持(#46727)。分层 KV 缓存卸载:磁盘卸载支持(#49644),通过 module_path 的树外二级管理器(#51007),部分二级负载结果(#50321),分层指标(#48798),以及用于并行无关卸载的标准 CPU 布局(#48414)。Rust 前端 & gRPC:独立渲染器(#50289),通过 gRPC 进行多模态图像推理(#50368),显式数据并行排名路由(#51178),以及 RL 生命周期控制(#51316),protobuf 架构现在已发布到 Buf(#51276)。新默认值:max_num_batched_tokens 从 8192 提升到 16384(#51726),默认启用 Mamba 模型的前缀缓存(#50991),Blackwell CUDA 图捕获默认值提高到 1024(#49390)。重大更改:bitsandbytes 支持迁移到树外插件(#43529);Transformers 版本提升至 5.15.0(#51668);已弃用的 calculate_kv_scales 运行时 KV 比例计算已被移除(#49389);override_attention_dtype 已被移除(#48684)。发布文档 Python Wheels 平台安装 PyPI(CUDA 13.0) pip install vllm PyPI(CUDA 13.0,uv) uv pip install vllm --torch-backend=auto ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.28.0/rocm722 Docker 镜像 平台 Docker 镜像 CUDA 13.0(默认) docker pull vllm/vllm-openai:v0.28.0 ( v0.28.0-cu130 也可用) CUDA 12.9 docker pull vllm/vllm-openai:v0.28.0-cu129 CUDA 13.0 + Ubuntu 24.04 docker pull vllm/vllm-openai:v0.28.0-ubuntu2404 CUDA 12.9 + Ubuntu 24.04 docker pull vllm/vllm-openai:v0.28.0-cu129-ubuntu2404 ROCm docker pull vllm/vllm-openai-rocm:v0.28.0 CPU docker pull vllm/vllm-openai-cpu:v0.28.0 XPU docker pull vllm/vllm-openai-xpu:v0.28.0 其他文件 预构建的发布文档可在本页面底部的“资产”部分找到,包括:源分发压缩包 CUDA 12.9 的 x86_64 和 arm64 的 Python wheels CUDA 13.0 的 x86_64 和 arm64 的 Python wheels CPU 的 x86_64、arm64 和 macOS 的 Python wheels 模型支持 新模型:Muse Glimmer(#51655),Ling 3.0 Flash 支持 BF16、MTP 和解析器(#51045),此外还有 FP8 变体(#51265)和混合 MXFP4 路由专家(#52114),Dots3 NOTE 原生多模态支持(#51255),以及 Interns2mobius(#51149)。Qwen:Qwen3.8 在 AMD ROCm 上启用(#50068),为 Qwen3.5 GDN 提供融合 CUDA 后卷积 MTP 解码内核(#51674),GDN 门控与推测令牌对齐(#51812),以及 Qwen3.5 的文本仅检查点修复(#50734,#50355)。Transformers 模型后端:MLA 支持(#48250),硬件无关的模型定义(#49458),完全通用的输入嵌入处理(#51247),logit 软修整(#52173),以及强化的多模态路径(#51408,#51657)。LoRA:Gemma4 的视觉塔 LoRA(#42662),Keye(#51780)和 Ultravox(#48215)的塔/连接器 LoRA。视觉编码器:Kimi-K2.5 的完整 CUDA 图(#50929)和 Ernie-4.5-VL(#45254,#51461),针对 Qwen3-VL 编码器的 torch.compile(#40116),以及避免在 ViT 中长时间阻塞的 H2D 复制(#51841)。MoE:Mistral Large 3 的扩展 EPLB 支持和额外的 MoE 后端(#48355),CuTe DSL 瘦 GEMM 扩展到 GLM-5.2(#49791)。推测解码覆盖:KimiLinear 上声明的 EAGLE3 支持(#52171),Qwen3.6 dSpark 接受覆盖(#51310)。正确性:MiniMax-M3 NVFP4 推理(#48929)和压缩张量。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡