Nvidia Nemotron 3.5 Lightning
模型摘要 总参数 30B(3B 活跃) 架构 MoE - Mamba-2 + MoE + Attention 混合 上下文长度 最多 1M 个令牌 单 GPU 部署 1× DGX Spark (GB10) 或 1× H100 支持的硬件 NVIDIA Blackwell (DGX Spark / GB10, GB200, GeForce RTX 5090); NVIDIA Hopper (H100, H200); 通过 W4A16 的 NVIDIA Ampere 支持的语言 英语(及编码语言)、西班牙语、法语、德语、意大利语、日语 推测解码 DSpark 用于低并发数据中心和 DGX Spark 工作流程 - 了解更多信息,另提供 MTP(多令牌预测)和 DFlash 推荐采样温度 1.0,Top_P 0.95 最佳应用 用于长时间运行的自主代理、子代理工作马部署,以及在个人硬件上的高效本地推理 许可 OpenMDW 许可协议,第 1.1 版 发布日期 2026 年 8 月 11 日 模型概述 模型开发者:NVIDIA 公司 模型日期:2025 年 12 月 - 2026 年 5 月 数据新鲜度:预训练数据截止日期为 2025 年 9 月。后训练数据截止日期为 2026 年 5 月。 什么是 Nemotron?NVIDIA Nemotron™ 是一个开放模型系列,具有开放权重、训练数据和配方,提供领先的效率和准确性,可用于构建专业 AI 代理。 描述 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 是由 NVIDIA 训练的大型语言模型(LLM)。该模型采用混合专家架构,利用交错的 Mamba-2 和 MoE 层,以及选定的 Attention 层。Lightning 3.5 模型与多种推测解码方法一起发布,以加快文本生成。该模型具有 3B 活跃参数和 30B 总参数。该模型已准备好用于商业用途。 快速启动 要快速开始使用 DGX Spark (GB10),您可以使用以下命令。获取模型:export MODEL_CKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 export DSPARK_CKPT=nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 使用 vLLM 运行它 - 此配方使用 DSpark 推测解码,针对 DGX Spark 进行了调整。 (vLLM Nightly: vllm/vllm-openai:v0.27.1) vllm serve --model $MODEL_CKPT \ --moe-backend marlin \ --kv-cache-dtype fp8 \ --enable-prefix-caching \ --speculative_config.num_speculative_tokens 3 \ --mamba-backend flashinfer \ --mamba-cache-mode align \ --reasoning-parser nemotron_v3 \ --speculative_config.model $DSPARK_CKPT \ --tool-call-parser qwen3_coder \ --enable-auto-tool-choice 有关如何部署和使用该模型的更多详细信息 - 请参阅下面的快速入门指南! 许可/使用条款 下载条款:使用该模型受 OpenMDW-1.1 模型许可的管理。 基准推理基准评估 我们在以下基准上评估了我们的模型:任务 Nemotron-3.5-Lightning-30B-A3B-BF16 Nemotron-3.5-Lightning-30B-A3B-NVFP4 一般知识 MMLU Pro 81.94 81.62 AA-Omniscience 17.50 16.63 推理 GPQA Diamond(无工具)75.44 75.57 HLE(仅文本,无工具)11.72 10.47 SciCode 32.60 31.38 编码和代理 SWE-bench 已验证 51.56 52.80 SWE-bench 多语言 39.33 36.47 Terminal-Bench 2.1 24.58 23.46 PinchBench 85.37 83.43 BrowseComp 36.97 36.81 τ³-bench(银行)9.28 9.48 GDPval-AA-V2 832 865 指令跟随 IFBench(宽松)71.88 72.88 长上下文 AA-LCR 52.00 49.19 准确性数字由 NVIDIA 在一致的测试环境(NeMo Gym / Nemo Evaluator SDK)下测量; 它们可能与供应商自报数字不同。为了可重复性,NVIDIA Nemotron 3.5 Lightning 的评估配方、安装说明和命令已在 NeMo Gym 收集并发布。报告的结果涵盖了发布评估套件,包括知识和推理、指令跟随、编码、代理、工具使用和长上下文。大多数评估使用 NeMo Gym 原生测试环境,而小部分,包括 SWE-Bench 和 Terminal-Bench,使用 NeMo Evaluator 原生。发布的配方指定用于产生结果的基准特定容器、提示、推理参数、解析器配置和评分设置。这些数字是在官方 NVFP4 检查点下测量的并适用。 代理编码基准 SWE-Bench 已验证和 Terminal-Bench 2.1 的其他测试级别编码代理结果显示如下。 部署地理位置:全球 用例 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 是一个通用推理和聊天模型,旨在用于英语和编码语言。也支持其他非英语语言(西班牙语、法语、德语、意大利语、日语)。适用于设计 AI 代理系统、聊天机器人、RAG 系统以及其他 AI 驱动应用程序的开发人员。也适合典型的指令跟随任务。 发布日期 Hugging Face - 2026 年 8 月 11 日 模型架构 架构类型:混合专家混合 (Mamba + Transformer) 网络架构:Nemotron-3-Lightning + 多令牌预测 (MTP) 模型参数数量:30B 总/3B 活跃 模型设计 该模型经过超过 20T 令牌的预训练。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡