如果你的 AI 智能体每天都在重复调用工具、校验结果、整理输出,那么最强的推理模型未必是性价比最高的选择。Nemotron 3.5 Lightning 正是为这类执行环节打造:它是一款总参数量 30B、每个 token 只激活 3B 参数的 MoE 模型,NVIDIA 称其 token 生成速度最高可达 4 倍。不过,从自家基准来看,它在 12 项可比测试中有 11 项落后于 Qwen 3.6 35B-A3B。这正是它的取舍:不追求峰值推理能力,而是面向对速度和成本更敏感的智能体重复执行任务。需要注意的是,全精度 BF16 权重需要 80 GB GPU,NVIDIA 建议生产环境使用 NVFP4 checkpoint。
Nemotron 3.5 Lightning 的架构有何不同
Nemotron 3.5 Lightning 采用 NVIDIA 标记为 nemotron_h 的混合架构,将 Mamba-2 状态空间层、MoE 路由与选择性的注意力层交错组合。Mamba-2 层降低了长上下文注意力机制的内存和计算开销,因此 Lightning 能支持最高 100 万 token 的上下文窗口;根据模型卡说明,单张 H100 80GB 实际可用上限为 256K。这避免了纯注意力模型在长上下文下需承担的二次方成本。
| 规格 | 参数 |
|---|---|
| 总参数量 | 30B |
| 每个 token 激活参数量 | 3B |
| 架构 | Mamba-2 + MoE + Attention 混合架构 |
| 上下文长度 | 最高 100 万 token(单张 H100 为 256K) |
| 精度选项 | BF16、NVFP4 |
| 许可证 | OpenMDW v1.1(可用于商业用途) |
| 语言 | 英语、西班牙语、法语、德语、意大利语、日语,以及编程 |
| 预训练语料 | 20T+ tokens |
| 推理模式 | 可通过聊天模板中的 enable_thinking 开关控制 |
| 推荐采样参数 | Temperature 1.0,top-p 0.95 |
NVIDIA 将 Lightning 定位为Nemotron 3 系列中最小的成员。据官方介绍,它专门针对智能体框架中的行为训练,包括工具调用、输出校验、结果格式化和子智能体委派。复杂规划交给 Nemotron 3 Ultra 这类前沿推理模型,Lightning 则承担日常执行任务,避免把高价模型的 token 预算耗在重复操作上。
基准表现:优势在速度,短板在通用能力
HuggingFace 模型卡公布了 14 组基准数据,将 Lightning 与 Qwen 3.6 35B-A3B、Gemma 4 26B-A4B、Nemotron 3 Nano/Super 和 GPT-OSS 20B 对比。以下列出其中最值得用于决策的 10 项:
| 基准测试 | Nemotron 3.5 Lightning | Qwen 3.6 35B-A3B | Gemma 4 26B-A4B | GPT-OSS 20B |
|---|---|---|---|---|
| MMLU Pro | 81.94 | 85.63 | 85.20 | 76.40 |
| GPQA Diamond(无工具) | 75.44 | 83.40 | 79.61 | 71.46 |
| SWE-bench Verified | 51.56 | 70.12 | 57.40 | 52.44 |
| SWE-bench Multilingual | 39.33 | 63.40 | 43.40 | 41.93 |
| Terminal-Bench 2.1 | 24.58 | 44.38 | 37.22 | 15.17 |
| PinchBench | 85.37 | 88.07 | 74.70 | 57.20 |
| BrowseComp | 36.97 | 48.74 | 26.30 | - |
| IFBench(宽松模式) | 71.88 | 63.71 | 77.25 | 68.50 |
| AA-LCR | 52.00 | 61.06 | 57.56 | 32.88 |
| SciCode | 32.60 | 35.33 | 40.28 | 38.63 |
在 12 项可比项目中,Lightning 有 11 项不及 Qwen 3.6 35B-A3B。唯一的例外是IFBench,即宽松模式下的指令遵循测试:Lightning 得分 71.88,Qwen 为 63.71,领先 8 分。这与其智能体执行定位相符——面对工具调用格式和输出校验时,严格遵循指令的重要性往往高于纯粹的推理上限。
Lightning 真正拉开差距的是速度。在 NVIDIA 的PinchBench 评测中,10,000 个智能体任务以 H100 GPU 小时计量:Lightning 以 86% 的准确率约消耗 16.5 GPU 小时完成;Qwen 3.6 35B 以 87% 准确率需 23.5–24 GPU 小时;Gemma 4 26B 在 73% 准确率下需 25–26 GPU 小时:
在准确率近乎相当的前提下,这意味着约减少 30% 的计算量。如果你需要运行 10,000 个智能体步骤,并按 GPU 小时付费,这一差异非常可观。NVIDIA 还称,Lightning 在 Artificial Analysis 排行榜上可达到约 670 输出 tokens/秒,以及约 23–24 个 Intelligence Index 分,在总参数量低于 40B 的开放权重模型中位于帕累托前沿。
r/LocalLLaMA 社区测试也得出了相似的速度结论:一名 DGX Spark 用户报告,NVFP4 checkpoint 在仅目标生成时达到78.5 tokens/秒,启用推测解码后达到90.7 tokens/秒。另一位用户在主讨论帖中认为,Lightning 的质量“介于 Gemma 4 26B 和 31B 之间,且更接近 26B”;它的运行速度约为 Gemma 31B 的 2 倍,但会生成大量 thinking tokens,实际使用中会抵消部分速度优势。早期 GGUF Q4 转换版本的文件大小约为 25 GB,并出现未使用张量警告,表明混合 Mamba-2 架构可能尚未被所有基于 GGUF 的工具完整支持。
硬件门槛与本地部署选择
作为全精度参考权重的 BF16 checkpoint,单卡部署需要1 张 H100 80GB 或 1 张 A100 80GB,其分片 safetensors 文件大小为 65.8 GB。NVIDIA 明确建议生产推理使用独立发布的NVFP4版本。
| Checkpoint | 文件大小(约) | 最低 GPU 要求 | 适用场景 |
|---|---|---|---|
| BF16 | 65.8 GB | 1x H100/A100 80GB | 微调、研究、构建量化版本 |
| NVFP4 | ~16 GB | RTX 5090、DGX Spark、Jetson(Blackwell/Hopper/Ampere) | 生产推理、智能体部署 |
| GGUF Q4 | ~25 GB | 16 GB+ VRAM(社区构建) | llama.cpp、Ollama、LM Studio |
NVIDIA 为首日支持与四个本地推理项目合作:vLLM、SGLang、Ollama 和 llama.cpp,同时还提到了 LM Studio 与 Unsloth。该模型支持三种推测解码策略:
- DSpark:推荐用于 DGX Spark 和低并发数据中心推理
- DFlash:另一种草稿模型方案,效果取决于具体工作负载
- MTP(Multi-Token Prediction):模型内置方案,适合中高并发场景
如果不想自备硬件,Lightning 可通过 build.nvidia.com 以 NIM 微服务形式访问,也已上线 OpenRouter。NVFP4 checkpoint 可运行于 GeForce RTX 5090、DGX Spark、OEM GB10 系统和 NVIDIA Jetson。
智能体路由:Lightning 最能发挥价值的方式
NVIDIA 开源的路由库 NeMo Switchyard,会根据准确率、速度和成本,将智能体工作流中的每个步骤分配给最匹配的模型。规划任务上送至前沿推理模型,执行任务则下沉到 Lightning。NVIDIA 的内部基准称,Switchyard 在维持“前沿级”任务完成能力的同时,将成本降至仅使用 Opus 4.8 的约三分之一。被路由至 Lightning 的执行任务包括 git pull、校验工具输出、格式化结果和常规 API 调用。
这并不只是理论方案。CodeRabbit 在 Reddit 发布了一个真实案例:他们通过定向 SFT 加 RLVR(reinforcement learning with verifiable rewards,可验证奖励强化学习),对 Nemotron 3.5 Lightning 进行了代码审查路由后训练。在冻结的 1,000 项任务评估中,该模型超过了他们的基线,而训练成本低于 $100。NVIDIA 通过 NeMo Automodel 和 NeMo Megatron Bridge(LoRA/SFT)、NeMo RL 和 NeMo Gym(强化学习),以及名为 Nemotron-RL Agentic Terminal Pivot 的开放数据集支持这一工作流。
对于构建智能体流水线的团队,真正值得问的问题是:能否将 Lightning 微调到足以承担大部分智能体步骤,以每个 token 3B 激活参数的成本运行,只在少数必要环节调用前沿模型?
Nemotron 3.5 Lightning 值不值得用?
| 使用场景 | 推荐方案 | 原因 |
|---|---|---|
| 高频智能体路由(工具调用、校验、格式化) | Lightning NVFP4 | 3B 激活参数、4 倍 token 速度、相近准确率下约减少 30% 计算量 |
| 通用编程辅助 | Qwen 3.6 35B-A3B | SWE-bench Verified 为 70.12 对 51.56,领先 19 分 |
| 复杂推理 / 规划 | Nemotron 3 Ultra 或前沿模型 | Lightning 明确不是规划模型 |
| 消费级硬件上的单 GPU 本地聊天 | RTX 5090 上运行 Lightning NVFP4 | 可以运行,但 GGUF 转换仍较粗糙;vLLM/SGLang 更可靠 |
| 针对狭窄智能体任务进行微调 | Lightning BF16 | 3B 激活参数意味着微调成本更低;OpenMDW v1.1 允许商业使用 |
| 大规模指令遵循 | Lightning | IFBench 71.88 对 Qwen 63.71,领先 8 分 |
Lightning 用峰值准确率换取高吞吐执行速度。在一次会话有数百个智能体步骤时,30% 的计算节省会不断累积。不过,该模型于2026 年 8 月 11 日发布,生态成熟度仍在发展中。Mamba-2 混合架构意味着基于 GGUF 的工具可能尚未完全支持它。目前,如果使用 NVIDIA 硬件,搭配 vLLM 或 SGLang 部署 NVFP4 checkpoint 是最稳妥的路径;如果是 Apple Silicon 或仅使用 GGUF 的环境,建议等待社区的转换版本稳定下来。
常见问题
Nemotron 3.5 Lightning 能在消费级硬件上运行吗?
NVIDIA 仅支持在消费级硬件上使用 NVFP4 checkpoint。BF16 权重需要 80GB GPU,即 H100 或 A100。NVFP4 可运行于 GeForce RTX 5090、DGX Spark 和 NVIDIA Jetson。社区已有适用于 16 GB+ VRAM 系统的 GGUF Q4 转换版本,可供 llama.cpp 和 Ollama 使用,但早期版本曾报告 Mamba-2 混合架构的未使用张量问题。
Nemotron 3.5 Lightning 与 Qwen 3.6 35B 相比如何?
在已公布的 12 项基准中,Qwen 3.6 35B-A3B 有 11 项优于 Lightning,差距最大的项目是 SWE-bench Verified 和 Terminal-Bench。Lightning 在 IFBench 指令遵循测试中胜出,并且在智能体工作负载上以相近准确率实现约 30% 更快的任务完成速度。Qwen 是更强的通用模型;Lightning 则是更快的智能体执行模型。
Nemotron 3.5 Lightning 适合编程吗?
若看原始编程基准,答案是否定的:其 SWE-bench Verified 得分为 51.56,而 Qwen 3.6 为 70.12。不过,CodeRabbit 曾以低于 $100 的成本,成功将 Lightning 微调用于代码审查路由,并超过了其基线。该模型本身就是为定制化设计的:将其针对你的代码库规范进行微调后,它可以用每个 token 3B 激活参数的成本处理常规代码任务。
Nemotron 3.5 Lightning 使用什么许可证?
该模型采用 OpenMDW v1.1(Open Model Data Weight)许可证发布,NVIDIA 将其描述为“尽可能宽松地”发布。该许可证允许商业使用,覆盖权重、训练数据和训练配方。完整许可证条款可参阅 HuggingFace 模型卡。