AIREITER

Nemotron 3.5 Lightning:为智能体速度而生的 30B MoE 模型

最后更新: 2026-08-11 19:02:52

如果你的 AI 智能体每天都在重复调用工具、校验结果、整理输出,那么最强的推理模型未必是性价比最高的选择。Nemotron 3.5 Lightning 正是为这类执行环节打造:它是一款总参数量 30B、每个 token 只激活 3B 参数的 MoE 模型,NVIDIA 称其 token 生成速度最高可达 4 倍。不过,从自家基准来看,它在 12 项可比测试中有 11 项落后于 Qwen 3.6 35B-A3B。这正是它的取舍:不追求峰值推理能力,而是面向对速度和成本更敏感的智能体重复执行任务。需要注意的是,全精度 BF16 权重需要 80 GB GPU,NVIDIA 建议生产环境使用 NVFP4 checkpoint。

Nemotron 3.5 Lightning 的架构有何不同

Nemotron 3.5 Lightning 采用 NVIDIA 标记为 nemotron_h 的混合架构,将 Mamba-2 状态空间层、MoE 路由与选择性的注意力层交错组合。Mamba-2 层降低了长上下文注意力机制的内存和计算开销,因此 Lightning 能支持最高 100 万 token 的上下文窗口;根据模型卡说明,单张 H100 80GB 实际可用上限为 256K。这避免了纯注意力模型在长上下文下需承担的二次方成本。

规格参数
总参数量30B
每个 token 激活参数量3B
架构Mamba-2 + MoE + Attention 混合架构
上下文长度最高 100 万 token(单张 H100 为 256K)
精度选项BF16、NVFP4
许可证OpenMDW v1.1(可用于商业用途)
语言英语、西班牙语、法语、德语、意大利语、日语,以及编程
预训练语料20T+ tokens
推理模式可通过聊天模板中的 enable_thinking 开关控制
推荐采样参数Temperature 1.0,top-p 0.95

NVIDIA 将 Lightning 定位为Nemotron 3 系列中最小的成员。据官方介绍,它专门针对智能体框架中的行为训练,包括工具调用、输出校验、结果格式化和子智能体委派。复杂规划交给 Nemotron 3 Ultra 这类前沿推理模型,Lightning 则承担日常执行任务,避免把高价模型的 token 预算耗在重复操作上。

基准表现:优势在速度,短板在通用能力

HuggingFace 模型卡公布了 14 组基准数据,将 Lightning 与 Qwen 3.6 35B-A3B、Gemma 4 26B-A4B、Nemotron 3 Nano/Super 和 GPT-OSS 20B 对比。以下列出其中最值得用于决策的 10 项:

Nemotron 3.5 Lightning、Qwen 3.6、Gemma 4 与 GPT-OSS 在五项关键基准上的对比
基准测试Nemotron 3.5 LightningQwen 3.6 35B-A3BGemma 4 26B-A4BGPT-OSS 20B
MMLU Pro81.9485.6385.2076.40
GPQA Diamond(无工具)75.4483.4079.6171.46
SWE-bench Verified51.5670.1257.4052.44
SWE-bench Multilingual39.3363.4043.4041.93
Terminal-Bench 2.124.5844.3837.2215.17
PinchBench85.3788.0774.7057.20
BrowseComp36.9748.7426.30-
IFBench(宽松模式)71.8863.7177.2568.50
AA-LCR52.0061.0657.5632.88
SciCode32.6035.3340.2838.63

在 12 项可比项目中,Lightning 有 11 项不及 Qwen 3.6 35B-A3B。唯一的例外是IFBench,即宽松模式下的指令遵循测试:Lightning 得分 71.88,Qwen 为 63.71,领先 8 分。这与其智能体执行定位相符——面对工具调用格式和输出校验时,严格遵循指令的重要性往往高于纯粹的推理上限。

Lightning 真正拉开差距的是速度。在 NVIDIA 的PinchBench 评测中,10,000 个智能体任务以 H100 GPU 小时计量:Lightning 以 86% 的准确率约消耗 16.5 GPU 小时完成;Qwen 3.6 35B 以 87% 准确率需 23.5–24 GPU 小时;Gemma 4 26B 在 73% 准确率下需 25–26 GPU 小时:

PinchBench 散点图:10,000 个任务下的智能体准确率与 GPU 小时对比

在准确率近乎相当的前提下,这意味着约减少 30% 的计算量。如果你需要运行 10,000 个智能体步骤,并按 GPU 小时付费,这一差异非常可观。NVIDIA 还称,Lightning 在 Artificial Analysis 排行榜上可达到约 670 输出 tokens/秒,以及约 23–24 个 Intelligence Index 分,在总参数量低于 40B 的开放权重模型中位于帕累托前沿。

r/LocalLLaMA 社区测试也得出了相似的速度结论:一名 DGX Spark 用户报告,NVFP4 checkpoint 在仅目标生成时达到78.5 tokens/秒,启用推测解码后达到90.7 tokens/秒。另一位用户在主讨论帖中认为,Lightning 的质量“介于 Gemma 4 26B 和 31B 之间,且更接近 26B”;它的运行速度约为 Gemma 31B 的 2 倍,但会生成大量 thinking tokens,实际使用中会抵消部分速度优势。早期 GGUF Q4 转换版本的文件大小约为 25 GB,并出现未使用张量警告,表明混合 Mamba-2 架构可能尚未被所有基于 GGUF 的工具完整支持。

硬件门槛与本地部署选择

作为全精度参考权重的 BF16 checkpoint,单卡部署需要1 张 H100 80GB 或 1 张 A100 80GB,其分片 safetensors 文件大小为 65.8 GB。NVIDIA 明确建议生产推理使用独立发布的NVFP4版本。

Checkpoint文件大小(约)最低 GPU 要求适用场景
BF1665.8 GB1x H100/A100 80GB微调、研究、构建量化版本
NVFP4~16 GBRTX 5090、DGX Spark、Jetson(Blackwell/Hopper/Ampere)生产推理、智能体部署
GGUF Q4~25 GB16 GB+ VRAM(社区构建)llama.cpp、Ollama、LM Studio

NVIDIA 为首日支持与四个本地推理项目合作:vLLM、SGLang、Ollama 和 llama.cpp,同时还提到了 LM Studio 与 Unsloth。该模型支持三种推测解码策略:

  • DSpark:推荐用于 DGX Spark 和低并发数据中心推理
  • DFlash:另一种草稿模型方案,效果取决于具体工作负载
  • MTP(Multi-Token Prediction):模型内置方案,适合中高并发场景

如果不想自备硬件,Lightning 可通过 build.nvidia.com 以 NIM 微服务形式访问,也已上线 OpenRouter。NVFP4 checkpoint 可运行于 GeForce RTX 5090、DGX Spark、OEM GB10 系统和 NVIDIA Jetson。

智能体路由:Lightning 最能发挥价值的方式

NVIDIA 开源的路由库 NeMo Switchyard,会根据准确率、速度和成本,将智能体工作流中的每个步骤分配给最匹配的模型。规划任务上送至前沿推理模型,执行任务则下沉到 Lightning。NVIDIA 的内部基准称,Switchyard 在维持“前沿级”任务完成能力的同时,将成本降至仅使用 Opus 4.8 的约三分之一。被路由至 Lightning 的执行任务包括 git pull、校验工具输出、格式化结果和常规 API 调用。

这并不只是理论方案。CodeRabbit 在 Reddit 发布了一个真实案例:他们通过定向 SFT 加 RLVR(reinforcement learning with verifiable rewards,可验证奖励强化学习),对 Nemotron 3.5 Lightning 进行了代码审查路由后训练。在冻结的 1,000 项任务评估中,该模型超过了他们的基线,而训练成本低于 $100。NVIDIA 通过 NeMo Automodel 和 NeMo Megatron Bridge(LoRA/SFT)、NeMo RL 和 NeMo Gym(强化学习),以及名为 Nemotron-RL Agentic Terminal Pivot 的开放数据集支持这一工作流。

对于构建智能体流水线的团队,真正值得问的问题是:能否将 Lightning 微调到足以承担大部分智能体步骤,以每个 token 3B 激活参数的成本运行,只在少数必要环节调用前沿模型?

Nemotron 3.5 Lightning 值不值得用?

使用场景推荐方案原因
高频智能体路由(工具调用、校验、格式化)Lightning NVFP43B 激活参数、4 倍 token 速度、相近准确率下约减少 30% 计算量
通用编程辅助Qwen 3.6 35B-A3BSWE-bench Verified 为 70.12 对 51.56,领先 19 分
复杂推理 / 规划Nemotron 3 Ultra 或前沿模型Lightning 明确不是规划模型
消费级硬件上的单 GPU 本地聊天RTX 5090 上运行 Lightning NVFP4可以运行,但 GGUF 转换仍较粗糙;vLLM/SGLang 更可靠
针对狭窄智能体任务进行微调Lightning BF163B 激活参数意味着微调成本更低;OpenMDW v1.1 允许商业使用
大规模指令遵循LightningIFBench 71.88 对 Qwen 63.71,领先 8 分

Lightning 用峰值准确率换取高吞吐执行速度。在一次会话有数百个智能体步骤时,30% 的计算节省会不断累积。不过,该模型于2026 年 8 月 11 日发布,生态成熟度仍在发展中。Mamba-2 混合架构意味着基于 GGUF 的工具可能尚未完全支持它。目前,如果使用 NVIDIA 硬件,搭配 vLLM 或 SGLang 部署 NVFP4 checkpoint 是最稳妥的路径;如果是 Apple Silicon 或仅使用 GGUF 的环境,建议等待社区的转换版本稳定下来。

常见问题

Nemotron 3.5 Lightning 能在消费级硬件上运行吗?

NVIDIA 仅支持在消费级硬件上使用 NVFP4 checkpoint。BF16 权重需要 80GB GPU,即 H100 或 A100。NVFP4 可运行于 GeForce RTX 5090、DGX Spark 和 NVIDIA Jetson。社区已有适用于 16 GB+ VRAM 系统的 GGUF Q4 转换版本,可供 llama.cpp 和 Ollama 使用,但早期版本曾报告 Mamba-2 混合架构的未使用张量问题。

Nemotron 3.5 Lightning 与 Qwen 3.6 35B 相比如何?

在已公布的 12 项基准中,Qwen 3.6 35B-A3B 有 11 项优于 Lightning,差距最大的项目是 SWE-bench Verified 和 Terminal-Bench。Lightning 在 IFBench 指令遵循测试中胜出,并且在智能体工作负载上以相近准确率实现约 30% 更快的任务完成速度。Qwen 是更强的通用模型;Lightning 则是更快的智能体执行模型。

Nemotron 3.5 Lightning 适合编程吗?

若看原始编程基准,答案是否定的:其 SWE-bench Verified 得分为 51.56,而 Qwen 3.6 为 70.12。不过,CodeRabbit 曾以低于 $100 的成本,成功将 Lightning 微调用于代码审查路由,并超过了其基线。该模型本身就是为定制化设计的:将其针对你的代码库规范进行微调后,它可以用每个 token 3B 激活参数的成本处理常规代码任务。

Nemotron 3.5 Lightning 使用什么许可证?

该模型采用 OpenMDW v1.1(Open Model Data Weight)许可证发布,NVIDIA 将其描述为“尽可能宽松地”发布。该许可证允许商业使用,覆盖权重、训练数据和训练配方。完整许可证条款可参阅 HuggingFace 模型卡。