AIREITER

Nemotron 3 Ultra API 指南:免费访问、限制与配置

最后更新: 2026-09-19 01:33:27

百万 token 上下文加上 $0 接口,乍看之下,Nemotron 3 Ultra 很适合直接当默认模型。但实际并非如此:免费线路更适合评测,真正用于生产环境时,还要考虑供应商稳定性、数据处理方式,以及是否准备好付费备用线路。

OpenRouter 上的 Nemotron 3 Ultra 免费 API 条目

Nemotron 3 Ultra API 值得用吗?

如果你的任务包括长时间运行的文本 Agent、大型文档分析,或需要超长上下文的编程工作流,Nemotron 3 Ultra 值得测试。对于低延迟的日常聊天、在公开记录的免费接口上处理机密提示词,或者没有备用方案的生产服务,它并不是理想的默认选择。

NVIDIA 于 2026 年 6 月 4 日发布 Nemotron 3 Ultra。官方模型卡显示,NVFP4 检查点为 1.0 GA 版本,采用 OpenMDW 1.1 许可证,允许商业和非商业使用。

决策依据已验证数值实际意义
模型规模总计 550B,激活 55B稀疏计算不代表完整权重很小
最大上下文最高 1M tokens不同线路的供应商限制可能更低
模态文本输入与输出不支持图像或视频理解
官方 NVFP4 SWE-Bench Verified69.7可作为编程 Agent 评测的参考
官方 NVFP4 RULER 1M94.0支持超长上下文场景
OpenRouter 免费价格$0 输入,$0 输出适合试用,不代表 SLA
OpenRouter 免费线路可用性快照三天内成功率 84.07%能连通不等于始终可用
官方自托管最低配置4x B200 级别或 8x H100不是普通工作站能承担的部署

上表中的基准数据来自 NVIDIA 模型卡,应视为厂商一方的测试结果。OpenRouter 的可用性是动态供应商指标,并不是永久保证。

五分钟调用免费的 Nemotron 3 Ultra API

最快的免费方案是通过 OpenRouter 的 OpenAI 兼容 chat-completions 接口调用,模型 ID 必须使用 nvidia/nemotron-3-ultra-550b-a55b:free。先创建 OpenRouter 密钥并放入环境变量,再用一个小请求进行测试,不要一上来就提交超长上下文任务。

  1. 在 OpenRouter 中创建 API key。
  2. 将它导出为 OPENROUTER_API_KEY
  3. 使用免费模型 ID 调用 /api/v1/chat/completions
  4. 评测时记录 HTTP 状态码、延迟和空响应。
  5. 正式上线前,加入付费线路或其他模型作为备用。
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b:free",
    "messages": [
      {
        "role": "user",
        "content": "Return three risks in this migration plan as a numbered list."
      }
    ],
    "max_tokens": 500
  }'

使用 OpenAI Python 客户端时也可以走同一线路,只需修改 base_urlmodel

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b:free",
    messages=[
        {
            "role": "user",
            "content": "Inspect this plan and list the three highest-impact risks.",
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

免费线路到底能保证什么

免费的 Nemotron 3 Ultra 线路既不保证无限容量,也不保证生产环境可用。OpenRouter 条目将免费接口标注为限流,但没有在模型页面公布明确配额;其 9 月 19 日的快照显示,三天内可达率为 100%,但成功可用率只有 84.07%,错误和空响应都会被计为失败。

在这份快照中,OpenRouter 展示了 1M token 上下文、65,536 token 最大输出、工具调用、2.28 秒中位延迟,以及每秒 29 token 的中位吞吐量。

此外,不同供应商之间还存在功能边界。OpenRouter 免费线路支持 toolstool_choice,但不会强制执行 response_format。Segmind 的付费线路则以每百万输入 token $0.625、每百万输出 token $2.75的价格提供 JSON Schema 输出。凡是依赖严格 JSON 的代码,都应该针对实际使用的供应商进行测试,不能仅根据基础模型推断功能支持情况。

不要通过 OpenRouter 免费线路发送机密数据或个人数据。该线路说明会出于安全目的记录使用情况,并可能用于改进 NVIDIA 产品和服务。遇到 429、超时或空响应时,应采用有上限的指数退避,然后切换到付费线路;不要让 Agent 操作无限重试。

550B-A55B 架构在实际使用中意味着什么

550B-A55B 表示 Nemotron 3 Ultra 总共包含 5500 亿参数,但每个 token 大约只激活 550 亿参数。NVIDIA 将 LatentMoE 路由、Mamba-2、部分注意力层和 Multi-Token Prediction 结合在了一起。稀疏激活可以降低每个 token 的计算量,但完整权重仍然需要存储、分发或卸载;A55B 并不意味着它就是一个 55B 规模的部署。

NVIDIA 的研究发布页面给出了最高 1M token 的上下文长度,并在一个比较特殊的工作负载上测试吞吐量:输入 8,000 token,输出 64,000 token。NVIDIA 声称,其吞吐量是 GLM-5.1-754B-A40B 的 5.9 倍、Kimi-K2.6-1T-A32B 的 4.8 倍、Qwen-3.5-397B-17B 的 1.6 倍。但页面没有给出绝对吞吐量和硬件细节,因此不能把这些倍数直接换算成 API 延迟预期。

对于部署选择,官方的 BF16/NVFP4 对比表更有参考价值:

基准测试BF16NVFP4实际解读
SWE-Bench Verified71.969.7在这项编程测试中,量化带来 2.2 分下降
Terminal Bench 2.156.453.9Agent 式终端任务同样有所下降
TauBench V3 平均值70.970.3工具调用平均成绩基本接近
GPQA,无工具87.087.9NVFP4 并非在所有任务上都更弱
RULER 1M94.794.0超长上下文检索能力仍然接近
OmniScience 非幻觉率78.775.5仍需重视事实准确性检查

不同任务的变化并不一致:NVFP4 在非幻觉率上下降 3.2 分,但在 GPQA 上提高了 0.9 分。

按任务选择,不要只看参数量

Nemotron 3 Ultra 应该和 DeepSeek V4、GLM 5.2、Qwen 3.8 Max 在实际要上线的工作负载上比较,而不是单纯比模型大小。本指南没有收集到足以证明某个模型全面胜出的同一测试框架结果,因此更稳妥的做法是先制定测试方案,并验证各条线路的实际边界。

任务优先开始测试选择前需要验证的证据与指标
百万 token 检索或文档综合Nemotron 3 Ultra官方 NVFP4 RULER 1M 得分为 94.0;应在真实提示词长度下测试检索准确率和预填充延迟
长时间运行的编程 AgentNemotron 3 Ultra 或 DeepSeek V4Nemotron 在 SWE-Bench Verified 上得分 69.7,在 Terminal Bench 2.1 上得分 53.9;应在同一测试框架中比较代码仓库任务成功率和工具调用有效性
结构化输出自动化GLM 5.2、Qwen 3.8 Max,或支持 Schema 的 Nemotron 供应商OpenRouter 免费线路不会强制执行 response_format;应在实际线路上测量 Schema 遵循率和重试次数
高并发短请求DeepSeek V4、GLM 5.2 或 Qwen 3.8 Max比较每个成功任务的成本和 p95 延迟;Ultra 的规模并不会自动带来优势
使用 NVIDIA 硬件部署开放权重模型Nemotron 3 Ultra在目标任务上比较 BF16 和 NVFP4,然后计算持续利用率

DeepSeek V4 和 GLM 5.2 在 AIReiter 上都有专门的 API,Qwen 3.8 Max 则以托管聊天模型形式提供:DeepSeek V4 Pro API 指南GLM 5.2 API 评测Qwen 3.8 Max API 价格。这些是用于评估的替代方案,并不意味着某个模型在所有任务上都更强。

Nemotron 3 Ultra 能在本地运行吗?

Nemotron 3 Ultra 可以自托管,但这里的“本地”指的是数据中心硬件或 DGX Station,而不是笔记本电脑。NVIDIA 列出的常规部署最低配置包括 4x GB200、4x B200、4x GB300、4x B300 或 8x H100。

NVIDIA 模型卡中的官方 vLLM 示例使用了 4 路张量并行和专家并行、FP8 KV cache、分块预填充以及 MTP 投机解码。标准示例默认使用 262,144 token;要启用 1,048,576 token,必须显式覆盖配置。因此,宣传中的上下文长度并不是默认的服务配置。

NVIDIA 还记录了一种特殊的单台 DGX Station 部署方式。它在一块集成式 GB300 GPU 上运行 NVFP4 检查点,通过提供最高 150 GiB 的统一 CPU 内存来卸载专家权重。该方案要求 vLLM 0.22.0、Blackwell 专用 NVFP4 后端,以及 DGX Station 的内存架构,不能直接套用到普通单 GPU 电脑上。

部署方式适合在什么情况下选择主要限制
OpenRouter 免费 API评估提示词和工具行为限流、日志记录和可用性波动
付费托管 API在使用量足以支撑硬件之前先上线供应商价格、精度、上下文和功能差异
4x B200 级别 / 8x H100 自托管需要稳定吞吐、数据控制或模型定制资本成本和分布式推理运维
单台 GB300 DGX Station 加卸载你拥有这类统一内存系统卸载延迟和硬件专属性

Nemotron 3 Ultra API 常见问题

Nemotron 3 Ultra API 是免费的吗?

是的。OpenRouter 将 nvidia/nemotron-3-ultra-550b-a55b:free 的输入和输出 token 价格都列为 $0,但该接口有限流,并且会记录使用情况。

Nemotron 3 Ultra 真的支持一百万 token 吗?

NVIDIA 规定的最大上下文为 1M token,但不同供应商线路可能提供更低的默认值;NVIDIA 的 vLLM 示例默认使用 262,144 token,除非运营方主动启用 1,048,576。

API 支持工具和结构化 JSON 吗?

模型支持工具调用,但具体执行方式取决于供应商:OpenRouter 免费线路不强制执行 response_format,而 Segmind 则记录了对严格 JSON Schema 的支持。

我可以将 Nemotron 3 Ultra 用于商业用途吗?

NVIDIA 表示,OpenMDW 1.1 许可证允许商业和非商业使用。如需了解再分发和部署义务,请查看官方模型卡中链接的许可证条款

可以关闭推理吗?

NVIDIA API 文档提供了 enable_thinking=True/False。托管供应商可能以不同方式映射这一控制项,因此需要在选定线路上确认可接受的参数和 token 计费方式。

550B A55B 等同于一个稠密 55B 模型吗?

不等同。每个 token 大约只激活 55B 参数,但全部 550B 参数仍然需要被存储、分发或卸载。

这是一项部署决策,不是一场基准赛夺冠

最稳妥的第一步,是使用免费的 Nemotron 3 Ultra API,配合非敏感提示词和一小组评测任务。等失败率、Schema 强制执行能力或容量可预测性成为关键问题后,再切换到付费接口;只有当实际利用率、隐私要求或定制需求足以证明至少四块当前高显存 GPU,或足以支撑文档中的 DGX Station 方案时,才值得自托管。

测试后的结果下一步行动
效果不错,但免费调用经常失败或排队增加付费 Nemotron 线路和重试策略
超长上下文检索是主要优势测试最大的真实文档,并测量预填充时间
主要问题是 JSON 输出失败改用支持 Schema 强制执行的供应商,或比较 GLM/Qwen 线路
短任务成本或延迟更重要优先选择更小的模型,将 Ultra 留给升级处理的任务
数据不能离开你的网络在确定方案前,先为官方多 GPU 部署做好预算

相关阅读