AIREITER

Nemotron 3 Ultra API 指南:免費存取、限制與設定

最近更新: 2026-09-19 01:36:10

百萬 Token 上下文,加上 $0 API 端點,乍看之下 Nemotron 3 Ultra 很適合直接當成預設選項。但實際情況沒這麼簡單:免費方案適合評估,真正上線時還得考慮供應商穩定性、資料處理方式,以及付費備援方案。

OpenRouter 上的 Nemotron 3 Ultra 免費 API 清單

Nemotron 3 Ultra API 值得使用嗎?

如果你的工作涉及長時間運作的文字代理、大型文件分析,或需要超長上下文的程式開發流程,Nemotron 3 Ultra 值得拿來測試。不過,對於低延遲的日常聊天、在有記錄功能的免費端點上處理機密提示,或沒有備援方案的正式服務來說,它並不是理想的預設選擇。

NVIDIA 於 June 4, 2026 發表 Nemotron 3 Ultra。官方模型卡指出,NVFP4 checkpoint 為 version 1.0 GA,採用 OpenMDW 1.1 授權,可用於商業與非商業用途。

判斷重點已確認數值實際意義
模型規模550B 總參數、55B 啟用參數稀疏計算不代表完整權重很小
最大上下文最高 1M tokens不同供應商路由可能設有更低限制
模態文字輸入與輸出不支援圖片或影片理解
官方 NVFP4 SWE-Bench Verified69.7可作為程式開發代理評估的參考
官方 NVFP4 RULER 1M94.0支持長上下文使用情境
OpenRouter 免費價格$0 輸入、$0 輸出適合試用,不代表有 SLA
OpenRouter 免費方案可用率快照三天內成功率 84.07%能連線不代表每次都能正常使用
官方自行部署最低需求4x B200-class 或 8x H100不是一般工作站能負擔的部署方式

上表的基準測試數值來自 NVIDIA 模型卡,應視為原廠結果。OpenRouter 的可用率是會變動的供應商觀測值,不是永久保證。

五分鐘呼叫免費 Nemotron 3 Ultra API

最快的免費用法,是透過 OpenRouter 的 OpenAI 相容 Chat Completions 端點,搭配完整模型 ID nvidia/nemotron-3-ultra-550b-a55b:free。先建立 OpenRouter 金鑰,放進環境變數,再用小型請求測試,確認運作正常後才執行長上下文任務。

  1. 在 OpenRouter 建立 API 金鑰。
  2. 將金鑰匯出為 OPENROUTER_API_KEY
  3. 使用免費模型 ID 呼叫 /api/v1/chat/completions
  4. 評估期間記錄 HTTP 狀態、延遲,以及空白回應。
  5. 正式使用前,加入付費路由或其他模型作為備援。
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b:free",
    "messages": [
      {
        "role": "user",
        "content": "Return three risks in this migration plan as a numbered list."
      }
    ],
    "max_tokens": 500
  }'

使用 OpenAI Python client 時也能走同一個路由,只要修改 base_urlmodel

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b:free",
    messages=[
        {
            "role": "user",
            "content": "Inspect this plan and list the three highest-impact risks.",
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

免費方案到底能保證什麼?

免費 Nemotron 3 Ultra 路由既不保證無限容量,也不保證正式環境可用。OpenRouter 清單標示免費端點會受到速率限制,但模型頁面沒有公布確切配額;其 September 19 快照顯示三天內可連線率為 100%,但成功可用率只有 84.07%,錯誤與空白回應都計為失敗。

在該快照中,OpenRouter 顯示 1M-token 上下文、65,536-token 最大完成長度、工具呼叫功能、2.28 秒中位延遲,以及每秒 29 tokens 的中位吞吐量。

此外,功能支援也會因供應商而異:OpenRouter 免費清單支援 toolstool_choice,但不會強制套用 response_format。Segmind 的付費路由則在 每百萬輸入 tokens $0.625、每百萬輸出 tokens $2.75的方案中,提供 JSON Schema 輸出。若程式依賴嚴格 JSON,就必須直接測試選定的供應商,不能只根據基礎模型推定支援狀況。

不要透過 OpenRouter 免費路由傳送機密或個人資料。該清單說明,使用記錄會為了安全目的保存,也可能用於改善 NVIDIA 產品與服務。遇到 429、逾時或空白回應時,應採用有上限的指數退避,接著切換到付費路由;不要讓代理無限重試同一個動作。

550B A55B 在實務上代表什麼?

550B-A55B 的意思是,Nemotron 3 Ultra 總共儲存 5500 億個參數,但每個 Token 約啟用 550 億個參數。NVIDIA 將 LatentMoE routing、Mamba-2、特定注意力層與 Multi-Token Prediction 結合在一起。稀疏啟用能降低每個 Token 的計算量,但完整權重仍然必須儲存、分散到多張 GPU,或進行卸載;A55B 並不代表這是一個 55B 規模的部署。

NVIDIA 的研究發布頁面指出,模型上下文最高可達 1M tokens,並在一個相當特殊的工作負載上比較吞吐量:8,000-token 輸入加上 64,000-token 輸出。NVIDIA 宣稱其吞吐量是 GLM-5.1-754B-A40B 的 5.9 倍、Kimi-K2.6-1T-A32B 的 4.8 倍,以及 Qwen-3.5-397B-17B 的 1.6 倍。不過頁面沒有提供絕對吞吐量或硬體細節,因此不能把這些倍數直接換算成 API 延遲。

官方 BF16/NVFP4 表格更能幫助判斷部署方案:

基準測試BF16NVFP4實務解讀
SWE-Bench Verified71.969.7在這項程式測試中,量化造成 2.2 分差距
Terminal Bench 2.156.453.9代理式終端工作同樣有所下降
TauBench V3 average70.970.3工具使用平均表現仍相當接近
GPQA, no tools87.087.9NVFP4 並非在所有項目都較弱
RULER 1M94.794.0長上下文檢索能力仍接近
OmniScience non-hallucination78.775.5仍須重視事實正確性檢查

差異取決於任務:NVFP4 在 non-hallucination 測試中下降 3.2 分,但在 GPQA 上反而提升 0.9 分。

不要只看參數量,應該按任務選模型

Nemotron 3 Ultra 應該拿實際要上線的工作負載,與 DeepSeek V4、GLM 5.2 及 Qwen 3.8 Max 比較,而不是只看模型大小。本指南沒有採用同一套測試環境取得足以支持「誰是全面優勝者」的結果,因此最可靠的做法,是建立一套測試計畫,逐項確認各模型的能力邊界。

任務建議先測選擇前的依據與測試
百萬 Token 檢索或文件綜合Nemotron 3 Ultra官方 NVFP4 RULER 1M 為 94.0;以實際提示長度測試檢索準確率與 prefill 延遲
長時間運作的程式開發代理Nemotron 3 Ultra 或 DeepSeek V4Nemotron 在 SWE-Bench Verified 得分 69.7,在 Terminal Bench 2.1 得分 53.9;使用同一套測試環境比較儲存庫任務成功率與工具呼叫有效性
結構化輸出自動化GLM 5.2、Qwen 3.8 Max,或支援 schema 的 Nemotron 供應商OpenRouter 免費方案不會強制套用 response_format;應在確定的路由上測量 schema 遵循率與重試次數
大量短請求DeepSeek V4、GLM 5.2 或 Qwen 3.8 Max比較每個成功任務的成本與 p95 延遲;Ultra 的規模不會自動帶來優勢
使用 NVIDIA 硬體的開放權重部署Nemotron 3 Ultra在目標任務上比較 BF16 與 NVFP4,再計算持續運作時的利用率

DeepSeek V4 與 GLM 5.2 在 AIReiter 上都有專用 API,Qwen 3.8 Max 則以託管聊天模型形式提供:DeepSeek V4 Pro API guideGLM 5.2 API review,以及 Qwen 3.8 Max API pricing。這些是用來評估的替代方案,不代表其中某個模型在所有任務上都勝出。

Nemotron 3 Ultra 能在本機執行嗎?

Nemotron 3 Ultra 可以自行託管,但這裡的「本機」指的是資料中心硬體或 DGX Station,不是筆電。NVIDIA 列出的標準部署最低配置為 4x GB200、4x B200、4x GB300、4x B300,或 8x H100。

NVIDIA 模型卡中的官方 vLLM 範例使用 4-way tensor 與 expert parallelism、FP8 KV cache、chunked prefill,以及 MTP speculative decoding。標準範例預設為 262,144 tokens;若要啟用 1,048,576 tokens,必須明確覆寫設定。因此,官方標示的上下文上限並不是預設服務配置。

NVIDIA 也提供特殊的單台 DGX Station 部署方式。這個方案在一顆整合式 GB300 GPU 上執行 NVFP4 checkpoint,透過提供最高 150 GiB 的一致性 CPU 記憶體來卸載專家權重。該做法需要 vLLM 0.22.0、針對 Blackwell 的 NVFP4 backend,以及 DGX Station 的記憶體架構,不能直接套用到一般單 GPU 電腦。

部署方式適合情況主要限制
OpenRouter 免費 API評估提示與工具行為速率限制、記錄功能,以及不穩定的可用率
付費託管 API在使用量足以支撐硬體前先上線供應商在價格、精度、上下文與功能上可能有所不同
4x B200-class / 8x H100 自行託管需要持續處理大量流量、資料控管或模型客製化資本成本與分散式推論維運
單台 GB300 DGX Station 搭配卸載你擁有完全相同的一致性記憶體系統卸載延遲與硬體專屬性

Nemotron 3 Ultra API 常見問題

Nemotron 3 Ultra API 免費嗎?

是。OpenRouter 將 nvidia/nemotron-3-ultra-550b-a55b:free 的輸入與輸出 Token 都列為 $0,但該端點有速率限制,而且會記錄使用情況。

Nemotron 3 Ultra 真的支援一百萬 Token 嗎?

NVIDIA 指定的最大上限為 1M tokens,但不同供應商路由可能提供更低的預設值;NVIDIA 的 vLLM 範例預設為 262,144 tokens,除非操作者啟用 1,048,576。

API 支援工具與結構化 JSON 嗎?

模型支援工具,但是否強制套用結構化輸出取決於供應商:OpenRouter 免費方案不會強制執行 response_format,而 Segmind 則提供嚴格 JSON Schema 的文件說明。

我可以將 Nemotron 3 Ultra 用於商業用途嗎?

NVIDIA 表示,OpenMDW 1.1 授權允許商業與非商業用途。若涉及重新發布與部署義務,請查閱官方模型卡所連結的授權條款

可以關閉推理嗎?

NVIDIA API 文件提供 enable_thinking=True/False。託管供應商可能以不同方式對應這項控制,因此請確認所選路由接受的參數,以及 Token 計算方式。

550B A55B 等同於密集型 55B 模型嗎?

不等同。每個 Token 約有 55B 參數會被啟用,但完整的 550B 參數仍然必須儲存、分散或卸載。

這是部署決策,不是基準測試獎盃

最適合的第一步,是使用非敏感提示與小型評估集測試免費 Nemotron 3 Ultra API。當錯誤率、schema 強制執行或可預期的容量開始變得重要時,再轉向付費端點;只有在實測利用率、隱私或客製化需求足以證明至少四張目前的高記憶體 GPU,或符合文件所述的 DGX Station 路徑值得投入時,才應考慮自行託管。

測試後的結果下一步
品質不錯,但免費請求經常失敗或排隊加入付費 Nemotron 路由與重試策略
長上下文檢索是主要優勢測試最大的實際文件,並測量 prefill 時間
主要問題是 JSON 輸出失敗改用支援 schema 強制執行的供應商,或比較 GLM/Qwen 路由
短任務的成本或延遲最重要優先使用較小模型,將 Ultra 留給需要升級處理的請求
資料不能離開你的網路在確定採用前,先編列官方多 GPU 部署的預算

延伸閱讀