AIREITER

Guide de l’API Nemotron 3 Ultra : accès gratuit, limites et configuration

Dernière mise à jour: 2026-09-19 01:30:57

Avec son contexte d’un million de tokens et son endpoint à 0 $, l’API Nemotron 3 Ultra semble être un choix évident. En pratique, l’accès gratuit sert surtout à l’évaluation. Pour la production, il faut tenir compte de la fiabilité du fournisseur, du traitement des données et de la disponibilité d’une solution de secours.

Offre de l’API gratuite Nemotron 3 Ultra sur OpenRouter

L’API Nemotron 3 Ultra vaut-elle le détour ?

L’API Nemotron 3 Ultra mérite d’être testée pour les agents textuels exécutant des tâches longues, l’analyse de documents volumineux et les workflows de programmation qui tirent parti d’un contexte très étendu. En revanche, ce n’est pas le meilleur choix par défaut pour les conversations courantes à faible latence, les prompts confidentiels envoyés à un endpoint gratuit journalisé ou un service de production sans solution de repli.

NVIDIA a lancé Nemotron 3 Ultra le 4 juin 2026. La fiche officielle du modèle identifie le checkpoint NVFP4 comme la version 1.0 GA, utilisable à des fins commerciales et non commerciales sous licence OpenMDW 1.1.

Élément déterminantValeur vérifiéePourquoi c’est important
Taille du modèle550B au total, 55B actifsLe calcul parcimonieux ne réduit pas la taille de l’ensemble des poids
Contexte maximalJusqu’à 1M de tokensLes limites peuvent être inférieures selon le fournisseur
ModalitéEntrées et sorties textePas de compréhension des images ou des vidéos
SWE-Bench Verified officiel en NVFP469.7Un indicateur pertinent pour évaluer les agents de programmation
RULER 1M officiel en NVFP494.0Confirme l’intérêt du modèle pour les contextes très longs
Tarif gratuit OpenRouter$0 en entrée, $0 en sortieAdapté aux essais, pas à un SLA
Disponibilité gratuite OpenRouter observée84.07 % de succès sur trois joursLe service était accessible, mais pas toujours exploitable
Configuration minimale officielle en auto-hébergement4x B200 ou 8x H100Ce n’est pas un déploiement prévu pour une station de travail classique

Les résultats de benchmark ci-dessus proviennent de la fiche officielle de NVIDIA et doivent être considérés comme des mesures fournies par le constructeur. La disponibilité observée sur OpenRouter est une mesure dynamique du fournisseur, pas une garantie permanente.

Appeler gratuitement l’API Nemotron 3 Ultra en cinq minutes

La méthode gratuite la plus rapide consiste à utiliser l’endpoint de chat compatible avec l’API OpenAI proposé par OpenRouter, avec l’identifiant exact nvidia/nemotron-3-ultra-550b-a55b:free. Créez une clé OpenRouter, stockez-la dans une variable d’environnement et envoyez d’abord un petit test avant de lancer une tâche exploitant un long contexte.

  1. Créez une clé API dans OpenRouter.
  2. Exportez-la sous le nom OPENROUTER_API_KEY.
  3. Appelez /api/v1/chat/completions avec l’identifiant du modèle gratuit.
  4. Lors de l’évaluation, journalisez le statut HTTP, la latence et les réponses vides.
  5. Ajoutez une route payante ou un autre modèle avant de passer en production.
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b:free",
    "messages": [
      {
        "role": "user",
        "content": "Return three risks in this migration plan as a numbered list."
      }
    ],
    "max_tokens": 500
  }'

La même route fonctionne avec le client Python OpenAI : il suffit de modifier base_url et model :

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["OPENROUTER_API_KEY"],
    base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-ultra-550b-a55b:free",
    messages=[
        {
            "role": "user",
            "content": "Inspect this plan and list the three highest-impact risks.",
        }
    ],
    max_tokens=500,
)

print(response.choices[0].message.content)

Ce que garantit réellement l’accès gratuit

La route gratuite de Nemotron 3 Ultra ne garantit ni une capacité illimitée ni une disponibilité adaptée à la production. La fiche OpenRouter indique que les endpoints gratuits sont soumis à des limites de débit, sans publier de quota précis sur la page du modèle. Son relevé du 19 septembre affichait 100 % d’accessibilité, mais seulement 84.07 % de disponibilité réussie sur trois jours ; les erreurs et les réponses vides étaient comptabilisées comme des échecs.

Dans ce relevé, OpenRouter affichait un contexte de 1M de tokens, une complétion maximale de 65 536 tokens, l’appel d’outils, une latence médiane de 2,28 secondes et un débit médian de 29 tokens par seconde.

Il existe également une limite liée aux fonctionnalités du fournisseur : l’offre gratuite d’OpenRouter prenait en charge tools et tool_choice, mais n’imposait pas response_format. La route payante de Segmind documente la sortie JSON Schema à $0.625 par million de tokens en entrée et $2.75 par million de tokens en sortie. Si votre code dépend d’un JSON strict, testez le fournisseur choisi au lieu de déduire cette compatibilité du modèle de base.

N’envoyez pas de données confidentielles ou personnelles via la route gratuite d’OpenRouter. Sa fiche précise que l’utilisation est journalisée à des fins de sécurité et peut servir à améliorer les produits et services de NVIDIA. En cas de 429, de dépassement de délai ou de réponse vide, appliquez un backoff exponentiel borné, puis basculez vers une route payante. Ne relancez pas indéfiniment une action d’agent.

Ce que change concrètement le format 550B A55B

La désignation 550B-A55B signifie que Nemotron 3 Ultra contient 550 milliards de paramètres au total, dont environ 55 milliards sont activés pour chaque token. NVIDIA combine le routage LatentMoE, Mamba-2, certaines couches d’attention et la prédiction multi-token. L’activation parcimonieuse réduit le calcul par token, mais l’ensemble des poids doit toujours être stocké, distribué ou déporté. A55B ne transforme donc pas le modèle en déploiement 55B.

La publication de recherche de NVIDIA annonce jusqu’à 1M de tokens de contexte et compare le débit sur une charge inhabituelle composée de 8 000 tokens en entrée et de 64 000 tokens en sortie. NVIDIA revendique un débit 5,9 fois supérieur à celui de GLM-5.1-754B-A40B, 4,8 fois supérieur à celui de Kimi-K2.6-1T-A32B et 1,6 fois supérieur à celui de Qwen-3.5-397B-17B. La page ne fournit ni débit absolu ni détails sur le matériel : ces multiplicateurs ne doivent donc pas être transformés en prévisions de latence API.

Le tableau officiel BF16/NVFP4 est plus utile pour réfléchir au déploiement :

BenchmarkBF16NVFP4Lecture pratique
SWE-Bench Verified71.969.7La quantification coûte 2,2 points sur ce test de programmation
Terminal Bench 2.156.453.9Les tâches agentiques dans un terminal régressent également
Moyenne TauBench V370.970.3La moyenne sur l’utilisation d’outils reste proche
GPQA, sans outils87.087.9Le NVFP4 n’est pas systématiquement moins performant
RULER 1M94.794.0La recherche dans les longs contextes reste proche
OmniScience, absence d’hallucinations78.775.5Les contrôles de factualité restent indispensables

L’impact dépend de la tâche : le NVFP4 perd 3,2 points sur l’absence d’hallucinations, mais en gagne 0,9 sur GPQA.

Choisissez selon la tâche, pas selon le nombre de paramètres

Nemotron 3 Ultra doit être comparé à DeepSeek V4, GLM 5.2 et Qwen 3.8 Max sur la charge de travail qui sera réellement mise en production, et non sur la taille des modèles. Aucun résultat obtenu avec un même banc de test pour ce guide ne permet de désigner un vainqueur universel. La comparaison la plus solide passe donc par un plan de test et des limites vérifiées.

TâcheCommencez parÉléments à vérifier avant de choisir
Recherche dans un million de tokens ou synthèse de documentsNemotron 3 UltraLe RULER 1M officiel en NVFP4 atteint 94.0 ; testez la précision de recherche et la latence de préremplissage avec la longueur réelle des prompts
Agent de programmation exécutant des tâches longuesNemotron 3 Ultra ou DeepSeek V4Nemotron obtient 69.7 sur SWE-Bench Verified et 53.9 sur Terminal Bench 2.1 ; comparez la réussite des tâches sur dépôt et la validité des appels d’outils avec un même banc de test
Automatisation avec sorties structuréesGLM 5.2, Qwen 3.8 Max ou un fournisseur Nemotron prenant en charge les schémasL’offre gratuite d’OpenRouter n’impose pas response_format ; mesurez le respect du schéma et le nombre de relances sur la route exacte
Requêtes courtes à fort volumeDeepSeek V4, GLM 5.2 ou Qwen 3.8 MaxComparez le coût par tâche réussie et la latence p95 ; la taille d’Ultra n’est pas automatiquement un avantage
Déploiement open-weight sur matériel NVIDIANemotron 3 UltraComparez BF16 et NVFP4 sur la tâche cible, puis calculez l’utilisation soutenue

DeepSeek V4 et GLM 5.2 disposent de surfaces API dédiées sur AIReiter, tandis que Qwen 3.8 Max est disponible comme modèle de chat hébergé : guide de l’API DeepSeek V4 Pro, analyse de l’API GLM 5.2 et tarifs de l’API Qwen 3.8 Max. Il s’agit d’alternatives à évaluer, pas d’une affirmation selon laquelle un modèle serait meilleur pour toutes les tâches.

Peut-on exécuter Nemotron 3 Ultra en local ?

Nemotron 3 Ultra peut être auto-hébergé, mais « en local » signifie ici du matériel de centre de données ou une DGX Station, pas un ordinateur portable. NVIDIA indique comme configurations minimales 4x GB200, 4x B200, 4x GB300, 4x B300 ou 8x H100 pour le déploiement standard.

Les exemples officiels vLLM de la fiche NVIDIA utilisent le parallélisme tensoriel et expert en 4 voies, un cache KV en FP8, le préremplissage par blocs et le décodage spéculatif MTP. Un exemple standard utilise par défaut 262 144 tokens ; l’activation de 1 048 576 tokens nécessite une surcharge explicite. Le contexte annoncé n’est donc pas la configuration de service par défaut.

NVIDIA documente également un déploiement sur une DGX Station unique. Il exécute le checkpoint NVFP4 sur un seul GPU GB300 intégré, en rendant disponibles jusqu’à 150 Gio de mémoire CPU cohérente et en déportant les poids des experts. Cette recette nécessite vLLM 0.22.0, le backend NVFP4 spécifique à Blackwell et l’architecture mémoire de la DGX Station ; elle ne s’applique pas à un PC ordinaire équipé d’un seul GPU.

DéploiementÀ choisir quandContrainte principale
API gratuite OpenRouterVous évaluez les prompts et le comportement des outilsLimites de débit, journalisation et disponibilité variable
API hébergée payanteVous devez lancer le service avant que le volume justifie du matérielDifférences de tarifs, de précision, de contexte et de fonctionnalités selon le fournisseur
Auto-hébergement sur 4x B200 ou 8x H100Le volume soutenu, le contrôle des données ou la personnalisation du modèle sont prioritairesCoût d’investissement et exploitation de l’inférence distribuée
DGX Station GB300 unique avec déportVous possédez précisément ce système à mémoire cohérenteLatence du déport et dépendance à ce matériel particulier

FAQ sur l’API Nemotron 3 Ultra

L’API Nemotron 3 Ultra est-elle gratuite ?

Oui. OpenRouter affiche nvidia/nemotron-3-ultra-550b-a55b:free à $0 pour les tokens d’entrée et de sortie, mais l’endpoint est soumis à des limites de débit et journalisé.

Nemotron 3 Ultra prend-il vraiment en charge un million de tokens ?

NVIDIA indique un maximum de 1M de tokens, mais les routes des fournisseurs peuvent exposer des valeurs par défaut inférieures. L’exemple vLLM de NVIDIA utilise par défaut 262 144 tokens, sauf si l’opérateur active 1 048 576 tokens.

L’API prend-elle en charge les outils et le JSON structuré ?

Le modèle prend en charge les outils, mais l’application dépend du fournisseur : l’offre gratuite d’OpenRouter ne force pas response_format, tandis que Segmind documente le JSON Schema strict.

Puis-je utiliser Nemotron 3 Ultra à des fins commerciales ?

NVIDIA indique que la version publiée sous OpenMDW 1.1 autorise les usages commerciaux et non commerciaux. Consultez les conditions de licence accessibles depuis la fiche officielle du modèle pour connaître les obligations liées à la redistribution et au déploiement.

Peut-on désactiver le raisonnement ?

La documentation API de NVIDIA expose enable_thinking=True/False. Les fournisseurs hébergés peuvent gérer ce contrôle différemment : vérifiez donc le paramètre accepté et le décompte des tokens sur la route choisie.

550B A55B équivaut-il à un modèle dense de 55B ?

Non. Environ 55B paramètres sont actifs pour chaque token, mais les 550B paramètres doivent toujours être stockés, distribués ou déportés.

Une décision de déploiement, pas un trophée de benchmark

Le meilleur point de départ consiste à utiliser gratuitement l’API Nemotron 3 Ultra avec des prompts non sensibles et un petit jeu d’évaluation. Passez à un endpoint payant lorsque les erreurs, l’application des schémas ou la capacité prévisible deviennent importantes. Ne vous tournez vers l’auto-hébergement que si l’utilisation mesurée, la confidentialité ou la personnalisation justifient au moins quatre GPU actuels à grande capacité mémoire ou le chemin de déploiement documenté pour la DGX Station.

Résultat après vos testsAction suivante
La qualité est bonne, mais les appels gratuits échouent ou restent en attenteAjoutez une route Nemotron payante et une politique de relance
La recherche dans les longs contextes fait la différenceTestez le document réel le plus volumineux et mesurez le temps de préremplissage
Les erreurs JSON sont majoritairesUtilisez un fournisseur qui impose les schémas ou comparez les routes GLM/Qwen
Le coût ou la latence des tâches courtes dominePréférez un modèle plus petit et réservez Ultra aux cas nécessitant une escalade
Les données ne peuvent pas quitter votre réseauBudgétez le déploiement officiel multi-GPU avant de vous engager

À lire aussi