AIREITER

Nemotron 3.5 Lightning: Das 30B-MoE für schnelle Agenten-Workflows

Zuletzt aktualisiert: 2026-08-11 18:59:46

Bei der reinen Benchmark-Leistung liegt Nemotron 3.5 Lightning laut NVIDIA hinter Qwen 3.6 35B-A3B: in 11 von 12 Tests. Dennoch soll das Modell Tokens bis zu 4x schneller generieren. Genau darauf zielt dieses 30B-Mixture-of-Experts-Modell ab: Pro Token sind nur 3B Parameter aktiv, sodass es die wiederkehrenden Ausführungsschritte in Agenten-Pipelines schnell und kosteneffizient erledigen kann. Der Haken: Die BF16-Gewichte in voller Präzision benötigen eine GPU mit 80 GB Speicher. Für den produktiven Einsatz empfiehlt NVIDIA den NVFP4-Checkpoint.

Warum Nemotron 3.5 Lightning kein gewöhnliches 30B-Modell ist

Nemotron 3.5 Lightning kombiniert Mamba-2-State-Space-Schichten, MoE-Routing und gezielt eingesetzte Attention-Schichten zu einer Hybridarchitektur, die NVIDIA als nemotron_h bezeichnet. Mamba-2 reduziert den Speicher- und Rechenaufwand von Attention bei langen Kontexten. Dadurch erreicht Lightning ein Kontextfenster von 1 Mio. Tokens; laut Model Card liegt die praktische Grenze auf einer einzelnen H100 80GB bei 256K. Ein reines Attention-Modell müsste dafür quadratisch steigende Kosten in Kauf nehmen.

SpezifikationWert
Parameter insgesamt30B
Aktive Parameter pro Token3B
ArchitekturMamba-2 + MoE + Attention Hybrid
KontextlängeBis zu 1 Mio. Tokens (256K auf einer einzelnen H100)
PräzisionsoptionenBF16, NVFP4
LizenzOpenMDW v1.1 (kommerziell nutzbar)
SprachenEnglisch, Spanisch, Französisch, Deutsch, Italienisch, Japanisch + Code
Pre-Training-Korpus20T+ Tokens
Reasoning-ModusÜber enable_thinking im Chat-Template umschaltbar
Empfohlenes SamplingTemperature 1.0, top-p 0.95

NVIDIA positioniert Lightning als das kleinste Modell der Nemotron-3-Familie. Es wurde laut NVIDIA gezielt auf Agent-Harness-Verhalten trainiert: Tool-Aufrufe, Validierung von Ausgaben, Ergebnisformatierung und Delegation an Subagenten. Die komplexe Planung übernimmt ein Frontier-Reasoning-Modell wie Nemotron 3 Ultra; Lightning bearbeitet die Routinearbeit, die sonst das Token-Budget eines teureren Modells aufbrauchen würde.

Benchmarks: Schnell ist Lightning, aber nicht überall besser

Die HuggingFace Model Card enthält 14 Benchmark-Zeilen, in denen Lightning mit Qwen 3.6 35B-A3B, Gemma 4 26B-A4B, Nemotron 3 Nano/Super und GPT-OSS 20B verglichen wird. Die zehn für die Entscheidung wichtigsten Ergebnisse:

Benchmark-Vergleich: Nemotron 3.5 Lightning gegen Qwen 3.6, Gemma 4 und GPT-OSS in fünf wichtigen Benchmarks
BenchmarkNemotron 3.5 LightningQwen 3.6 35B-A3BGemma 4 26B-A4BGPT-OSS 20B
MMLU Pro81.9485.6385.2076.40
GPQA Diamond (ohne Tools)75.4483.4079.6171.46
SWE-bench Verified51.5670.1257.4052.44
SWE-bench Multilingual39.3363.4043.4041.93
Terminal-Bench 2.124.5844.3837.2215.17
PinchBench85.3788.0774.7057.20
BrowseComp36.9748.7426.30-
IFBench (locker)71.8863.7177.2568.50
AA-LCR52.0061.0657.5632.88
SciCode32.6035.3340.2838.63

In 11 der 12 direkt vergleichbaren Zeilen bleibt Lightning hinter Qwen 3.6 35B-A3B zurück. Die Ausnahme ist IFBench, also Instruction Following im lockeren Modus: Hier erzielt Lightning 71.88 gegenüber 63.71 bei Qwen, ein Vorsprung von 8 Punkten. Das passt zur Positionierung als Ausführungsmodell für Agenten. Bei Tool-Call-Formatierung und Ausgabevalidierung ist das präzise Befolgen von Anweisungen oft wichtiger als maximale Reasoning-Leistung.

Seinen eigentlichen Vorteil spielt Lightning beim Tempo aus. In NVIDIAs PinchBench-Auswertung mit 10.000 Agenten-Aufgaben, gemessen in H100-GPU-Stunden, erledigt Lightning die Last in rund 16.5 GPU-Stunden bei 86% Genauigkeit. Qwen 3.6 35B benötigt bei 87% Genauigkeit 23.5-24 GPU-Stunden, Gemma 4 26B bei 73% Genauigkeit 25-26 GPU-Stunden:

PinchBench-Streudiagramm: Agenten-Genauigkeit gegenüber GPU-Stunden für 10.000 Aufgaben

Das entspricht bei nahezu gleicher Genauigkeit etwa 30% weniger Rechenaufwand. Wer 10.000 Agenten-Schritte ausführt und GPU-Stunden bezahlt, spürt diesen Unterschied. NVIDIA nennt zudem rund 670 Output-Tokens pro Sekunde bei etwa 23-24 Intelligence-Index-Punkten auf dem Artificial Analysis Leaderboard. Damit liegt das Modell auf der Pareto-Grenze der Open-Weight-Modelle mit weniger als 40B Gesamtparametern.

Tests aus der Community auf r/LocalLLaMA bestätigen den Geschwindigkeitstrend: Ein Nutzer mit DGX Spark meldete beim NVFP4-Checkpoint 78.5 Tokens pro Sekunde ohne Speculative Decoding und 90.7 Tokens pro Sekunde damit. Ein anderer Nutzer ordnete die Qualität im zentralen Diskussionsthread „zwischen Gemma 4 26B und 31B, deutlich näher an 26B“ ein. Lightning laufe ungefähr 2x schneller als Gemma 31B, erzeuge aber viele Thinking-Tokens, was den praktischen Geschwindigkeitsgewinn relativiere. Frühe GGUF-Q4-Konvertierungen kamen auf Dateigrößen von 25 GB und meldeten ungenutzte Tensoren. Das deutet darauf hin, dass die hybride Mamba-2-Architektur noch nicht von allen GGUF-basierten Tools vollständig unterstützt wird.

Hardwarebedarf und Optionen für den lokalen Betrieb

Der BF16-Checkpoint mit den Referenzgewichten in voller Präzision benötigt für den Betrieb auf einer GPU 1x H100 80GB oder 1x A100 80GB. Die geshardete safetensors-Datei ist 65.8 GB groß. NVIDIA empfiehlt für Production Inference ausdrücklich die separate NVFP4-Version.

CheckpointDateigröße (ca.)Minimale GPUAm besten geeignet für
BF1665.8 GB1x H100/A100 80GBFine-Tuning, Forschung, Erstellung quantisierter Varianten
NVFP4~16 GBRTX 5090, DGX Spark, Jetson (Blackwell/Hopper/Ampere)Production Inference, Agenten-Deployment
GGUF Q4~25 GB16 GB+ VRAM (aus der Community)llama.cpp, Ollama, LM Studio

Für Day-0-Support arbeitete NVIDIA laut eigenem Beitrag mit vier Local-Serving-Projekten zusammen: vLLM, SGLang, Ollama und llama.cpp. Auch LM Studio und Unsloth werden genannt. Das Modell unterstützt drei Strategien für Speculative Decoding:

  • DSpark – empfohlen für DGX Spark und Data-Center-Inferenz mit geringer Parallelität
  • DFlash – alternatives Draft-Modell, abhängig vom jeweiligen Workload
  • MTP (Multi-Token Prediction) – im Modell integriert und am besten für mittlere bis hohe Parallelität geeignet

Ohne lokale Hardware ist Lightning über build.nvidia.com als NIM-Microservice sowie auf OpenRouter verfügbar. Der NVFP4-Checkpoint läuft auf GeForce RTX 5090, DGX Spark, OEM-GB10-Systemen und NVIDIA Jetson.

Das Routing-Muster für Agenten: Hier lohnt sich Lightning

NVIDIAs Open-Source-Routing-Bibliothek NeMo Switchyard weist jeden Schritt eines Agenten-Workflows anhand von Genauigkeit, Geschwindigkeit und Kosten dem passenden Modell zu. Planungsaufgaben gehen an ein Frontier-Reasoning-Modell, die Ausführung an Lightning. Laut NVIDIAs internem Benchmark hielt Switchyard die Aufgabenerledigung auf „Frontier-Niveau“ und senkte die Kosten auf etwa ein Drittel gegenüber dem alleinigen Einsatz von Opus 4.8. An Lightning geroutete Ausführungsaufgaben umfassen git pull, die Validierung von Tool-Ausgaben, Ergebnisformatierung und Routine-API-Aufrufe.

Auch der Praxiseinsatz liefert ein Beispiel. CodeRabbit veröffentlichte auf Reddit einen Real-World-Fall: Für das Routing bei Code Reviews post-trainierte das Team Nemotron 3.5 Lightning mit gezieltem SFT und RLVR (Reinforcement Learning with Verifiable Rewards). In einer eingefrorenen Auswertung mit 1.000 Aufgaben schlug das Modell den bisherigen Ausgangspunkt – bei Trainingskosten von unter $100. NVIDIA unterstützt diesen Workflow mit NeMo Automodel und NeMo Megatron Bridge für LoRA/SFT, NeMo RL und NeMo Gym für Reinforcement Learning sowie dem offenen Datensatz Nemotron-RL Agentic Terminal Pivot.

Für Teams, die Agenten-Pipelines bauen, lautet die praktische Frage: Lässt sich Lightning so fine-tunen, dass es den Großteil der Agenten-Schritte zu Kosten von 3B aktiven Parametern übernimmt und ein Frontier-Modell nur bei den wenigen wirklich anspruchsvollen Schritten zum Einsatz kommt?

Lohnt sich Nemotron 3.5 Lightning für Ihren Einsatz?

AnwendungsfallEmpfehlungBegründung
Agenten-Routing mit hohem Volumen (Tool Calls, Validierung, Formatierung)Lightning NVFP43B aktive Parameter, 4x Token-Geschwindigkeit, ~30% weniger Compute bei ähnlicher Genauigkeit
Allgemeine Coding-UnterstützungQwen 3.6 35B-A3B70.12 gegenüber 51.56 bei SWE-bench Verified – Abstand von 19 Punkten
Komplexes Reasoning / PlanungNemotron 3 Ultra oder Frontier-ModellLightning ist ausdrücklich nicht das Modell für Planung
Lokaler Chat auf Consumer-Hardware mit einer GPULightning NVFP4 auf RTX 5090Funktioniert, aber GGUF-Konvertierungen sind noch unausgereift; vLLM/SGLang verlässlicher
Fine-Tuning für eine eng umrissene Agenten-AufgabeLightning BF163B aktive Parameter = günstigeres Fine-Tuning; OpenMDW v1.1 erlaubt kommerzielle Nutzung
Instruction Following im großen MaßstabLightningIFBench 71.88 gegenüber Qwen 63.71 – Vorsprung von 8 Punkten

Lightning tauscht Spitzenleistung gegen Geschwindigkeit bei volumenstarken Ausführungsaufgaben. Über Hunderte Agenten-Schritte pro Sitzung summieren sich die 30% weniger Compute. Das Modell wurde jedoch erst am 11. August 2026 veröffentlicht, und das Ökosystem entwickelt sich noch. Wegen der Mamba-2-Hybridarchitektur unterstützen GGUF-basierte Tools das Modell möglicherweise noch nicht vollständig. Auf NVIDIA-Hardware sind vLLM oder SGLang mit dem NVFP4-Checkpoint derzeit der sicherste Deployment-Weg. Auf Apple Silicon oder in reinen GGUF-Setups sollte man warten, bis die Community die Konvertierungen stabilisiert hat.

Häufige Fragen

Läuft Nemotron 3.5 Lightning auf Consumer-Hardware?

Für Consumer-Hardware unterstützt NVIDIA nur den NVFP4-Checkpoint. Die BF16-Gewichte erfordern eine GPU mit 80 GB Speicher, also H100 oder A100. NVFP4 läuft auf GeForce RTX 5090, DGX Spark und NVIDIA Jetson. GGUF-Q4-Konvertierungen aus der Community für llama.cpp und Ollama existieren für Systeme mit 16 GB+ VRAM. Bei frühen Builds wurden jedoch Probleme mit ungenutzten Tensoren in der Mamba-2-Hybridarchitektur gemeldet.

Wie schneidet Nemotron 3.5 Lightning gegen Qwen 3.6 35B ab?

Qwen 3.6 35B-A3B übertrifft Lightning in 11 von 12 veröffentlichten Benchmarks; die größten Abstände gibt es bei SWE-bench Verified und Terminal-Bench. Lightning gewinnt bei IFBench für Instruction Following und erledigt Agenten-Workloads bei ähnlicher Genauigkeit rund 30% schneller. Qwen ist das stärkere Allround-Modell, Lightning das schnellere Modell für die Agenten-Ausführung.

Ist Nemotron 3.5 Lightning gut zum Programmieren?

Für reine Coding-Benchmarks: nein. Bei SWE-bench Verified erreicht Lightning 51.56, Qwen 3.6 dagegen 70.12. CodeRabbit konnte Lightning allerdings erfolgreich für das Routing von Code Reviews fine-tunen und übertraf für unter $100 Trainingskosten den eigenen Ausgangspunkt. Das Modell ist auf Anpassung ausgelegt: Wer es auf die Konventionen der eigenen Codebasis fine-tunt, kann Routineaufgaben im Code zu Kosten von 3B aktiven Parametern abwickeln.

Unter welcher Lizenz steht Nemotron 3.5 Lightning?

Das Modell steht unter OpenMDW v1.1 (Open Model Data Weight), die NVIDIA als Veröffentlichung „as permissively as possible“ beschreibt. Die Lizenz erlaubt die kommerzielle Nutzung, einschließlich Gewichten, Trainingsdaten und Recipes. Die vollständigen Lizenzbedingungen stehen in der HuggingFace Model Card.