Eine RTX 3060 mit 12 GB VRAM, zwei lokal in ComfyUI laufende Open-Weights-Videomodelle und eine Deadline: Soll der nächste Clip durch MiniMax H3 oder LTX 2.3? Beide erzeugen Audio nativ, doch ihre Stärken liegen weit auseinander. LTX 2.3 schafft einen 5-Sekunden-Clip in 1080p in unter 40 Sekunden, während H3 für 10 Sekunden in 480p 11 Minuten benötigen kann. Dafür liefert das langsamere Modell eine Physik, die laut Reddit-Community „nicht einmal annähernd“ vergleichbar ist. Entscheidend ist daher nicht, welches Modell pauschal besser ist, sondern welches zum Shot, zur vorhandenen Hardware und zum aktuellen Abgabetermin passt.
MiniMax H3 und LTX 2.3 im Direktvergleich
| Spezifikation | MiniMax H3 | LTX 2.3 |
|---|---|---|
| Architektur | 33B DiT + Qwen3-VL-32B encoder | DiT-based, new VAE |
| Maximale Auflösung | 2K | 4K |
| Maximale Dauer | 15 Sekunden | 20 Sekunden (10 s bei 4K/1440p) |
| Audio | Nativer Stereo-Sound | Natives Audio, saubererer Vocoder, Audio-to-Video-Endpunkt |
| LoRA-Unterstützung | Noch nicht | Style LoRAs, HDR IC-LoRA, Character LoRAs |
| Porträtmodus | Über Seitenverhältnissteuerung | Natives 9:16, mit Porträtdaten trainiert |
| Mindestens nötiger VRAM (lokal) | 8 GB (INT8-quantisiert) | Praktisch etwa 12 GB (OOM-Berichte bei kleineren Karten) |
| Lizenz | MiniMax Community License | Apache-2.0-Gewichte; LTX Model License für kommerzielle Nutzung bei über $10M Umsatz |
| Veröffentlicht | API 31. Juli 2026; Gewichte 3. August 2026 | März 2026 |
Beide Modelle erschienen innerhalb weniger Monate als Open Weights. LTX 2.3 hat mit seiner ausgereiften LoRA-Pipeline einen Vorsprung von fünf Monaten; die H3-Gewichte sind zum Zeitpunkt dieses Artikels erst acht Tage alt.
Renderzeit und Hardware: Hier entscheidet sich der Workflow
Bei der Geschwindigkeit wird der Abstand für manche Pipelines unpraktikabel – und die reine Modellgröße führt dabei in die Irre. H3 ist auf dem Papier größer, mit 21 GB Diffusionsgewichten und 16 GB Text-Encoder. Trotzdem berichten mehrere Nutzer, dass es auf Consumer-Hardware stabiler läuft als LTX 2.3:
„Obwohl es technisch größer als LTX 2.3 ist, läuft es schneller und macht weniger Speicherprobleme. Ich habe 2.3 kürzlich noch einmal ausprobiert und war vom Speicherverbrauch genervt.“ – Reddit-Nutzer dobomex761604, r/StableDiffusion
Stabilität ist allerdings nicht gleich Geschwindigkeit. Diese gemessenen Renderzeiten stammen aus demselben Reddit-Vergleichsthread:
| Hardware | Modell | Dauer / Auflösung | Renderzeit |
|---|---|---|---|
| RTX 3060 12 GB | H3 (INT8) | 10 s / 480p | ~11 Min. |
| RTX 3060 12 GB | H3 (INT8) | 5 s / ~480p | ~3–4 Min. |
| RTX 5090 24 GB | H3 (voll) | 15 s / 720p / 20 Schritte | 48 Min. |
| RTX 4080 | LTX 2.3 | 15 s / 1080p | 15–20 Min. |
| RTX 4090 | LTX 2.3 | 5 s / 1080p | 25–40 s |
| RTX 4090 | Wan 2.2 (14B FP8) | 5 s / 1080p | 90–120 s |
Ein praxistauglicher Hinweis von Nutzer srikantpatnaik: Wer in ComfyUI in den Subgraph wechselt und die Schritte von 20 auf 10 reduziert, spart bei H3 rund 40 % Renderzeit – bei noch vertretbarem Qualitätsverlust. Das Verhältnis aus Sekunden und Auflösung ist derzeit H3s größte Schwäche.
Beim VRAM überrascht H3 dagegen positiv. Das von ComfyUI selbst vertriebene INT8-pruned-Modell läuft laut den Testnotizen von Nutzer Aadi_880 bereits auf Karten mit 8 GB VRAM und 16 GB Arbeitsspeicher. Dann sind allerdings nur kleine Auflösungen von 0,3–0,4 Megapixeln, also ungefähr 480–600p, sowie 5-Sekunden-Clips möglich. Bei LTX 2.3 häufen sich auf 8-GB-Karten Out-of-Memory-Fehler; ein Nutzer bezeichnet seine Speichererfahrung sogar als „Katastrophe“.
Prompt-Treue und Physik: H3 setzt sich klar ab
Ist LTX bei der Geschwindigkeit im Vorteil, übernimmt H3 bei Prompt-Verständnis deutlich die Führung. Mehrere Teilnehmer des verlinkten Reddit-Vergleichsthreads bevorzugten H3 bei Prompt-Treue und Physik:
„MiniMax H3 ist deutlich einfacher zu bedienen. Ordentliche Szenen lassen sich erzeugen, ohne komplizierte, extrem beschreibende Prompts zu schreiben. Das allein entscheidet es für mich.“ – Reddit-Nutzer nvidiot, r/StableDiffusion
„Nach meinen Tests versteht Minimax Physik und Prompt-Following sehr gut. Es scheut auch grafische Szenen wie Action oder Blut nicht. Ich komme mit vier Sätzen zum Ergebnis, während LTX zwei Absätze brauchte.“ – Reddit-Nutzer Fit_Satisfaction2953
Der Unterschied bei der Physik betrifft vor allem die Objektpermanenz. LTX 2.3 lässt Objekte häufig durch andere Objekte hindurchgehen oder mitten in der Szene verschwinden. H3 nutzt einen 33B DiT und die Hidden States der 50. Schicht von Qwen3-VL-32B als Text-Encoder. Community-Tester führen das stärkere räumliche Tracking auf diese größere Architektur zurück. Nutzer SX2k7 formulierte es so: „Bei LTX verschwinden Dinge einfach viel zu oft oder bewegen sich ohne Grund durch einander hindurch.“
Nutzer im selben Reddit-Thread berichten außerdem, H3 sei weniger stark zensiert als LTX und Wan. Actionszenen, Blut und physisch intensive Momente seien möglich, während diese Modelle sie standardmäßig filtern.
Image-to-Video: H3 hält Gesichter konsistenter
H3s Ref2Vid-Funktion (Reference-to-Video) sticht bei der Identitätstreue heraus. Gibt man ein Charakterbild vor, hält das Modell laut Community-Testern die Gesichtszüge über einen vollständigen Clip hinweg – selbst wenn die Figur aus dem Bild läuft und später zurückkehrt.
Der Image-to-Video-Modus von LTX 2.3 wurde mit dieser Version verbessert: weniger eingefrorene Bilder und weniger künstliche Bewegungsartefakte im Ken-Burns-Stil. Identity Drift bleibt jedoch ein bekanntes Problem:
„Ja, ich habe I2V getestet: Die Figur war 10 Sekunden lang außerhalb des Bildes und schaute am Ende wieder hinein – identisches Gesicht. LTX dagegen so: ‚Wer ist das?‘“ – Reddit-Nutzer kemb0
Für Produktaufnahmen, konsistente Figuren und Markenprojekte, bei denen dasselbe Gesicht einen 10-Sekunden-Clip überstehen muss, ist H3 unter den Open-Weights-Modellen die stärkere Wahl.
Audio-reaktive LoRA-Workflows: LTX bleibt flexibler
Hier besitzt LTX 2.3 weiterhin einen strukturellen Vorteil, den H3 bislang nicht ausgleichen kann. Das LTX-Ökosystem hatte über Monate Zeit, eigene Werkzeuge aufzubauen:
- Style LoRAs: Das Modell auf eine bestimmte Bildästhetik wie Stop-Motion, Handarbeit oder Miniaturen abstimmen und pro Shot wechseln
- HDR IC-LoRA: Direkt in HDR mit erweitertem Dynamikumfang generieren oder SDR-Material für Finishing-Pipelines nach EXR konvertieren
- Audio-to-Video-Endpunkt: Einen Audioclip vorgeben und LTX erzeugt passende Bilder – praktisch für musikgetriebene Inhalte und Social Clips, bei denen Sound und Bewegung synchron sein müssen
- ComfyUI-Workflows mit seedhunter und director: Von der Community gebaute Mehrfach-Pass-Pipelines, die Seeds für das beste Ergebnis durchiterieren und anschließend die Komposition verfeinern
- Natives Porträtformat 9:16: Mit Daten im Hochformat trainiert statt aus Landschaftsformaten beschnitten – wichtig für vertikale Social-Inhalte
- 24/48-FPS-Optionen: Flexible Bildraten zur Anpassung an die Vorgaben des finalen Outputs
H3 bietet im Vergleich einen schlanken Workflow: Text-to-Video, Image-to-Video und Reference-to-Video inklusive Audio. Es gibt keine LoRA-Trainingspipeline, keine Style-Adapter und keine HDR-Ausgabe. Die Gewichte sind zum Zeitpunkt dieses Artikels erst acht Tage alt, sodass sich diese Lücken schließen könnten. Wer aber bereits LTX-LoRA-Bibliotheken und abgestimmte ComfyUI-Graphs besitzt, zahlt beim Wechsel heute einen echten Preis.
Nutzer l2ddit fasste die Spannung treffend zusammen: „Ich bin so froh, dass ich jetzt all diese LTX-Loras löschen kann, die nichts zur Lösung der Probleme beigetragen haben. Das Einzige, was LTX besser konnte, war nicht-englische Voice-Synchronisation.“
Kosten: Lokal rendern oder API nutzen?
Lizenztechnisch ist der lokale Betrieb beider Modelle kostenlos, doch die Renderzeit ist der eigentliche Kostenfaktor. Bei gehosteten APIs ist der Preisunterschied deutlich:
| Endpunkt | LTX 2.3 (fal.ai) | MiniMax H3 (gehostet) |
|---|---|---|
| Text-to-Video 1080p | $0.06/s | Noch nicht per API veröffentlicht |
| Text-to-Video 4K/2K | $0.24/s (4K) | Noch nicht per API veröffentlicht |
| Fast-Variante 1080p | $0.04/s | N/A |
| Audio-to-Video | $0.10/s | Im Video enthalten |
| Image-to-Video | $0.06-0.24/s | Im Video enthalten |
| Extend / Retake | $0.10/s | Noch nicht verfügbar |
Ein konkretes Budgetbeispiel: Ein 5-Sekunden-Clip in 1080p kostet mit LTX 2.3 über fal.ai $0.30. Mit der Fast-Variante sinkt der Preis auf $0.20. Die Preise für MiniMax H3s gehostete API waren zum Zeitpunkt dieses Artikels noch nicht öffentlich bekannt. Lokal lassen sich beide Modelle kostenlos ausführen, doch ein 11-Minuten-Render auf einer 3060 verursacht bei H3 spürbare Iterationskosten.
Die Gewichte von LTX 2.3 sind unter Apache 2.0 auf HuggingFace verfügbar; für kommerzielles Embedding bei Unternehmen mit mehr als $10M Jahresumsatz gilt die LTX Model License. Die H3-Gewichte finden sich auf HuggingFace unter der MiniMax Community License. Beide erlauben die lokale Offline-Nutzung. Die API-Preise für LTX 2.3 stammen von der Modellseite von fal.ai.
Produktionspraxis: Welcher Shot gehört wohin?
Die meisten Creator müssen sich nicht auf ein einziges Modell festlegen. Ein hybrider Workflow nutzt die jeweiligen Stärken:
H3 einsetzen, wenn:
- Der Shot komplexe Physik erfordert – Kollisionen, schnelle Bewegungen oder physische Interaktionen
- Die Identität einer Figur über einen längeren Clip stabil bleiben muss, etwa bei Produktenthüllungen oder narrativen Szenen
- Nativer Stereo-Sound ohne separaten Sound-Pass gefragt ist
- Einfache Prompts wichtig sind: vier Sätze statt zwei Absätze
- Die GPU im unteren Bereich liegt, mit 8–12 GB VRAM, und längere Renderzeiten akzeptabel sind
LTX 2.3 einsetzen, wenn:
- Schnelle Iterationen nötig sind – für Storyboards, Timing-Tests oder Entwurfsvorschauen
- Ein eigenes LoRA den visuellen Stil definiert
- Vertikaler 9:16-Content für Social Media ausgeliefert wird
- 4K erforderlich ist, da H3 bei 2K endet
- Audio-to-Video-Synchronität gebraucht wird und eine vorhandene Audiospur die Bildwelt steuert
- Geschwindigkeit wichtiger ist als maximale Qualität pro Frame
Ein sinnvoller Ablauf: Mit LTX Fast zunächst Blocking und Timing prüfen, anschließend den freigegebenen Shot für Physik, Identität und Audio in H3 rendern. Upscaling erst nach der Shot-Freigabe anwenden. Weil erneute H3-Renderläufe viel Zeit kosten, lohnt es sich, die Einstellung vorher sauber festzuzurren.
FAQ
Ist MiniMax H3 besser als LTX 2.3?
H3 liegt bei Qualität, Prompt-Treue und Identitätserhalt vorn. LTX 2.3 gewinnt bei Geschwindigkeit, LoRA-Anpassung und 4K-Ausgabe. Die Wahl sollte vom Shot-Typ abhängen, nicht von der Marke.
Läuft MiniMax H3 auf Consumer-GPUs?
Ja. Das INT8-pruned-Modell läuft mit 8 GB VRAM plus 16 GB RAM bei ungefähr 480–600p und 5 Sekunden Länge. Für H3 in voller Präzision sind 24 GB VRAM vorteilhaft.
Unterstützt H3 LoRA-Fine-Tuning?
Noch nicht. Seit Veröffentlichung der Gewichte am 3. August 2026 gibt es für H3 keine LoRA-Pipeline. LTX 2.3 unterstützt Style LoRAs, HDR IC-LoRAs und Character LoRAs.
Welches Modell liefert das bessere Audio?
Beide erzeugen Audio nativ. H3 liefert Stereo-Sound mit mehr Umgebungsdetails. LTX 2.3 hat einen verbesserten Vocoder für sauberere Ausgabe und bietet einen Audio-to-Video-Endpunkt, der aus einem eingegebenen Audioclip passende Bilder generiert.
Wie viel VRAM brauche ich für die beiden Modelle?
H3 INT8 benötigt mindestens 8 GB VRAM plus 16 GB RAM für 480p. H3 in voller Präzision profitiert von 24 GB VRAM. Für LTX 2.3 gelten rund 12 GB VRAM als praktisches Minimum; bei 8-GB-Karten gibt es Berichte über OOM-Fehler.