Seit fünf Jahren bringt es Real-ESRGAN auf 36.500 Sterne im GitHub-Repository, steht unter der BSD-3-Clause-Lizenz und läuft in der ncnn-vulkan-Variante gleichermaßen auf AMD-, Intel- und NVIDIA-GPUs. Für Einzelbilder und Anime bleibt es der naheliegende kostenlose Standard. Für längere Videos mit realen Aufnahmen ist es dagegen die falsche Wahl.
Real-ESRGAN 2026: Wo es weiterhin überzeugt – und wo nicht
Seine größte Stärke ist die breite Nutzbarkeit: Der gesamte Stack ist kostenlos, funktioniert offline und behandelt AMD-, Intel- und NVIDIA-GPUs gleich. Bei Video verliert Real-ESRGAN, weil jedes Frame unabhängig verarbeitet wird. Auch bei aufwendiger Restauration stößt es an Grenzen: Das ICCVW-2021-Paper beschreibt ein GAN, das ausschließlich mit synthetischen Verschlechterungen trainiert wurde. Es schärft vorhandene Details, statt neue zu rekonstruieren.
Das Urteil aus den r/upscaling-Threads auf Reddit lässt sich auf einen Satz verdichten:
"Slow as crap but looks decent." - u/ChemistryAdorable956, r/upscaling
Alle Real-ESRGAN-Weights im Überblick: x4plus, x2plus, anime_6B und mehr
Die Wahl des Modells beeinflusst das Ergebnis stärker als die Anwendung, in der es läuft. Alle sechs veröffentlichten Weights finden sich auf der offiziellen Releases-Seite des Projekts.
| Weight-Datei | Native Skalierung | Geeignet für | Quelle |
|---|---|---|---|
RealESRGAN_x4plus.pth | 4x | Fotos, allgemeine Bilder | Release v0.1.0 |
RealESRGAN_x2plus.pth | 2x | Fotos, die nur verdoppelt werden sollen | Releases-Seite |
RealESRGAN_x4plus_anime_6B.pth | 4x | Anime, Illustrationen, Line-Art | Release v0.2.2.4 |
RealESRNet_x4plus.pth | 4x | Allgemeine Bilder, zurückhaltendere Texturen | Releases-Seite |
realesr-general-x4v3 | 4x | Komprimierte oder verrauschte Vorlagen | Releases-Seite |
realesr-animevideov3 | 4x | Anime-Video-Frames | Im ncnn-Zip enthalten |
Eine wichtige Formatfalle: Die portable ncnn-Version verwendet keine .pth-Dateien. Sie enthält bereits konvertierte .param/.bin-Modelle im Ordner models. .pth-Downloads sind also nur für den Python-Weg relevant. Noch eine Besonderheit aus der README: Im offiziellen Online-Demo ist ausschließlich das Anime-6B-Modell verfügbar. Seine Fotoqualität sollte deshalb nicht als Maßstab dienen.
Weg 1: ncnn-vulkan portabel nutzen – ohne CUDA und Python
Am schnellsten geht es mit der portablen ausführbaren Datei von der Real-ESRGAN-ncnn-vulkan-Releases-Seite. Das jüngste Release v0.2.0 vom 24. April 2022 bietet drei ZIP-Dateien: Windows mit 2,2 MB, Ubuntu mit 3,7 MB und macOS mit 8,5 MB. Entpacken, ein Terminal im Ordner öffnen und ausführen:
./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4
Kein CUDA, kein PyTorch, kein Python: Laut offizieller README funktioniert die Anwendung per Vulkan auf Intel-, AMD- und NVIDIA-GPUs. Verweist -i auf einen Ordner statt auf eine Datei, verarbeitet das Tool alle darin enthaltenen JPG-, PNG- und WebP-Dateien im Batch.
| Option | Funktion |
|---|---|
-i / -o | Eingabe- und Ausgabedatei oder -ordner |
-n | Modellname: realesrgan-x4plus, realesrnet-x4plus, realesrgan-x4plus-anime, realesr-animevideov3 |
-s | Skalierung: 2, 3 oder 4, Standard ist 4 |
-t | Tile-Größe, ≥32 oder 0 für automatisch – bei VRAM-Mangel verringern |
-g / -j | GPU-ID für Multi-GPU-Systeme; Thread-Anzahl für Laden:Verarbeiten:Speichern |
-x | TTA-Modus: bessere Qualität auf Kosten der Geschwindigkeit |
-f | Ausgabeformat: png (Standard), jpg, webp |
Zwei bekannte Einschränkungen sind in derselben README dokumentiert: Die ncnn-Version kennt kein Äquivalent zu outscale, und durch das Aufteilen sowie Zusammenfügen von Tiles können Block-Artefakte entstehen. Die Resultate können daher leicht vom PyTorch-Weg abweichen. Auch -s 2 mit den nativ auf 4x ausgelegten x4plus-Weights ist eine Falle: Die Option wird zwar akzeptiert, Nutzer berichten jedoch von fehlerhaften Ergebnissen.
"realesrgan-ncnn-vulkan where setting scale to anything other than 4 breaks the output - what is this?" - @hogehoge61, X
Für eine 2x-Ausgabe sind die x2plus-Weights über eine GUI oder den Python-Weg die bessere Wahl, statt mit dieser Option zu kämpfen.
Weg 2: Python und PyTorch für den vollen Funktionsumfang
Der Python-Weg bietet den vollständigen Funktionsumfang des Projekts. Das Skript inference_realesrgan.py liegt direkt im Repository. Der Installationsablauf aus der offiziellen README verlangt Python 3.7+ und PyTorch 1.7+:
git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results
Das leisten die zusätzlichen Optionen:
--face_enhancestartet GFPGAN für erkannte Gesichter; der zweite Befehl ist das native 2x-Rezept für Fotos.--outscaleerlaubt beliebige Ausgabegrößen, etwa 3,5x. Die README weist aber klar darauf hin, dass dabei die 4x-Ausgabe mit LANCZOS4 skaliert wird – keine native Skalierung.- Alphakanäle, Graustufen- und 16-Bit-Bilder werden laut README nur über diesen Python-Weg unterstützt.
- Die Inferenz läuft standardmäßig mit fp16.
--fp32erzwingt volle Präzision.
Weg 3: GUI-Apps mit Upscayl und Real-ESRGAN GUI
Wer Ordner lieber per Drag-and-drop verarbeitet als mit dem Terminal, landet meist bei Upscayl. Die kostenlose Desktop-App unter AGPL-Lizenz läuft auf Windows, macOS und Linux, basiert auf Real-ESRGAN und Vulkan und bietet Batch-Warteschlangen für Ordner. Für stark komprimierte JPEGs gibt es mit „Double Upscayl“ einen zweiten Durchlauf. Nach der Installation arbeitet die App offline und exportiert PNG, JPG oder WebP bis 16x. Die offizielle Website empfiehlt eine dedizierte Vulkan-fähige GPU.
Leichtergewichtig ist TransparentLC's realesrgan-gui: ein plattformübergreifendes Tkinter-Frontend, das auch Real-CUGAN ansteuern kann und bevorzugt die neuere Binärdatei upscayl-ncnn verwendet, wenn sie gefunden wird. Upscayl ist die Wahl für einen ausgereiften Batch-Workflow. CLI-Varianten bleiben besser, wenn Skripting, ffmpeg-Pipelines oder exakte Modellkontrolle gefragt sind.
Für Anime und Fotos nicht dasselbe Modell verwenden
Anime, Manga-Panels und Line-Art gehören zu anime_6B. Laut offizieller README ist es ein auf Anime-Bilder spezialisiertes und deutlich kleineres Modell; das Projekt verlinkt zudem einen eigenen Vergleich mit waifu2x. Fotos gehören zu x4plus – oder zu x2plus, wenn Verdoppeln genügt. Komprimierte oder verrauschte Quellen wie alte Scans, stark komprimierte JPEGs und Screenshots sind ein Fall für realesr-general-x4v3. Die für dieses Modell in der README dokumentierte Entrauschungsstärke -dn soll genau den Kompromiss zwischen Bereinigung und der für diese Modellfamilie typischen übermäßigen Glättung steuern.
Eine Grenze, auf die Nutzer in r/upscaling regelmäßig stoßen: Werden Anime-Weights auf echte Menschen angewendet, führen sie Berichten zufolge zu instabilen, fehlerhaften Gesichtern. Die erste Antwort von u/Green-Cucumber8507 in diesem Thread lautet: "What variant of the model?" Bei Porträts mit sichtbaren Gesichtern ist der Python-Weg mit --face_enhance sinnvoll, damit GFPGAN Details repariert, die das Upscaling geglättet hat.
Typische Probleme – und was dagegen hilft
„Vulkan device not found“ oder Absturz direkt beim Start
Diese Punkte der Reihe nach prüfen:
- Zuerst den GPU-Treiber aktualisieren.
- Sicherstellen, dass die Grafikkarte Vulkan-Unterstützung meldet; die Windows-Fehlerbehebung von Upscayl erklärt den Test.
- Bei Laptops und Desktop-PCs mit zwei GPUs die Anwendung in den Grafik-Einstellungen des Systems auf die dedizierte GPU zwingen.
Stiller Abbruch und der models-Ordner
Wenn die ausführbare Datei einen Segfault auslöst oder ohne Fehlermeldung endet, sollte zuerst -m geprüft werden: Die Option muss auf einen Ordner mit den konvertierten Modelldateien zeigen. Die ausführbare Datei und ihr Ordner models müssen genau in der gelieferten Struktur zusammenbleiben.
Kein Speicher bei Videos: der 8-GB-Workflow
Bei langen Videos ist der VRAM schnell erschöpft. @bi_9527zx beschrieb auf X einen funktionierenden Ablauf für eine 8-GB-Karte: Alle anderen Modelle aus dem Speicher entfernen, den Clip mit ffmpeg in PNG-Frames zerlegen, die Frames einzeln mit 4x hochskalieren und anschließend mit ffmpeg samt Skalierung und Padding wieder zusammensetzen. Das funktioniert, macht den Preis aber ehrlich sichtbar:
"Some flicker may still remain because each frame is processed independently." - u/Dagnarus15, r/upscaling
Die Geschwindigkeitsgrenze ist real
Zur Einordnung: @zinya2dx berichtet auf X von einer Stunde GPU-Volllast, um ungefähr 20 Sekunden SD-Video auf 4K hochzuskalieren. Einzelbilder sind deutlich weniger anspruchsvoll: @Tomoari_hsmt maß auf X ungefähr 2 Sekunden pro Bild auf einer GPU der 860M-Klasse mit NPU.
Real-ESRGAN vs. Topaz und SeedVR2 im Jahr 2026
Real-ESRGAN tritt inzwischen gegen Abo-Suiten und offene Diffusions-Upscaler an, die Details nicht nur schärfen, sondern neu generieren.
| Real-ESRGAN | Topaz Gigapixel | ByteDance SeedVR2 | |
|---|---|---|---|
| Lizenz und Preis | BSD-3, kostenlos | $149/Jahr Personal, $499/Jahr Pro (offizielle Preise) | Apache-2.0, kostenlos |
| Hardware | Jede Vulkan-GPU per ncnn | Desktop-App auf der eigenen GPU | NVIDIA mit viel VRAM (3B-/7B-Varianten) |
| Ansatz | GAN schärft vorhandene Details | Kommerzielle GAN/CNN-Suite mit modellbezogenen Einstellungen | One-Step-Diffusion generiert Details neu |
| Gemeldeter Durchsatz | 1,7 fps bei x4, 720p, fp16 (RTX 5090) | Proteus: 15 fps bei 1080p, 7,3 fps bei 4K | Diffusion in der 4K-Klasse: 0,2–2 fps |
| Zu beachten | Flimmern im Video, flache Texturen bei starken Schäden | Abo-Preise | Dokumentiertes Überschärfen von KI-generierten 720p-Videos |
Alle Durchsatzwerte stammen aus einem fortlaufend aktualisierten offenen Benchmark, der im Juni 2026 auf einer RTX 5090 lief. Die Workloads unterscheiden sich: Real-ESRGAN wurde mit x4 auf 720p-Eingabe in fp16 gemessen, Topaz Proteus bei 1080p und 4K. Die Werte sind daher als Größenordnungen zu lesen. Die Empfehlungen des Benchmarks selbst geben die Hierarchie vor: Real-ESRGAN für günstige Batches und Vorschauen, SeedVR2-7B für 4K in Kinoqualität.
SeedVR2 wurde von ByteDance unter Apache-2.0 veröffentlicht und auf der ICLR 2026 publiziert. Es generiert Details per Diffusion neu – mit dem umgekehrten Risiko: Nach den Methodikhinweisen dieses Benchmarks eignen sich Diffusions-Upscaler besser für synthetisches Material, können aber ein neues Gesicht erfinden und über Frames hinweg driften. Bei Kanten liegen neuere Open-Source-Tools bereits vorn. Ein X-Nutzer formulierte es beim Vergleich von Real-ESRGAN und FlashVSR so:
"RealESRGAN ends up with less." - @dawidope, X
Langjährige Nutzer steigen bei schwierigen Vorlagen zudem wegen verlorener Details aus: "i just notice it blows out details sometimes," schrieb @realrebelai auf X, bevor Topaz für ihn zum Rettungsanker wurde.
Über eine API erledigen sich alle Hardwarefragen. Replicates gehostetes nightmareai/real-esrgan kostet $2 pro 1.000 Ausgabebilder, also $0.002 pro Bild. Es unterstützt Skalierung bis 10 samt GFPGAN-Schalter für Gesichter, empfiehlt Eingaben unter 1440p und wurde laut Zähler auf dieser Seite etwa 97 Millionen Mal ausgeführt. Eine Beispielvorhersage auf der Seite war nach rund 2,5 Sekunden fertig. Wenn die lokale Installation das Hindernis ist, erledigt AIReiter's hosted upscaler dieselbe Aufgabe im Browser.
Kurz beantwortet: Lizenz, Hardware, Video und .pth-Dateien
Ist Real-ESRGAN kostenlos kommerziell nutzbar?
Ja. Das Projekt steht unter der BSD-3-Clause-Lizenz, einer der freizügigsten Open-Source-Lizenzen. Die konvertierten ncnn-Binärdateien und veröffentlichten Weights werden mit dem Repository bereitgestellt. Vor der Auslieferung eines kommerziellen Produkts sollte dennoch die LICENSE-Datei jedes verwendeten Repositorys gelesen werden.
Braucht Real-ESRGAN eine NVIDIA-GPU?
Nein. Die ncnn-vulkan-Version und Upscayl funktionieren per Vulkan auf Intel, AMD und NVIDIA. CUDA ist nur für den Python-/PyTorch-Weg relevant; dort ist eine NVIDIA-Karte der schnelle Weg.
Kann Real-ESRGAN Videos hochskalieren?
Nur Frame für Frame. realesr-animevideov3 verarbeitet Anime-Clips, und der offene Benchmark kombiniert Real-ESRGAN für Vorschauen mit dem VapourSynth-Filter vs_temporalfix. Vollständig verschwindet temporales Flimmern aber nicht, weil jedes Frame unabhängig hochskaliert wird.
Kann ich eine .pth-Datei in ncnn-vulkan laden?
Nicht direkt: ncnn benötigt konvertierte .param/.bin-Dateien. Eine Konvertierung ist möglich, hat aber klare Grenzen:
"Only works for old-architecture 4x models though." - u/nmkd, r/GameUpscale
Welches Execution-Backend ist am schnellsten?
Das Modell bleibt gleich, das Backend nicht. Ein langjähriger Nutzer fand dieselbe Aufgabe außerhalb von Vulkan deutlich langsamer: "it's much slower for me than when i use Vulkan," berichtete u/SouthernVisit3076 auf r/software. Erst die eigene Grafikkarte benchmarken, bevor das Modell verantwortlich gemacht wird.
Welche Variante heute Abend starten?
Real-ESRGAN schärft die vorhandenen Pixel, Diffusions-Tools ersetzen sie. Entscheidend ist daher, ob die Vorlage Belegmaterial oder vor allem eine ästhetische Ausgangsbasis ist:
| Situation | Empfehlung |
|---|---|
| Fotos, kein Terminal | Upscayl mit dem Real-ESRGAN-Modell |
| Anime oder Line-Art | Upscayl oder ncnn mit anime_6B / realesrgan-x4plus-anime |
| Fotos mit 2x | Python-Weg mit RealESRGAN_x2plus |
| Alte, komprimierte, verrauschte Scans | realesr-general-x4v3 mit höher eingestelltem -dn |
| Porträts, bei denen Gesichter zählen | Python mit --face_enhance |
| Anime-Video-Clips | ncnn mit realesr-animevideov3 |
| Reale Aufnahmen oder 4K-Video | Nicht Real-ESRGAN – SeedVR2 oder Topaz |
| Hunderte Bilder, keine GPU-Zeit | API: Replicate für $0.002/Bild |
Weiterführend: Kostenlose KI-Video-Upscaler im Vergleich und der Replicate-Test mit Preisen und Alternativen.