Con 36.500 estrellas en su repositorio de GitHub, cinco años de recorrido y licencia BSD-3-Clause, Real-ESRGAN sigue siendo la opción gratuita de referencia para ampliar imágenes fijas y anime. Su versión ncnn-vulkan funciona por igual con GPU de AMD, Intel y NVIDIA. Eso sí: para vídeo largo de imagen real, no es la herramienta adecuada.
Real-ESRGAN en 2026: dónde sigue destacando y dónde se queda corto
La gran ventaja de Real-ESRGAN sigue siendo su accesibilidad: toda la pila es gratuita, funciona sin conexión y no discrimina entre GPU AMD, Intel o NVIDIA. En vídeo pierde terreno, porque trata cada fotograma por separado. También se queda corto en restauraciones agresivas: el artículo de ICCVW 2021 describe un GAN entrenado exclusivamente con degradaciones sintéticas, diseñado para afinar detalle existente, no para regenerarlo.
El veredicto de los usuarios en los hilos de Reddit r/upscaling cabe en una frase:
"Lento de narices, pero el resultado está bastante bien." - u/ChemistryAdorable956, r/upscaling
Todos los pesos de Real-ESRGAN: x4plus, x2plus, anime_6B y compañía
El modelo elegido influye más en el resultado que la aplicación desde la que lo ejecutes. Los seis pesos publicados están disponibles en la página de Releases oficial del proyecto.
| Archivo de pesos | Escala nativa | Mejor para | Origen |
|---|---|---|---|
RealESRGAN_x4plus.pth | 4x | Fotos e imágenes generales | Release v0.1.0 |
RealESRGAN_x2plus.pth | 2x | Fotos que solo necesitan duplicar tamaño | Página de Releases |
RealESRGAN_x4plus_anime_6B.pth | 4x | Anime, ilustración y line art | Release v0.2.2.4 |
RealESRNet_x4plus.pth | 4x | Imágenes generales con texturas más seguras | Página de Releases |
realesr-general-x4v3 | 4x | Fuentes comprimidas o con ruido | Página de Releases |
realesr-animevideov3 | 4x | Fotogramas de vídeo anime | Incluido en el zip de ncnn |
Hay una trampa de formatos: la compilación portátil ncnn no usa archivos .pth en absoluto. Incluye modelos ya convertidos en formato .param/.bin dentro de su carpeta models, así que las descargas .pth solo importan si usas Python. Otro detalle del README: la demo online oficial solo expone el modelo anime 6B. No la uses para juzgar la calidad en fotografía.
Opción 1: ncnn-vulkan portátil, sin CUDA ni Python
La forma más rápida de empezar es descargar el ejecutable portátil desde la página de releases de Real-ESRGAN-ncnn-vulkan. La última versión, v0.2.0 (24 de abril de 2022), ofrece tres zips: Windows de 2,2 MB, Ubuntu de 3,7 MB y macOS de 8,5 MB. Descomprime el archivo, abre una terminal en esa carpeta y ejecuta:
./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4
No hace falta CUDA, PyTorch ni Python. El README oficial indica que funciona mediante Vulkan en GPU Intel, AMD y NVIDIA. Si en -i indicas una carpeta en lugar de un archivo, procesará por lotes todos los JPG, PNG y WebP que encuentre dentro.
| Parámetro | Para qué sirve |
|---|---|
-i / -o | Archivo o directorio de entrada y salida |
-n | Nombre del modelo: realesrgan-x4plus, realesrnet-x4plus, realesrgan-x4plus-anime, realesr-animevideov3 |
-s | Escala: 2, 3 o 4; el valor predeterminado es 4 |
-t | Tamaño de tile, ≥32 o 0 para automático; bájalo si te quedas sin VRAM |
-g / -j | ID de GPU en equipos con varias GPU; número de hilos de carga:proceso:guardado |
-x | Modo TTA: mejora la calidad a costa de velocidad |
-f | Formato de salida: png por defecto, jpg o webp |
Hay dos límites conocidos, ambos documentados en el README: la versión ncnn no tiene equivalente de outscale, y su sistema de dividir y recomponer tiles puede introducir inconsistencias por bloques, con resultados ligeramente distintos a los de PyTorch. Además, usar -s 2 con los pesos x4plus, nativos a 4x, es una trampa: el parámetro lo acepta, pero usuarios han informado de que la salida se rompe.
"realesrgan-ncnn-vulkan: poner la escala en cualquier valor que no sea 4 rompe la salida; ¿qué es esto?" - @hogehoge61, X
Si buscas salida a 2x, usa los pesos x2plus desde una GUI o mediante la ruta de Python, en lugar de pelearte con ese parámetro.
Opción 2: Python y PyTorch para acceder a todas las funciones
La ruta de Python es la que da acceso al conjunto completo de funciones del proyecto. El script inference_realesrgan.py viene incluido en el propio repositorio, y el proceso de instalación del README oficial requiere Python 3.7+ y PyTorch 1.7+:
git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results
Esto es lo que aportan los parámetros adicionales:
--face_enhanceejecuta GFPGAN en las caras detectadas; el segundo comando es la receta de 2x nativo para fotografías.--outscalepermite establecer escalas arbitrarias, como 3,5x, pero el README deja claro que es un redimensionado LANCZOS4 de la salida a 4x, no un escalado nativo.- Según el README, las imágenes con canal alfa, en escala de grises y de 16 bits solo están soportadas en esta ruta de Python.
- La inferencia usa fp16 por defecto; añade
--fp32para trabajar con precisión completa.
Opción 3: interfaces gráficas con Upscayl y Real-ESRGAN GUI
Si quieres arrastrar carpetas sin abrir una terminal, Upscayl es la alternativa más extendida. Es una aplicación de escritorio gratuita, con licencia AGPL, para Windows, macOS y Linux, basada en Real-ESRGAN y Vulkan. Ofrece colas por carpetas, una segunda pasada llamada "Double Upscayl" para JPEG muy comprimidos, funcionamiento offline tras la instalación y salida de hasta 16x en PNG/JPG/WebP. Su web oficial recomienda una GPU dedicada compatible con Vulkan.
La alternativa más ligera es realesrgan-gui de TransparentLC, un frontal multiplataforma en Tkinter que también puede manejar Real-CUGAN y que prefiere el binario más reciente upscayl-ncnn cuando lo detecta. Elige Upscayl si priorizas una experiencia de procesamiento por lotes pulida; recurre a la CLI si necesitas automatización, flujos con ffmpeg o control exacto sobre el modelo.
Anime o fotografía: elige el modelo según el contenido
Para anime, viñetas de manga y line art, el modelo indicado es anime_6B. Según el README oficial, es un modelo para imágenes anime optimizado para ocupar mucho menos espacio, y el proyecto enlaza su propia comparación con waifu2x. Para fotografías, usa x4plus, o x2plus si basta con duplicar la resolución. Las fuentes comprimidas o ruidosas, como escaneos antiguos, JPEG muy castigados y capturas, encajan con realesr-general-x4v3. Su intensidad de reducción de ruido -dn, documentada en el README para este modelo, está precisamente para equilibrar la limpieza con el exceso de suavizado característico de esta familia.
Hay un límite que se repite entre usuarios de r/upscaling: aplicar pesos de anime a personas reales puede generar caras inestables y llenas de artefactos. La primera respuesta de u/Green-Cucumber8507 en ese hilo fue: "¿Qué variante del modelo?". Para retratos con rostros visibles, conviene usar Python con --face_enhance, de modo que GFPGAN repare lo que el escalado suaviza en exceso.
Fallos habituales y cómo resolverlos
"Vulkan device not found" o cierres inmediatos
Sigue este orden:
- Actualiza primero el controlador de la GPU.
- Comprueba que la tarjeta informa de compatibilidad con Vulkan; la guía de resolución de problemas para Windows de Upscayl explica cómo hacerlo.
- En portátiles y sobremesas con dos GPU, fuerza la aplicación a usar la GPU dedicada desde la configuración gráfica del sistema.
Cierres silenciosos y la carpeta models
Si el ejecutable produce un segfault o se cierra sin mostrar un error, revisa primero -m: debe apuntar a una carpeta que contenga los archivos de modelo convertidos. Mantén el ejecutable y su carpeta models juntos, exactamente como se distribuyen.
Sin memoria en vídeo: el flujo de trabajo para 8 GB
El vídeo largo es donde la VRAM se agota. @bi_9527zx publicó en X un flujo que funciona con una tarjeta de 8 GB: descargar todos los demás modelos, separar el clip en fotogramas PNG con ffmpeg, ampliar cada fotograma individualmente a 4x y reconstruir el vídeo con escalado y relleno de ffmpeg. Funciona, pero deja claro el coste:
"Puede seguir habiendo algo de parpadeo porque cada fotograma se procesa de forma independiente." - u/Dagnarus15, r/upscaling
La barrera de velocidad existe
Para ponerlo en contexto: @zinya2dx informó en X de una hora de GPU a pleno rendimiento para ampliar unos 20 segundos de vídeo con calidad SD a 4K. Las imágenes fijas son bastante más llevaderas: @Tomoari_hsmt midió alrededor de 2 segundos por imagen en una GPU de la clase 860M con NPU, según X.
Real-ESRGAN frente a Topaz y SeedVR2 en 2026
Real-ESRGAN compite ahora con suites de suscripción y escaladores abiertos basados en difusión, que regeneran detalle en lugar de limitarse a afilarlo.
| Real-ESRGAN | Topaz Gigapixel | ByteDance SeedVR2 | |
|---|---|---|---|
| Licencia y precio | BSD-3, gratuito | $149/año Personal, $499/año Pro (precios oficiales) | Apache-2.0, gratuito |
| Hardware | Cualquier GPU Vulkan mediante ncnn | Aplicación de escritorio en tu propia GPU | NVIDIA con mucha VRAM (variantes 3B/7B) |
| Enfoque | El GAN afina detalle existente | Suite comercial GAN/CNN con controles por modelo | La difusión en un paso regenera detalle |
| Rendimiento informado | 1,7 fps a x4 720p fp16 (RTX 5090) | Proteus: 15 fps @1080p, 7,3 fps @4K | Difusión de clase 4K: 0,2–2 fps |
| Ten en cuenta | Parpadeo en vídeo y textura plana con daño intenso | Precio de suscripción | Sobreenfoque documentado en vídeo generado por IA a 720p |
Todos los datos de rendimiento proceden de un benchmark abierto que se actualiza continuamente, ejecutado en una RTX 5090 en junio de 2026. Las cargas de trabajo son distintas —Real-ESRGAN se midió a x4 sobre entrada 720p en fp16, mientras que Topaz Proteus se midió a 1080p y 4K—, así que tómalos como órdenes de magnitud. La jerarquía que plantea el propio benchmark es clara: Real-ESRGAN para lotes económicos y vistas previas; SeedVR2-7B para 4K con calidad cinematográfica.
SeedVR2, publicado por ByteDance en ICLR 2026 bajo licencia Apache-2.0, regenera detalles al estilo de la difusión. El intercambio es el inverso: según las notas metodológicas de ese benchmark, los escaladores por difusión encajan mejor con entrada sintética, pero pueden inventar una cara nueva y variar entre fotogramas. En contornos, las herramientas abiertas más recientes ya van por delante. Un usuario de X que comparó Real-ESRGAN con FlashVSR lo resumió así:
"RealESRGAN termina con menos." - @dawidope, X
Los usuarios veteranos también lo abandonan por la pérdida de detalle en fuentes difíciles: "a veces noto que revienta los detalles", escribió @realrebelai en X, antes de pasar a Topaz como salvavidas.
La ruta por API elimina cualquier duda sobre hardware. El modelo alojado nightmareai/real-esrgan de Replicate cuesta $2 por 1.000 imágenes de salida ($0.002 cada una), admite escalado hasta 10 con el interruptor facial de GFPGAN, recomienda entradas por debajo de 1440p y se ha ejecutado aproximadamente 97 millones de veces, según el contador de esa página. Un ejemplo de predicción de la misma página se completó en unos 2,5 segundos. Si el problema es instalar algo en local, el escalador alojado de AIReiter resuelve la misma tarea desde el navegador.
Respuestas rápidas: licencia, hardware, vídeo y archivos .pth
¿Real-ESRGAN es gratis para uso comercial?
Sí. El proyecto se distribuye bajo la licencia BSD 3-Clause, una de las licencias más permisivas del código abierto. Los binarios ncnn convertidos y los pesos publicados acompañan al repositorio; antes de lanzar un producto comercial, lee el archivo LICENSE de cada repositorio.
¿Real-ESRGAN necesita una GPU NVIDIA?
No. La versión ncnn-vulkan y Upscayl funcionan con Intel, AMD y NVIDIA mediante Vulkan. CUDA solo importa en la ruta Python/PyTorch, donde una tarjeta NVIDIA es la vía rápida.
¿Real-ESRGAN puede ampliar vídeo?
Solo fotograma a fotograma. realesr-animevideov3 sirve para clips de anime, y el benchmark abierto combina Real-ESRGAN con un filtro VapourSynth vs_temporalfix para vistas previas, pero el parpadeo temporal nunca desaparece del todo porque cada fotograma se amplía de forma independiente.
¿Puedo cargar un archivo .pth en ncnn-vulkan?
No directamente: ncnn necesita archivos .param/.bin convertidos. La conversión existe, pero tiene límites importantes:
"Solo funciona con modelos 4x de arquitectura antigua." - u/nmkd, r/GameUpscale
¿Qué backend de ejecución es más rápido?
El modelo es el mismo; el backend no. Un usuario de largo recorrido comprobó que el mismo trabajo era mucho más lento fuera de Vulkan: "para mí es mucho más lento que cuando uso Vulkan", informó u/SouthernVisit3076 en r/software. Prueba tu propia tarjeta antes de culpar al modelo.
Qué opción usar esta noche
Real-ESRGAN afina los píxeles que ya tienes; las herramientas de difusión los reemplazan. Elige según si tu fuente requiere fidelidad o una mejora estética:
| Tu situación | Haz esto |
|---|---|
| Fotos, sin terminal | Upscayl con el modelo Real-ESRGAN |
| Anime o line art | Upscayl o ncnn con anime_6B / realesrgan-x4plus-anime |
| Fotos a 2x | Ruta Python con RealESRGAN_x2plus |
| Escaneos antiguos, comprimidos o con ruido | realesr-general-x4v3 con -dn ajustado al alza |
| Retratos donde importan las caras | Python con --face_enhance |
| Clips de vídeo anime | ncnn con realesr-animevideov3 |
| Metraje real o vídeo 4K | No Real-ESRGAN: SeedVR2 o Topaz |
| Cientos de imágenes sin tiempo de GPU | API: Replicate a $0.002/imagen |
Lecturas relacionadas: comparativa de escaladores de vídeo con IA gratuitos y la reseña de Replicate con precios y alternativas.