AIREITER

Real-ESRGAN 指南(2026):权重、下载、GUI 与 ncnn-vulkan

最后更新: 2026-08-20 01:39:55

开源五年、GitHub 仓库已有 36,500 星,采用 BSD-3-Clause 许可证;Real-ESRGAN 的 ncnn-vulkan 版本还能同时兼容 AMD、Intel 与 NVIDIA GPU。对于静态图片和动漫图,它依然是默认的免费选择;但要处理长篇真实视频,它并不是合适的工具。

2026 年结论:Real-ESRGAN 还能赢什么,又输在哪里

Real-ESRGAN 最大的优势是普适性:整套工具免费、可离线运行,对 AMD、Intel 和 NVIDIA GPU 一视同仁。短板则集中在视频和重度修复。它逐帧独立处理视频,容易产生闪烁;而ICCVW 2021 论文所描述的 GAN 训练基于纯合成退化数据,核心是锐化已有细节,而不是重新生成细节。

Reddit 的 r/upscaling 社区用户把它概括得很直白:

“慢得离谱,但效果还行。”——u/ChemistryAdorable956,r/upscaling

六个权重怎么选:x4plus、x2plus、anime_6B 及其他版本

模型选对了,往往比你用哪个软件更重要。官方发布的六个权重都可以在项目的 Releases 页面找到。

权重文件原生倍率适用场景来源
RealESRGAN_x4plus.pth4x照片、通用图片Release v0.1.0
RealESRGAN_x2plus.pth2x只需要放大一倍的照片Releases 页面
RealESRGAN_x4plus_anime_6B.pth4x动漫、插画、线稿Release v0.2.2.4
RealESRNet_x4plus.pth4x通用图片、更稳妥的纹理表现Releases 页面
realesr-general-x4v34x压缩严重或噪点较多的素材Releases 页面
realesr-animevideov34x动漫视频帧随 ncnn 压缩包附带

别踩格式坑:ncnn 便携版根本不用 .pth 文件。它在 models 文件夹中自带预转换的 .param/.bin 模型,因此只有走 Python 路线时才需要下载 .pth 权重。还有一点来自官方 README:官方在线演示只提供 anime 6B 模型,别拿它来判断照片的实际效果。

方案一:ncnn-vulkan 便携版,不用 CUDA 也不用 Python

想最快上手,直接从 Real-ESRGAN-ncnn-vulkan 发布页下载便携版可执行程序即可。最新版本 v0.2.0 发布于 2022 年 4 月 24 日,提供三个压缩包:Windows 为 2.2 MB、Ubuntu 为 3.7 MB、macOS 为 8.5 MB。解压后,在该文件夹打开终端并执行:

./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4

不需要 CUDA、PyTorch 或 Python。官方 README说明,它通过 Vulkan 支持 Intel、AMD 和 NVIDIA GPU。把 -i 指向一个目录而不是单个文件,就会批量处理其中全部 JPG、PNG 与 WebP 图片。

参数作用
-i / -o输入和输出文件或目录
-n模型名称:realesrgan-x4plus、realesrnet-x4plus、realesrgan-x4plus-anime、realesr-animevideov3
-s倍率:2、3 或 4,默认值为 4
-t分块尺寸,≥32,或设为 0 自动处理;显存不足时调低
-g / -j多 GPU 设备的 GPU id;加载:处理:保存的线程数量
-xTTA 模式,以速度换取画质
-f输出格式:png(默认)、jpg、webp
Real-ESRGAN ncnn-vulkan 的 GitHub 发布页面,展示可下载的 v0.2.0 Windows、macOS 和 Ubuntu 文件

README 也明确记录了两个限制:ncnn 版本没有与 outscale 对应的功能;其分块拼接机制可能造成块与块之间不一致,结果会和 PyTorch 路线略有差异。另外,在原生 4x 的 x4plus 权重上使用 -s 2 是个坑:参数虽然接受,但用户反馈输出会崩坏。

“realesrgan-ncnn-vulkan 把倍率设成 4 以外的任何值都会毁掉输出,这是什么情况?”——@hogehoge61,X

如果目标就是 2x 输出,与其和这个参数较劲,不如在 GUI 或 Python 路线中使用 x2plus 权重。

方案二:Python 与 PyTorch,功能最完整

项目的完整功能都在 Python 路线中。仓库本身就带有 inference_realesrgan.py 脚本;按照官方 README的安装流程,要求 Python 3.7+ 与 PyTorch 1.7+:

git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results

这些附加参数的价值在于:

  • --face_enhance 会对检测到的人脸运行 GFPGAN;第二条命令则是照片原生 2x 放大的标准用法。
  • --outscale 可设定任意输出倍率,例如 3.5x。但 README 说得很清楚:它只是对 4x 输出进行 LANCZOS4 缩放,并非原生倍率。
  • 根据 README,只有 Python 路线支持带 Alpha 通道、灰度和 16 位图片。
  • 推理默认使用 fp16;如需完整精度,传入 --fp32。

方案三:GUI 工具 Upscayl 与 Real-ESRGAN GUI

不想碰终端、只想把文件夹拖进去处理,主流选择是 Upscayl。这是一款基于 Real-ESRGAN 和 Vulkan 的免费 AGPL 许可证桌面应用,支持 Windows、macOS 与 Linux;它提供文件夹批量队列、面向重度 JPEG 压缩图的“Double Upscayl”二次处理,安装后可离线运行,并支持 PNG/JPG/WebP 最高 16x 输出。官网建议使用支持 Vulkan 的独立显卡。

Upscayl:一款适用于 Windows、macOS 和 Linux 的免费开源 Real-ESRGAN 放大 GUI

更轻量的替代方案是 TransparentLC 的 realesrgan-gui。这是一个跨平台 Tkinter 前端,也能驱动 Real-CUGAN,并且检测到时会优先使用新版 upscayl-ncnn 二进制文件。需要成熟的批量处理体验就选 Upscayl;需要脚本化、ffmpeg 工作流或精确控制模型时,命令行方案更合适。

动漫还是照片:按素材选模型,别凭习惯

动漫、漫画分镜和线稿应使用 anime_6B。按照官方 README的说明,它是针对动漫图像优化、体积更小的模型,项目还提供了它与 waifu2x 的对比。照片则应选择 x4plus,如果只需放大一倍则选 x2plus。旧扫描件、重度 JPEG、截图等压缩严重或噪点多的素材,适合 realesr-general-x4v3。该模型的 README 专门记录了 -dn 降噪强度,用于在清理噪点与避免这一模型家族常见的过度平滑之间取得平衡。

r/upscaling 用户反复遇到的一条边界很明确:把动漫权重用在真人身上,可能生成不稳定、出错的人脸。在那篇讨论中,u/Green-Cucumber8507 的第一条回复就是“用的是哪个模型变体?”。对于人脸清晰可见的人像,更值得走 Python 路线并加上 --face_enhance,让 GFPGAN 修复放大过程中被抹平的面部细节。

常见故障与对应处理办法

提示“Vulkan device not found”或一启动就崩溃

按以下顺序排查:

  1. 先更新显卡驱动。
  2. 确认显卡报告支持 Vulkan;Upscayl 的 Windows 故障排查指南提供了检查方法。
  3. 如果是双 GPU 笔记本或桌面设备,在系统图形设置中强制让应用使用独立显卡。

程序静默退出,以及 models 文件夹问题

如果可执行文件发生段错误或静默退出,没打印任何报错,先检查 -m:它必须指向存放已转换模型文件的目录。请保持可执行文件与其 models 文件夹和发布时的原始结构一致。

视频显存爆掉:8 GB 显卡的处理流程

长视频最容易耗尽显存。@bi_9527zx 曾在 X 分享过一套适用于 8 GB 显卡的可行流程:卸载其他所有模型,用 ffmpeg 将视频拆成 PNG 帧,逐帧进行 4x 放大,再借助 ffmpeg 缩放和填充后重新合成。它确实能跑通,但也真实反映了代价:

“由于每一帧都是独立处理,仍可能存在一些闪烁。”——u/Dagnarus15,r/upscaling

速度瓶颈确实存在

给一个量级参考:@zinya2dx 在 X 表示,GPU 满载运行约一小时,才能将约 20 秒 SD 画质视频放大到 4K。静态图片就友好得多:@Tomoari_hsmt 在 X 测得,在一块 860M 级别、配有 NPU 的 GPU 上,每张图大约需要 2 秒。

2026 年 Real-ESRGAN、Topaz 与 SeedVR2 怎么选

如今,Real-ESRGAN 面对的是订阅制商业套件,以及能够重新生成细节的开源扩散式放大工具。

Real-ESRGANTopaz GigapixelByteDance SeedVR2
许可证与价格BSD-3,免费Personal 为 $149/年,Pro 为 $499/年(官方定价)Apache-2.0,免费
硬件要求通过 ncnn 支持任何 Vulkan GPU在自有 GPU 上运行的桌面应用NVIDIA GPU,且需要充足显存(3B/7B 变体)
技术路线GAN 锐化已有细节商业 GAN/CNN 套件,支持按模型控制一步扩散重建细节
报告的吞吐量x4、720p、fp16 下为 1.7 fps(RTX 5090)Proteus:1080p 为 15 fps,4K 为 7.3 fps4K 级扩散:0.2–2 fps
需要注意视频闪烁,重度损坏素材纹理偏平订阅价格有文档记录会对 720p AI 生成视频过度锐化
RTX 5090 上的放大速度测量柱状图:Topaz Proteus 在 1080p 为 15 fps、4K 为 7.3 fps;Real-ESRGAN 在 x4 720p fp16 下为 1.7 fps

全部吞吐量数据都来自一项持续更新的开放基准测试,测试于 2026 年 6 月在 RTX 5090 上完成。不同工具的工作负载并不相同:Real-ESRGAN 测的是 720p 输入的 x4 fp16,Topaz Proteus 则测了 1080p 与 4K。因此应把这些数字理解为量级参考,并以该基准测试自身的推荐作为优先级:便宜的批量任务和预览用 Real-ESRGAN,电影级 4K 用 SeedVR2-7B。

ByteDance 在 ICLR 2026 发布的 SeedVR2 采用 Apache-2.0 许可证,通过扩散方式重建细节。这是反过来的取舍:按该基准测试的方法说明,扩散式放大器更适合合成输入,却可能生成一张全新的人脸,并在帧间发生漂移。边缘处理方面,新一代开源工具已经领先;一位在 X 上对比 Real-ESRGAN 和 FlashVSR 的用户说得很直接:

“RealESRGAN 最终得到的细节更少。”——@dawidope,X

一些老用户也因为困难素材上的细节爆掉而放弃它。@realrebelai 在 X 写道:“我只是发现它有时会把细节冲掉。”随后转向 Topaz 作为救急方案。

走 API 则完全绕开本地硬件问题。Replicate 托管的 nightmareai/real-esrgan 每 1,000 张输出图片收费 $2,即每张 $0.002;支持最高 10 倍放大和 GFPGAN 人脸开关,建议输入低于 1440p。该页面的运行计数器显示,它已运行约 9,700 万次;页面中的单个预测示例约在 2.5 秒内完成。如果本地安装本身就是障碍,AIReiter 的在线放大器也能在浏览器中完成同样的工作。

快速问答:许可证、硬件、视频与 .pth 文件

Real-ESRGAN 可以免费商用吗?

可以。项目采用 BSD 3-Clause 许可证,这是开源领域最宽松的许可证之一。转换后的 ncnn 二进制文件和发布权重随仓库提供;在发布商业产品前,仍应阅读各仓库中的 LICENSE 文件。

Real-ESRGAN 必须使用 NVIDIA GPU 吗?

不需要。ncnn-vulkan 版本和 Upscayl 都可通过 Vulkan 在 Intel、AMD 与 NVIDIA GPU 上运行。CUDA 只与 Python/PyTorch 路线有关;在这条路线中,NVIDIA 显卡是更快的选择。

Real-ESRGAN 能放大视频吗?

只能逐帧处理。realesr-animevideov3 可用于动漫片段,开放基准测试也将 Real-ESRGAN 与 vs_temporalfix VapourSynth 滤镜搭配用于预览;但每帧独立放大的机制决定了时序闪烁无法彻底消除。

能把 .pth 文件直接加载到 ncnn-vulkan 吗?

不能直接加载。ncnn 需要已转换的 .param/.bin 文件。虽然存在转换方法,但限制很严格:

“不过它只适用于旧架构的 4x 模型。”——u/nmkd,r/GameUpscale

哪个执行后端最快?

模型相同,后端未必相同。一位长期用户发现,离开 Vulkan 后,同样的工作慢得多:“对我来说,它比使用 Vulkan 时慢很多。”u/SouthernVisit3076 在 r/software 如此表示。别急着怪模型,先在自己的显卡上跑一遍基准测试。

今晚该用哪条路线

Real-ESRGAN 是锐化你已有的像素,扩散工具则会替换它们。你的素材更看重真实性还是美感,决定了该选哪一条路线:

你的情况建议做法
照片,不想用终端使用 Upscayl,并选择 Real-ESRGAN 模型
动漫或线稿使用 Upscayl 或 ncnn,搭配 anime_6B / realesrgan-x4plus-anime
照片放大 2xPython 路线,使用 RealESRGAN_x2plus
老旧、压缩严重、有噪点的扫描件使用 realesr-general-x4v3,并调高 -dn
人脸很重要的人像Python 路线加 --face_enhance
动漫视频片段ncnn 路线,使用 realesr-animevideov3
真实拍摄素材或 4K 视频不要用 Real-ESRGAN,改用 SeedVR2 或 Topaz
数百张图片,没时间占用 GPUAPI:Replicate,$0.002/张

延伸阅读:免费 AI 视频放大器对比,以及含定价与替代方案的 Replicate 评测。