开源五年、GitHub 仓库已有 36,500 星,采用 BSD-3-Clause 许可证;Real-ESRGAN 的 ncnn-vulkan 版本还能同时兼容 AMD、Intel 与 NVIDIA GPU。对于静态图片和动漫图,它依然是默认的免费选择;但要处理长篇真实视频,它并不是合适的工具。
2026 年结论:Real-ESRGAN 还能赢什么,又输在哪里
Real-ESRGAN 最大的优势是普适性:整套工具免费、可离线运行,对 AMD、Intel 和 NVIDIA GPU 一视同仁。短板则集中在视频和重度修复。它逐帧独立处理视频,容易产生闪烁;而ICCVW 2021 论文所描述的 GAN 训练基于纯合成退化数据,核心是锐化已有细节,而不是重新生成细节。
Reddit 的 r/upscaling 社区用户把它概括得很直白:
“慢得离谱,但效果还行。”——u/ChemistryAdorable956,r/upscaling
六个权重怎么选:x4plus、x2plus、anime_6B 及其他版本
模型选对了,往往比你用哪个软件更重要。官方发布的六个权重都可以在项目的 Releases 页面找到。
| 权重文件 | 原生倍率 | 适用场景 | 来源 |
|---|---|---|---|
RealESRGAN_x4plus.pth | 4x | 照片、通用图片 | Release v0.1.0 |
RealESRGAN_x2plus.pth | 2x | 只需要放大一倍的照片 | Releases 页面 |
RealESRGAN_x4plus_anime_6B.pth | 4x | 动漫、插画、线稿 | Release v0.2.2.4 |
RealESRNet_x4plus.pth | 4x | 通用图片、更稳妥的纹理表现 | Releases 页面 |
realesr-general-x4v3 | 4x | 压缩严重或噪点较多的素材 | Releases 页面 |
realesr-animevideov3 | 4x | 动漫视频帧 | 随 ncnn 压缩包附带 |
别踩格式坑:ncnn 便携版根本不用 .pth 文件。它在 models 文件夹中自带预转换的 .param/.bin 模型,因此只有走 Python 路线时才需要下载 .pth 权重。还有一点来自官方 README:官方在线演示只提供 anime 6B 模型,别拿它来判断照片的实际效果。
方案一:ncnn-vulkan 便携版,不用 CUDA 也不用 Python
想最快上手,直接从 Real-ESRGAN-ncnn-vulkan 发布页下载便携版可执行程序即可。最新版本 v0.2.0 发布于 2022 年 4 月 24 日,提供三个压缩包:Windows 为 2.2 MB、Ubuntu 为 3.7 MB、macOS 为 8.5 MB。解压后,在该文件夹打开终端并执行:
./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4
不需要 CUDA、PyTorch 或 Python。官方 README说明,它通过 Vulkan 支持 Intel、AMD 和 NVIDIA GPU。把 -i 指向一个目录而不是单个文件,就会批量处理其中全部 JPG、PNG 与 WebP 图片。
| 参数 | 作用 |
|---|---|
-i / -o | 输入和输出文件或目录 |
-n | 模型名称:realesrgan-x4plus、realesrnet-x4plus、realesrgan-x4plus-anime、realesr-animevideov3 |
-s | 倍率:2、3 或 4,默认值为 4 |
-t | 分块尺寸,≥32,或设为 0 自动处理;显存不足时调低 |
-g / -j | 多 GPU 设备的 GPU id;加载:处理:保存的线程数量 |
-x | TTA 模式,以速度换取画质 |
-f | 输出格式:png(默认)、jpg、webp |
README 也明确记录了两个限制:ncnn 版本没有与 outscale 对应的功能;其分块拼接机制可能造成块与块之间不一致,结果会和 PyTorch 路线略有差异。另外,在原生 4x 的 x4plus 权重上使用 -s 2 是个坑:参数虽然接受,但用户反馈输出会崩坏。
“realesrgan-ncnn-vulkan 把倍率设成 4 以外的任何值都会毁掉输出,这是什么情况?”——@hogehoge61,X
如果目标就是 2x 输出,与其和这个参数较劲,不如在 GUI 或 Python 路线中使用 x2plus 权重。
方案二:Python 与 PyTorch,功能最完整
项目的完整功能都在 Python 路线中。仓库本身就带有 inference_realesrgan.py 脚本;按照官方 README的安装流程,要求 Python 3.7+ 与 PyTorch 1.7+:
git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results
这些附加参数的价值在于:
--face_enhance会对检测到的人脸运行 GFPGAN;第二条命令则是照片原生 2x 放大的标准用法。--outscale可设定任意输出倍率,例如 3.5x。但 README 说得很清楚:它只是对 4x 输出进行 LANCZOS4 缩放,并非原生倍率。- 根据 README,只有 Python 路线支持带 Alpha 通道、灰度和 16 位图片。
- 推理默认使用 fp16;如需完整精度,传入
--fp32。
方案三:GUI 工具 Upscayl 与 Real-ESRGAN GUI
不想碰终端、只想把文件夹拖进去处理,主流选择是 Upscayl。这是一款基于 Real-ESRGAN 和 Vulkan 的免费 AGPL 许可证桌面应用,支持 Windows、macOS 与 Linux;它提供文件夹批量队列、面向重度 JPEG 压缩图的“Double Upscayl”二次处理,安装后可离线运行,并支持 PNG/JPG/WebP 最高 16x 输出。官网建议使用支持 Vulkan 的独立显卡。
更轻量的替代方案是 TransparentLC 的 realesrgan-gui。这是一个跨平台 Tkinter 前端,也能驱动 Real-CUGAN,并且检测到时会优先使用新版 upscayl-ncnn 二进制文件。需要成熟的批量处理体验就选 Upscayl;需要脚本化、ffmpeg 工作流或精确控制模型时,命令行方案更合适。
动漫还是照片:按素材选模型,别凭习惯
动漫、漫画分镜和线稿应使用 anime_6B。按照官方 README的说明,它是针对动漫图像优化、体积更小的模型,项目还提供了它与 waifu2x 的对比。照片则应选择 x4plus,如果只需放大一倍则选 x2plus。旧扫描件、重度 JPEG、截图等压缩严重或噪点多的素材,适合 realesr-general-x4v3。该模型的 README 专门记录了 -dn 降噪强度,用于在清理噪点与避免这一模型家族常见的过度平滑之间取得平衡。
r/upscaling 用户反复遇到的一条边界很明确:把动漫权重用在真人身上,可能生成不稳定、出错的人脸。在那篇讨论中,u/Green-Cucumber8507 的第一条回复就是“用的是哪个模型变体?”。对于人脸清晰可见的人像,更值得走 Python 路线并加上 --face_enhance,让 GFPGAN 修复放大过程中被抹平的面部细节。
常见故障与对应处理办法
提示“Vulkan device not found”或一启动就崩溃
按以下顺序排查:
- 先更新显卡驱动。
- 确认显卡报告支持 Vulkan;Upscayl 的 Windows 故障排查指南提供了检查方法。
- 如果是双 GPU 笔记本或桌面设备,在系统图形设置中强制让应用使用独立显卡。
程序静默退出,以及 models 文件夹问题
如果可执行文件发生段错误或静默退出,没打印任何报错,先检查 -m:它必须指向存放已转换模型文件的目录。请保持可执行文件与其 models 文件夹和发布时的原始结构一致。
视频显存爆掉:8 GB 显卡的处理流程
长视频最容易耗尽显存。@bi_9527zx 曾在 X 分享过一套适用于 8 GB 显卡的可行流程:卸载其他所有模型,用 ffmpeg 将视频拆成 PNG 帧,逐帧进行 4x 放大,再借助 ffmpeg 缩放和填充后重新合成。它确实能跑通,但也真实反映了代价:
“由于每一帧都是独立处理,仍可能存在一些闪烁。”——u/Dagnarus15,r/upscaling
速度瓶颈确实存在
给一个量级参考:@zinya2dx 在 X 表示,GPU 满载运行约一小时,才能将约 20 秒 SD 画质视频放大到 4K。静态图片就友好得多:@Tomoari_hsmt 在 X 测得,在一块 860M 级别、配有 NPU 的 GPU 上,每张图大约需要 2 秒。
2026 年 Real-ESRGAN、Topaz 与 SeedVR2 怎么选
如今,Real-ESRGAN 面对的是订阅制商业套件,以及能够重新生成细节的开源扩散式放大工具。
| Real-ESRGAN | Topaz Gigapixel | ByteDance SeedVR2 | |
|---|---|---|---|
| 许可证与价格 | BSD-3,免费 | Personal 为 $149/年,Pro 为 $499/年(官方定价) | Apache-2.0,免费 |
| 硬件要求 | 通过 ncnn 支持任何 Vulkan GPU | 在自有 GPU 上运行的桌面应用 | NVIDIA GPU,且需要充足显存(3B/7B 变体) |
| 技术路线 | GAN 锐化已有细节 | 商业 GAN/CNN 套件,支持按模型控制 | 一步扩散重建细节 |
| 报告的吞吐量 | x4、720p、fp16 下为 1.7 fps(RTX 5090) | Proteus:1080p 为 15 fps,4K 为 7.3 fps | 4K 级扩散:0.2–2 fps |
| 需要注意 | 视频闪烁,重度损坏素材纹理偏平 | 订阅价格 | 有文档记录会对 720p AI 生成视频过度锐化 |
全部吞吐量数据都来自一项持续更新的开放基准测试,测试于 2026 年 6 月在 RTX 5090 上完成。不同工具的工作负载并不相同:Real-ESRGAN 测的是 720p 输入的 x4 fp16,Topaz Proteus 则测了 1080p 与 4K。因此应把这些数字理解为量级参考,并以该基准测试自身的推荐作为优先级:便宜的批量任务和预览用 Real-ESRGAN,电影级 4K 用 SeedVR2-7B。
ByteDance 在 ICLR 2026 发布的 SeedVR2 采用 Apache-2.0 许可证,通过扩散方式重建细节。这是反过来的取舍:按该基准测试的方法说明,扩散式放大器更适合合成输入,却可能生成一张全新的人脸,并在帧间发生漂移。边缘处理方面,新一代开源工具已经领先;一位在 X 上对比 Real-ESRGAN 和 FlashVSR 的用户说得很直接:
“RealESRGAN 最终得到的细节更少。”——@dawidope,X
一些老用户也因为困难素材上的细节爆掉而放弃它。@realrebelai 在 X 写道:“我只是发现它有时会把细节冲掉。”随后转向 Topaz 作为救急方案。
走 API 则完全绕开本地硬件问题。Replicate 托管的 nightmareai/real-esrgan 每 1,000 张输出图片收费 $2,即每张 $0.002;支持最高 10 倍放大和 GFPGAN 人脸开关,建议输入低于 1440p。该页面的运行计数器显示,它已运行约 9,700 万次;页面中的单个预测示例约在 2.5 秒内完成。如果本地安装本身就是障碍,AIReiter 的在线放大器也能在浏览器中完成同样的工作。
快速问答:许可证、硬件、视频与 .pth 文件
Real-ESRGAN 可以免费商用吗?
可以。项目采用 BSD 3-Clause 许可证,这是开源领域最宽松的许可证之一。转换后的 ncnn 二进制文件和发布权重随仓库提供;在发布商业产品前,仍应阅读各仓库中的 LICENSE 文件。
Real-ESRGAN 必须使用 NVIDIA GPU 吗?
不需要。ncnn-vulkan 版本和 Upscayl 都可通过 Vulkan 在 Intel、AMD 与 NVIDIA GPU 上运行。CUDA 只与 Python/PyTorch 路线有关;在这条路线中,NVIDIA 显卡是更快的选择。
Real-ESRGAN 能放大视频吗?
只能逐帧处理。realesr-animevideov3 可用于动漫片段,开放基准测试也将 Real-ESRGAN 与 vs_temporalfix VapourSynth 滤镜搭配用于预览;但每帧独立放大的机制决定了时序闪烁无法彻底消除。
能把 .pth 文件直接加载到 ncnn-vulkan 吗?
不能直接加载。ncnn 需要已转换的 .param/.bin 文件。虽然存在转换方法,但限制很严格:
“不过它只适用于旧架构的 4x 模型。”——u/nmkd,r/GameUpscale
哪个执行后端最快?
模型相同,后端未必相同。一位长期用户发现,离开 Vulkan 后,同样的工作慢得多:“对我来说,它比使用 Vulkan 时慢很多。”u/SouthernVisit3076 在 r/software 如此表示。别急着怪模型,先在自己的显卡上跑一遍基准测试。
今晚该用哪条路线
Real-ESRGAN 是锐化你已有的像素,扩散工具则会替换它们。你的素材更看重真实性还是美感,决定了该选哪一条路线:
| 你的情况 | 建议做法 |
|---|---|
| 照片,不想用终端 | 使用 Upscayl,并选择 Real-ESRGAN 模型 |
| 动漫或线稿 | 使用 Upscayl 或 ncnn,搭配 anime_6B / realesrgan-x4plus-anime |
| 照片放大 2x | Python 路线,使用 RealESRGAN_x2plus |
| 老旧、压缩严重、有噪点的扫描件 | 使用 realesr-general-x4v3,并调高 -dn |
| 人脸很重要的人像 | Python 路线加 --face_enhance |
| 动漫视频片段 | ncnn 路线,使用 realesr-animevideov3 |
| 真实拍摄素材或 4K 视频 | 不要用 Real-ESRGAN,改用 SeedVR2 或 Topaz |
| 数百张图片,没时间占用 GPU | API:Replicate,$0.002/张 |
延伸阅读:免费 AI 视频放大器对比,以及含定价与替代方案的 Replicate 评测。