在免費圖片超解析工具裡,Real-ESRGAN 依然是很難繞開的一個名字。它的 GitHub repository 五年來累積 36,500 顆星,採 BSD-3-Clause 授權;透過 ncnn-vulkan,AMD、Intel 與 NVIDIA GPU 都能跑。靜態圖片和動漫圖依舊很適合它,但若目標是長篇真人影片,Real-ESRGAN 通常不是對的選擇。
2026 年怎麼看 Real-ESRGAN:它還贏在哪裡,又輸在哪裡
Real-ESRGAN 最大優勢是適用範圍廣:整套工具免費、可離線執行,也不偏袒任何一家 GPU 廠商,AMD、Intel、NVIDIA 都能用。弱點則很明顯:處理影片時,它會逐格獨立運算,容易產生閃爍;面對嚴重損壞的素材,修復能力也有限。原因在於其 ICCVW 2021 論文使用純合成劣化資料訓練 GAN,核心是銳化既有細節,而不是重新生成細節。
Reddit 的 r/upscaling 討論串,則用一句話概括了使用者評價:
「慢得要命,但效果還不錯。」- u/ChemistryAdorable956,r/upscaling
Real-ESRGAN 權重怎麼選:x4plus、x2plus、anime_6B 與其他模型
比起你使用哪一套前端軟體,選對模型權重影響更大。官方釋出的六組權重都可在專案的 Releases page 找到。
| 權重檔 | 原生倍率 | 適合素材 | 來源 |
|---|---|---|---|
RealESRGAN_x4plus.pth | 4x | 照片、一般圖片 | Release v0.1.0 |
RealESRGAN_x2plus.pth | 2x | 只需要放大一倍的照片 | Releases page |
RealESRGAN_x4plus_anime_6B.pth | 4x | 動漫、插畫、線稿 | Release v0.2.2.4 |
RealESRNet_x4plus.pth | 4x | 一般圖片、紋理更保守 | Releases page |
realesr-general-x4v3 | 4x | 壓縮嚴重或含雜訊的來源 | Releases page |
realesr-animevideov3 | 4x | 動漫影片影格 | 隨 ncnn zip 一併提供 |
這裡有個常見陷阱:可攜式 ncnn 版本不會使用 .pth 檔。它隨附的是已轉換好的 .param/.bin 模型,放在 models 資料夾內;因此,只有走 Python 路線時才需要下載 .pth。另外,官方 README 也提到,官方線上示範只開放 anime 6B 模型,所以別拿它來判斷照片的放大品質。
路線一:ncnn-vulkan 可攜版,不用 CUDA 也不用 Python
想最快開始,可以直接從 Real-ESRGAN-ncnn-vulkan releases page 下載可攜式執行檔。最新版本 v0.2.0 發布於 2022 年 4 月 24 日,提供三個 zip:Windows 為 2.2 MB、Ubuntu 為 3.7 MB、macOS 為 8.5 MB。解壓縮後,在該資料夾開啟終端機並執行:
./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4
不需要 CUDA、PyTorch 或 Python。官方 README 指出,它透過 Vulkan 支援 Intel、AMD 與 NVIDIA GPU。將 -i 指向資料夾而非單一檔案時,程式會批次處理其中所有 JPG、PNG 與 WebP 圖片。
| 參數 | 用途 |
|---|---|
-i / -o | 輸入與輸出檔案或資料夾 |
-n | 模型名稱:realesrgan-x4plus、realesrnet-x4plus、realesrgan-x4plus-anime、realesr-animevideov3 |
-s | 放大倍率:2、3 或 4,預設為 4 |
-t | 分塊大小,≥32,或設為 0 自動決定;顯示卡記憶體不足時請調低 |
-g / -j | 多 GPU 主機的 GPU id;載入:處理:儲存的執行緒數 |
-x | TTA 模式,以速度換取品質 |
-f | 輸出格式:png(預設)、jpg、webp |
README 也記錄了兩個已知限制:ncnn 版本沒有對應 outscale 的功能;此外,分塊處理再拼接時可能出現區塊間不一致,結果會與 PyTorch 路線略有差異。還有一個坑:對原生 4x 的 x4plus 權重使用 -s 2。參數雖然接受這個設定,但使用者回報輸出結果可能會崩壞。
「realesrgan-ncnn-vulkan 只要把 scale 設成不是 4,輸出就壞掉——這是怎麼回事?」- @hogehoge61,X
如果目標是 2x 輸出,與其硬調這個參數,不如透過 GUI 或 Python 路線使用 x2plus 權重。
路線二:Python 與 PyTorch,功能最完整的做法
Real-ESRGAN 的完整功能都在 Python 路線。儲存庫本身就包含 inference_realesrgan.py,依官方 README 的安裝流程,需要 Python 3.7+ 與 PyTorch 1.7+:
git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results
多出的參數能帶來什麼:
--face_enhance會對偵測到的人臉執行 GFPGAN;第二條指令則是照片原生 2x 放大的建議做法。--outscale可設定 3.5x 這類任意輸出倍率,但 README 也坦白說明:這只是把 4x 結果以 LANCZOS4 縮放,不是原生倍率。- 依 README 說明,Alpha 通道、灰階與 16-bit 圖片僅在 Python 路線獲得支援。
- 推論預設使用 fp16;如需完整精度,加入
--fp32。
路線三:GUI 軟體:Upscayl 與 Real-ESRGAN GUI
如果你想直接拖拉整個資料夾、不想碰終端機,主流答案是 Upscayl。這是一款採 AGPL 授權、免費的 Windows、macOS 與 Linux 桌面軟體,以 Real-ESRGAN 和 Vulkan 為基礎;它支援資料夾批次佇列、用於嚴重 JPEG 壓縮圖的第二次處理功能「Double Upscayl」、安裝後離線運作,以及最高 16x 的 PNG/JPG/WebP 輸出。官方網站建議搭配支援 Vulkan 的獨立 GPU 使用。
更輕量的選擇是 TransparentLC's realesrgan-gui。這個跨平台 Tkinter 前端也可驅動 Real-CUGAN,偵測到時會優先使用較新的 upscayl-ncnn 二進位檔。想要完善的批次處理體驗就選 Upscayl;若你需要腳本化、ffmpeg 管線或精確控制模型,CLI 路線仍然更合適。
動漫還是照片?模型應看內容選,不要靠習慣
動漫、漫畫分鏡與線稿適合用 anime_6B。官方 README 將它定位為針對動漫圖像最佳化、檔案更小的模型,專案也附上與 waifu2x 的比較。照片則應使用 x4plus;若只需放大一倍,改用 x2plus。老掃描圖、高壓縮 JPEG、截圖等有壓縮痕跡或雜訊的來源,則適合 realesr-general-x4v3。README 為這個模型提供的 -dn 降噪強度,就是用來在清理雜訊與避免此模型系列常見的過度平滑之間取得平衡。
r/upscaling 使用者一再碰到的界線是:把動漫權重套用到真人,容易得到不穩定、帶有錯誤感的人臉。該討論串中,u/Green-Cucumber8507 的第一則回覆就是「用的是哪個模型變體?」對於人臉清楚可見的人像,建議走 Python 路線加上 --face_enhance,讓 GFPGAN 修補超解析過程中被平滑掉的臉部細節。
常見問題與排除方式
出現「Vulkan device not found」或程式立即崩潰
請依下列順序檢查:
- 先更新 GPU 驅動程式。
- 確認顯示卡回報支援 Vulkan;Upscayl 的 Windows troubleshooting guide 提供了檢查步驟。
- 雙 GPU 筆電或桌機請在系統圖形設定中,強制讓應用程式使用獨立 GPU。
程式無聲結束,以及 models 資料夾問題
如果執行檔發生 segfault,或沒有錯誤訊息便直接結束,先檢查 -m:它必須指向含有已轉換模型檔案的資料夾。請完全依原始發行包的結構,將執行檔與其 models 資料夾放在一起。
影片記憶體不足:8 GB 顯示卡的處理流程
長影片最容易耗盡 VRAM。@bi_9527zx 曾在 X 分享一套可在 8 GB 顯示卡運作的方式:卸載其他所有模型、用 ffmpeg 將影片拆成 PNG 影格、逐張 4x 放大,再透過 ffmpeg 縮放與補邊重組。這確實可行,但也如實揭露了代價:
「由於每個影格都是獨立處理,仍可能殘留一些閃爍。」- u/Dagnarus15,r/upscaling
速度瓶頸確實存在
用實際案例感受一下規模:@zinya2dx 在 X 回報,將約 20 秒 SD 畫質影片放大到 4K,GPU 全速跑了整整一小時。靜態圖片就友善得多:@Tomoari_hsmt 在 X 測得,配備 NPU 的 860M 級 GPU 每張圖片約需 2 秒。
2026 年 Real-ESRGAN、Topaz 與 SeedVR2 怎麼選
如今,Real-ESRGAN 面對的是訂閱制商業套件,以及可重新生成細節的開源擴散式超解析工具。
| Real-ESRGAN | Topaz Gigapixel | ByteDance SeedVR2 | |
|---|---|---|---|
| 授權與價格 | BSD-3,免費 | Personal 為 $149/year、Pro 為 $499/year(官方定價) | Apache-2.0,免費 |
| 硬體 | 透過 ncnn 支援任何 Vulkan GPU | 在自己的 GPU 上執行桌面應用程式 | 需要具備充足 VRAM 的 NVIDIA GPU(3B/7B 版本) |
| 技術路線 | GAN 銳化既有細節 | 商業 GAN/CNN 套件,提供個別模型控制 | 一步式擴散重新生成細節 |
| 回報吞吐量 | 1.7 fps,x4 720p fp16(RTX 5090) | Proteus:15 fps @1080p、7.3 fps @4K | 4K 級擴散:0.2–2 fps |
| 要留意的問題 | 影片閃爍、嚴重損壞素材的紋理扁平 | 訂閱價格 | 已有文件記錄其會過度銳化 720p AI 生成影片 |
所有吞吐量數據均來自一份持續更新的開源 benchmark,於 2026 年 6 月在 RTX 5090 上測得。各項工作負載不同:Real-ESRGAN 測試的是 fp16 下 720p 輸入的 x4,Topaz Proteus 則是 1080p 與 4K;因此應把數字當成量級參考,並以該 benchmark 本身的建議作為取捨:Real-ESRGAN 適合低成本批次處理與預覽,SeedVR2-7B 則適合電影級 4K。
ByteDance 在 ICLR 2026 發表、採 Apache-2.0 授權的 SeedVR2,以擴散方式重新生成細節,交換條件也正好相反。根據該 benchmark 的方法註記,擴散式超解析更適合合成來源,但可能憑空生成一張新臉,並在影格間產生漂移。邊緣處理方面,新一代開源工具已經領先;一位比較 Real-ESRGAN 與 FlashVSR 的 X 使用者說得很直接:
「RealESRGAN 最後保留下來的更少。」- @dawidope,X
長期使用者也會因為困難素材的細節爆掉而離開它。@realrebelai 在 X 寫道:「我只是注意到它有時會把細節炸掉」,之後便轉向 Topaz 當作救援方案。
走 API 則可以跳過所有硬體問題。Replicate 代管的 nightmareai/real-esrgan 每 1,000 張輸出圖片收費 $2,也就是每張 $0.002;支援最高 10 倍放大與 GFPGAN 人臉開關,建議輸入低於 1440p。依該頁面的執行計數器,它已執行約 9,700 萬次;頁面上的單一範例 prediction 約在 2.5 秒內完成。如果卡關點只是本機不想安裝任何東西,AIReiter's hosted upscaler 也能直接在瀏覽器完成同類工作。
快速問答:授權、硬體、影片與 .pth 檔案
Real-ESRGAN 可免費用於商業用途嗎?
可以。專案採 BSD 3-Clause 授權,這是開源世界中最寬鬆的授權之一。已轉換的 ncnn 二進位檔與發布的權重隨儲存庫提供;但在發行商業產品前,仍應閱讀各儲存庫中的 LICENSE 檔案。
Real-ESRGAN 一定需要 NVIDIA GPU 嗎?
不需要。ncnn-vulkan 版本與 Upscayl 均透過 Vulkan 支援 Intel、AMD 與 NVIDIA。只有 Python/PyTorch 路線會牽涉 CUDA,而 NVIDIA 顯示卡是該路線的快速選擇。
Real-ESRGAN 能放大影片嗎?
只能逐影格處理。realesr-animevideov3 可處理動漫片段,該開源 benchmark 也將 Real-ESRGAN 與 vs_temporalfix VapourSynth 濾鏡搭配用於預覽;但因每一影格都是獨立放大,時間性閃爍永遠無法完全消除。
能把 .pth 檔載入 ncnn-vulkan 嗎?
不能直接載入。ncnn 需要已轉換的 .param/.bin 檔案。雖然可以進行轉換,但限制很大:
「不過只適用於舊架構的 4x 模型。」- u/nmkd,r/GameUpscale
哪個執行後端最快?
模型固定,但後端並不固定。一位長期使用者發現,相同工作若不使用 Vulkan,速度會慢得多:「對我來說,它比使用 Vulkan 時慢非常多。」u/SouthernVisit3076 在 r/software 如此回報。先在自己的顯示卡上跑 benchmark,再決定是否該怪模型。
今晚該跑哪一條路線?
Real-ESRGAN 是銳化你已有的像素;擴散工具則會替換它們。選擇時,先想你的素材重視的是證據保真,還是視覺美感:
| 你的情境 | 建議做法 |
|---|---|
| 照片,不想用終端機 | 用 Upscayl 搭配 Real-ESRGAN 模型 |
| 動漫或線稿 | 用 Upscayl 或 ncnn,搭配 anime_6B / realesrgan-x4plus-anime |
| 2x 照片 | Python 路線搭配 RealESRGAN_x2plus |
| 老舊、壓縮嚴重或有雜訊的掃描圖 | 使用 realesr-general-x4v3,並調高 -dn |
| 人臉很重要的人像 | Python 加上 --face_enhance |
| 動漫影片片段 | ncnn 搭配 realesr-animevideov3 |
| 真人影片或 4K 影片 | 不要用 Real-ESRGAN,改選 SeedVR2 或 Topaz |
| 數百張圖片,又不想耗本機 GPU 時間 | API:Replicate,每張 $0.002 |