AIREITER

Guia do Real-ESRGAN (2026): pesos, downloads, GUI e ncnn-vulkan

Última Atualização: 2026-08-20 01:37:37

Com 36.500 estrelas no GitHub, licença BSD-3-Clause e cinco anos de estrada, o Real-ESRGAN segue como a escolha gratuita mais óbvia para ampliar imagens estáticas e anime. A versão ncnn-vulkan roda em GPUs AMD, Intel e NVIDIA. Para vídeos longos de filmagens reais, porém, não é a ferramenta certa.

Real-ESRGAN em 2026: onde ele ainda é forte — e onde fica para trás

O maior trunfo do Real-ESRGAN continua sendo a acessibilidade: todo o pacote é gratuito, funciona offline e não favorece uma marca específica de GPU — AMD, Intel e NVIDIA recebem o mesmo tratamento. Já em vídeo, ele perde terreno porque processa cada quadro isoladamente. Também não é ideal para restaurações pesadas: como explica o artigo da ICCVW 2021, o GAN foi treinado com degradações inteiramente sintéticas para realçar detalhes existentes, não para recriá-los.

O veredito dos usuários nas discussões do r/upscaling no Reddit cabe em uma frase:

"Lento pra caramba, mas o resultado é decente." - u/ChemistryAdorable956, r/upscaling

Arquivos de pesos do Real-ESRGAN: x4plus, x2plus, anime_6B e os demais

O modelo escolhido faz mais diferença do que o programa usado para executá-lo. Os seis pesos lançados estão na página oficial de Releases do projeto.

Arquivo de pesosEscala nativaMelhor usoOrigem
RealESRGAN_x4plus.pth4xFotos e imagens em geralRelease v0.1.0
RealESRGAN_x2plus.pth2xFotos que precisam apenas dobrar de tamanhoPágina de Releases
RealESRGAN_x4plus_anime_6B.pth4xAnimes, ilustrações e arte linearRelease v0.2.2.4
RealESRNet_x4plus.pth4xImagens gerais, com textura mais seguraPágina de Releases
realesr-general-x4v34xFontes comprimidas ou com ruídoPágina de Releases
realesr-animevideov34xQuadros de vídeo em animeIncluído no zip do ncnn

A pegadinha de formato: a versão portátil ncnn não usa arquivos .pth. Ela já traz modelos convertidos em .param/.bin na pasta models; portanto, baixar .pth só importa no caminho via Python. Outro detalhe do README: a demo online oficial disponibiliza apenas o modelo anime 6B. Não a use para avaliar a qualidade do Real-ESRGAN em fotos.

Caminho 1: ncnn-vulkan portátil, sem CUDA nem Python

Para começar rápido, baixe o executável portátil na página de releases do Real-ESRGAN-ncnn-vulkan. A versão mais recente, v0.2.0, de 24 de abril de 2022, oferece três zips: Windows com 2,2 MB, Ubuntu com 3,7 MB e macOS com 8,5 MB. Extraia o arquivo, abra um terminal dentro da pasta e execute:

./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4

Não exige CUDA, PyTorch nem Python. Segundo o README oficial, ele funciona via Vulkan em GPUs Intel, AMD e NVIDIA. Aponte -i para uma pasta, em vez de um arquivo, e ele processará em lote todos os JPG, PNG e WebP presentes nela.

FlagFunção
-i / -oArquivo ou diretório de entrada e saída
-nNome do modelo: realesrgan-x4plus, realesrnet-x4plus, realesrgan-x4plus-anime, realesr-animevideov3
-sEscala: 2, 3 ou 4; o padrão é 4
-tTamanho dos blocos, ≥32 ou 0 para automático — reduza se a VRAM acabar
-g / -jID da GPU em máquinas com várias GPUs; contagem de threads para carregar:processar:salvar
-xModo TTA, que privilegia qualidade em troca de velocidade
-fFormato de saída: png (padrão), jpg ou webp
Página de releases do Real-ESRGAN ncnn-vulkan no GitHub mostrando os arquivos v0.2.0 para Windows, macOS e Ubuntu

Há duas limitações conhecidas, ambas documentadas no README: a versão ncnn não tem um equivalente a outscale, e a divisão da imagem em blocos seguida da união pode criar inconsistências entre blocos, deixando o resultado levemente diferente do caminho PyTorch. Também vale evitar -s 2 com os pesos x4plus, nativos em 4x: a flag aceita o comando, mas usuários relatam que a saída desmorona.

"No realesrgan-ncnn-vulkan, definir uma escala diferente de 4 quebra a saída — que negócio é esse?" - @hogehoge61, X

Se a meta é uma saída em 2x, use os pesos x2plus em uma GUI ou pelo caminho Python, em vez de insistir nessa flag.

Caminho 2: Python e PyTorch para acessar todos os recursos

É no Python que estão todos os recursos do projeto. O script inference_realesrgan.py vem no próprio repositório, e o fluxo de instalação do README oficial pede Python 3.7+ e PyTorch 1.7+:

git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results

Na prática, as flags extras oferecem o seguinte:

  • --face_enhance executa o GFPGAN nos rostos detectados; o segundo comando é a receita de 2x nativo para fotos.
  • --outscale permite tamanhos arbitrários, como 3,5x, mas o README deixa claro que se trata de um redimensionamento LANCZOS4 da saída em 4x, não de uma escala nativa.
  • Imagens com canal alpha, em escala de cinza e de 16 bits são compatíveis, segundo o README, apenas nessa rota Python.
  • A inferência usa fp16 por padrão; passe --fp32 para obter precisão total.

Caminho 3: interfaces gráficas com Upscayl e Real-ESRGAN GUI

Para quem quer arrastar pastas sem abrir o terminal, o Upscayl é a opção mais conhecida. O aplicativo desktop gratuito, licenciado sob AGPL, roda em Windows, macOS e Linux, é baseado em Real-ESRGAN e Vulkan e traz filas de processamento em lote por pasta, o segundo passe "Double Upscayl" para JPEGs muito comprimidos, funcionamento offline após a instalação e saída de até 16x em PNG/JPG/WebP. O site oficial recomenda uma GPU dedicada compatível com Vulkan.

Upscayl, interface gráfica gratuita e open source para upscaling com Real-ESRGAN em Windows, macOS e Linux

Uma alternativa mais leve é o realesrgan-gui de TransparentLC, front-end multiplataforma em Tkinter que também controla o Real-CUGAN e prioriza o binário mais novo upscayl-ncnn quando o encontra. Escolha o Upscayl para uma experiência de lote mais refinada; prefira as rotas de linha de comando quando precisar de automação, pipelines com ffmpeg ou controle preciso de modelos.

Anime ou foto? O conteúdo deve definir o modelo

Animes, páginas de mangá e arte linear pedem anime_6B. De acordo com o README oficial, trata-se de um modelo para imagens de anime otimizado para ter tamanho muito menor, e o projeto inclui sua própria comparação com waifu2x. Fotos devem usar x4plus — ou x2plus, quando dobrar já basta. Fontes comprimidas ou ruidosas, como scans antigos, JPEGs agressivamente comprimidos e capturas de tela, são o território do realesr-general-x4v3. Sua intensidade de redução de ruído -dn, documentada no README para esse modelo, existe justamente para equilibrar limpeza e o excesso de suavização pelo qual essa família é conhecida.

Há um limite que usuários do r/upscaling encontram com frequência: pesos de anime aplicados a pessoas reais costumam gerar rostos instáveis e cheios de artefatos. A primeira resposta naquela discussão, de u/Green-Cucumber8507, foi: "Qual variante do modelo?" Para retratos com rostos visíveis, vale usar a rota Python com --face_enhance, permitindo que o GFPGAN repare o que o upscaling suavizar.

Problemas comuns e como resolver

"Vulkan device not found" ou travamentos imediatos

Siga esta ordem:

  1. Atualize primeiro o driver da GPU.
  2. Confirme que a placa informa suporte a Vulkan; o guia de solução de problemas do Upscayl para Windows mostra como fazer essa verificação.
  3. Em notebooks e desktops com duas GPUs, force o aplicativo a usar a GPU dedicada nas configurações gráficas do sistema.

Fechamentos silenciosos e a pasta models

Se o executável apresentar segfault ou fechar sem mensagem de erro, verifique primeiro -m: ele precisa apontar para uma pasta com os arquivos de modelo convertidos. Mantenha o executável e sua pasta models juntos, exatamente como foram distribuídos.

Falta de memória em vídeo: fluxo para 8 GB

É em vídeos longos que a VRAM costuma se esgotar. Um fluxo funcional publicado por @bi_9527zx no X, usando uma placa de 8 GB, é descarregar todos os outros modelos, separar o clipe em quadros PNG com ffmpeg, ampliar cada quadro individualmente em 4x e então remontar o vídeo com redimensionamento e padding no ffmpeg. Funciona, mas deixa o custo claro:

"Alguma cintilação ainda pode permanecer porque cada quadro é processado de forma independente." - u/Dagnarus15, r/upscaling

O limite de velocidade existe

Para dimensionar o problema: @zinya2dx relatou no X uma hora de GPU no máximo para ampliar cerca de 20 segundos de vídeo em qualidade SD para 4K. Imagens estáticas são bem mais amigáveis: @Tomoari_hsmt mediu cerca de 2 segundos por imagem em uma GPU da classe 860M com NPU, segundo publicação no X.

Real-ESRGAN vs. Topaz e SeedVR2 em 2026

Hoje, o Real-ESRGAN disputa espaço tanto com suítes por assinatura quanto com ampliadores open source baseados em difusão, que regeneram detalhes em vez de apenas realçá-los.

Real-ESRGANTopaz GigapixelByteDance SeedVR2
Licença e preçoBSD-3, gratuitoUS$ 149/ano no Personal, US$ 499/ano no Pro (preços oficiais)Apache-2.0, gratuito
HardwareQualquer GPU Vulkan via ncnnAplicativo desktop na sua própria GPUNVIDIA com muita VRAM (variantes 3B/7B)
AbordagemGAN realça detalhes existentesSuíte comercial de GAN/CNN, com controles por modeloDifusão de uma etapa regenera detalhes
Vazão reportada1,7 fps em x4 720p fp16 (RTX 5090)Proteus: 15 fps em 1080p, 7,3 fps em 4KClasse 4K com difusão: 0,2–2 fps
Atenção paraCintilação em vídeo e textura plana em danos pesadosPreço por assinaturaExcesso de nitidez documentado em vídeo gerado por IA a 720p
Gráfico de barras da velocidade medida de upscaling em uma RTX 5090: Topaz Proteus com 15 fps em 1080p, 7,3 fps em 4K e Real-ESRGAN com 1,7 fps em x4 720p fp16

Todos os números de vazão vêm de um benchmark aberto atualizado continuamente, executado em uma RTX 5090 em junho de 2026. As cargas de trabalho são diferentes — o Real-ESRGAN foi medido em x4 sobre entrada de 720p, em fp16, enquanto o Topaz Proteus foi testado em 1080p e 4K. Portanto, interprete os valores como ordens de grandeza e siga a hierarquia indicada pelo próprio benchmark: Real-ESRGAN para lotes baratos e prévias; SeedVR2-7B para 4K com nível de cinema.

Publicado pela ByteDance na ICLR 2026 sob Apache-2.0, o SeedVR2 regenera detalhes no estilo de difusão. É a troca inversa: segundo as notas de metodologia do benchmark, ampliadores por difusão se adaptam melhor a conteúdo sintético, mas podem inventar um rosto novo e variar entre quadros. Em bordas, ferramentas abertas mais novas já estão à frente. Um usuário do X, comparando Real-ESRGAN e FlashVSR, resumiu assim:

"O RealESRGAN acaba ficando com menos." - @dawidope, X

Usuários antigos também o abandonam quando detalhes estouram em fontes difíceis: "eu só percebo que ele às vezes estoura os detalhes", escreveu @realrebelai no X, antes de migrar para o Topaz como solução de emergência.

A rota por API elimina as dúvidas sobre hardware. O nightmareai/real-esrgan hospedado pela Replicate cobra US$ 2 por 1.000 imagens de saída, ou US$ 0,002 por imagem, aceita escala de até 10 com o controle de rosto GFPGAN, recomenda entradas abaixo de 1440p e já foi executado cerca de 97 milhões de vezes, segundo o contador da página. Uma previsão de exemplo na página foi concluída em aproximadamente 2,5 segundos. Se instalar qualquer coisa localmente for o obstáculo, o upscaler hospedado da AIReiter faz o mesmo trabalho pelo navegador.

Respostas rápidas: licença, hardware, vídeo e arquivos .pth

O Real-ESRGAN é gratuito para uso comercial?

Sim. O projeto usa a licença BSD 3-Clause, uma das mais permissivas do open source. Os binários ncnn convertidos e os pesos lançados acompanham o repositório; antes de lançar um produto comercial, leia o arquivo LICENSE de cada repositório.

O Real-ESRGAN exige uma GPU NVIDIA?

Não. A versão ncnn-vulkan e o Upscayl funcionam com Intel, AMD e NVIDIA via Vulkan. CUDA só importa na rota Python/PyTorch, na qual uma placa NVIDIA é o caminho mais rápido.

O Real-ESRGAN consegue ampliar vídeos?

Apenas quadro a quadro. O realesr-animevideov3 atende clipes de anime, e o benchmark aberto combina Real-ESRGAN com o filtro VapourSynth vs_temporalfix para prévias. Ainda assim, a cintilação temporal nunca desaparece por completo, pois cada quadro é ampliado separadamente.

Posso carregar um arquivo .pth no ncnn-vulkan?

Não diretamente: o ncnn requer arquivos convertidos .param/.bin. A conversão existe, mas tem limitações rígidas:

"Só funciona com modelos 4x da arquitetura antiga." - u/nmkd, r/GameUpscale

Qual backend de execução é mais rápido?

O modelo é o mesmo; o backend, não. Um usuário de longa data descobriu que o mesmo trabalho fica bem mais lento fora do Vulkan: "para mim, é muito mais lento do que quando uso Vulkan", relatou u/SouthernVisit3076 no r/software. Teste na sua própria placa antes de culpar o modelo.

Qual caminho usar hoje à noite

O Real-ESRGAN realça os pixels que você já tem; ferramentas de difusão os substituem. A escolha depende de seu material ser evidência ou estética:

Sua situaçãoFaça isto
Fotos, sem terminalUpscayl com o modelo Real-ESRGAN
Anime ou arte linearUpscayl ou ncnn com anime_6B / realesrgan-x4plus-anime
Fotos em 2xRota Python com RealESRGAN_x2plus
Scans antigos, comprimidos ou ruidososrealesr-general-x4v3 com -dn ajustado para cima
Retratos em que rostos importamPython com --face_enhance
Clipes de vídeo em animencnn com realesr-animevideov3
Filmagem real ou vídeo 4KNão use Real-ESRGAN — escolha SeedVR2 ou Topaz
Centenas de imagens, sem tempo de GPUAPI: Replicate por US$ 0,002/imagem

Leitura relacionada: comparativo de upscalers de vídeo com IA gratuitos e a análise da Replicate com preços e alternativas.