Com 36.500 estrelas no GitHub, licença BSD-3-Clause e cinco anos de estrada, o Real-ESRGAN segue como a escolha gratuita mais óbvia para ampliar imagens estáticas e anime. A versão ncnn-vulkan roda em GPUs AMD, Intel e NVIDIA. Para vídeos longos de filmagens reais, porém, não é a ferramenta certa.
Real-ESRGAN em 2026: onde ele ainda é forte — e onde fica para trás
O maior trunfo do Real-ESRGAN continua sendo a acessibilidade: todo o pacote é gratuito, funciona offline e não favorece uma marca específica de GPU — AMD, Intel e NVIDIA recebem o mesmo tratamento. Já em vídeo, ele perde terreno porque processa cada quadro isoladamente. Também não é ideal para restaurações pesadas: como explica o artigo da ICCVW 2021, o GAN foi treinado com degradações inteiramente sintéticas para realçar detalhes existentes, não para recriá-los.
O veredito dos usuários nas discussões do r/upscaling no Reddit cabe em uma frase:
"Lento pra caramba, mas o resultado é decente." - u/ChemistryAdorable956, r/upscaling
Arquivos de pesos do Real-ESRGAN: x4plus, x2plus, anime_6B e os demais
O modelo escolhido faz mais diferença do que o programa usado para executá-lo. Os seis pesos lançados estão na página oficial de Releases do projeto.
| Arquivo de pesos | Escala nativa | Melhor uso | Origem |
|---|---|---|---|
RealESRGAN_x4plus.pth | 4x | Fotos e imagens em geral | Release v0.1.0 |
RealESRGAN_x2plus.pth | 2x | Fotos que precisam apenas dobrar de tamanho | Página de Releases |
RealESRGAN_x4plus_anime_6B.pth | 4x | Animes, ilustrações e arte linear | Release v0.2.2.4 |
RealESRNet_x4plus.pth | 4x | Imagens gerais, com textura mais segura | Página de Releases |
realesr-general-x4v3 | 4x | Fontes comprimidas ou com ruído | Página de Releases |
realesr-animevideov3 | 4x | Quadros de vídeo em anime | Incluído no zip do ncnn |
A pegadinha de formato: a versão portátil ncnn não usa arquivos .pth. Ela já traz modelos convertidos em .param/.bin na pasta models; portanto, baixar .pth só importa no caminho via Python. Outro detalhe do README: a demo online oficial disponibiliza apenas o modelo anime 6B. Não a use para avaliar a qualidade do Real-ESRGAN em fotos.
Caminho 1: ncnn-vulkan portátil, sem CUDA nem Python
Para começar rápido, baixe o executável portátil na página de releases do Real-ESRGAN-ncnn-vulkan. A versão mais recente, v0.2.0, de 24 de abril de 2022, oferece três zips: Windows com 2,2 MB, Ubuntu com 3,7 MB e macOS com 8,5 MB. Extraia o arquivo, abra um terminal dentro da pasta e execute:
./realesrgan-ncnn-vulkan -i input.png -o output.png -n realesrgan-x4plus -s 4
Não exige CUDA, PyTorch nem Python. Segundo o README oficial, ele funciona via Vulkan em GPUs Intel, AMD e NVIDIA. Aponte -i para uma pasta, em vez de um arquivo, e ele processará em lote todos os JPG, PNG e WebP presentes nela.
| Flag | Função |
|---|---|
-i / -o | Arquivo ou diretório de entrada e saída |
-n | Nome do modelo: realesrgan-x4plus, realesrnet-x4plus, realesrgan-x4plus-anime, realesr-animevideov3 |
-s | Escala: 2, 3 ou 4; o padrão é 4 |
-t | Tamanho dos blocos, ≥32 ou 0 para automático — reduza se a VRAM acabar |
-g / -j | ID da GPU em máquinas com várias GPUs; contagem de threads para carregar:processar:salvar |
-x | Modo TTA, que privilegia qualidade em troca de velocidade |
-f | Formato de saída: png (padrão), jpg ou webp |
Há duas limitações conhecidas, ambas documentadas no README: a versão ncnn não tem um equivalente a outscale, e a divisão da imagem em blocos seguida da união pode criar inconsistências entre blocos, deixando o resultado levemente diferente do caminho PyTorch. Também vale evitar -s 2 com os pesos x4plus, nativos em 4x: a flag aceita o comando, mas usuários relatam que a saída desmorona.
"No realesrgan-ncnn-vulkan, definir uma escala diferente de 4 quebra a saída — que negócio é esse?" - @hogehoge61, X
Se a meta é uma saída em 2x, use os pesos x2plus em uma GUI ou pelo caminho Python, em vez de insistir nessa flag.
Caminho 2: Python e PyTorch para acessar todos os recursos
É no Python que estão todos os recursos do projeto. O script inference_realesrgan.py vem no próprio repositório, e o fluxo de instalação do README oficial pede Python 3.7+ e PyTorch 1.7+:
git clone https://github.com/xinntao/Real-ESRGAN.git
cd Real-ESRGAN
pip install -r requirements.txt
python setup.py develop
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs -o results --face_enhance
python inference_realesrgan.py -n RealESRGAN_x2plus -i inputs -o results
Na prática, as flags extras oferecem o seguinte:
--face_enhanceexecuta o GFPGAN nos rostos detectados; o segundo comando é a receita de 2x nativo para fotos.--outscalepermite tamanhos arbitrários, como 3,5x, mas o README deixa claro que se trata de um redimensionamento LANCZOS4 da saída em 4x, não de uma escala nativa.- Imagens com canal alpha, em escala de cinza e de 16 bits são compatíveis, segundo o README, apenas nessa rota Python.
- A inferência usa fp16 por padrão; passe
--fp32para obter precisão total.
Caminho 3: interfaces gráficas com Upscayl e Real-ESRGAN GUI
Para quem quer arrastar pastas sem abrir o terminal, o Upscayl é a opção mais conhecida. O aplicativo desktop gratuito, licenciado sob AGPL, roda em Windows, macOS e Linux, é baseado em Real-ESRGAN e Vulkan e traz filas de processamento em lote por pasta, o segundo passe "Double Upscayl" para JPEGs muito comprimidos, funcionamento offline após a instalação e saída de até 16x em PNG/JPG/WebP. O site oficial recomenda uma GPU dedicada compatível com Vulkan.
Uma alternativa mais leve é o realesrgan-gui de TransparentLC, front-end multiplataforma em Tkinter que também controla o Real-CUGAN e prioriza o binário mais novo upscayl-ncnn quando o encontra. Escolha o Upscayl para uma experiência de lote mais refinada; prefira as rotas de linha de comando quando precisar de automação, pipelines com ffmpeg ou controle preciso de modelos.
Anime ou foto? O conteúdo deve definir o modelo
Animes, páginas de mangá e arte linear pedem anime_6B. De acordo com o README oficial, trata-se de um modelo para imagens de anime otimizado para ter tamanho muito menor, e o projeto inclui sua própria comparação com waifu2x. Fotos devem usar x4plus — ou x2plus, quando dobrar já basta. Fontes comprimidas ou ruidosas, como scans antigos, JPEGs agressivamente comprimidos e capturas de tela, são o território do realesr-general-x4v3. Sua intensidade de redução de ruído -dn, documentada no README para esse modelo, existe justamente para equilibrar limpeza e o excesso de suavização pelo qual essa família é conhecida.
Há um limite que usuários do r/upscaling encontram com frequência: pesos de anime aplicados a pessoas reais costumam gerar rostos instáveis e cheios de artefatos. A primeira resposta naquela discussão, de u/Green-Cucumber8507, foi: "Qual variante do modelo?" Para retratos com rostos visíveis, vale usar a rota Python com --face_enhance, permitindo que o GFPGAN repare o que o upscaling suavizar.
Problemas comuns e como resolver
"Vulkan device not found" ou travamentos imediatos
Siga esta ordem:
- Atualize primeiro o driver da GPU.
- Confirme que a placa informa suporte a Vulkan; o guia de solução de problemas do Upscayl para Windows mostra como fazer essa verificação.
- Em notebooks e desktops com duas GPUs, force o aplicativo a usar a GPU dedicada nas configurações gráficas do sistema.
Fechamentos silenciosos e a pasta models
Se o executável apresentar segfault ou fechar sem mensagem de erro, verifique primeiro -m: ele precisa apontar para uma pasta com os arquivos de modelo convertidos. Mantenha o executável e sua pasta models juntos, exatamente como foram distribuídos.
Falta de memória em vídeo: fluxo para 8 GB
É em vídeos longos que a VRAM costuma se esgotar. Um fluxo funcional publicado por @bi_9527zx no X, usando uma placa de 8 GB, é descarregar todos os outros modelos, separar o clipe em quadros PNG com ffmpeg, ampliar cada quadro individualmente em 4x e então remontar o vídeo com redimensionamento e padding no ffmpeg. Funciona, mas deixa o custo claro:
"Alguma cintilação ainda pode permanecer porque cada quadro é processado de forma independente." - u/Dagnarus15, r/upscaling
O limite de velocidade existe
Para dimensionar o problema: @zinya2dx relatou no X uma hora de GPU no máximo para ampliar cerca de 20 segundos de vídeo em qualidade SD para 4K. Imagens estáticas são bem mais amigáveis: @Tomoari_hsmt mediu cerca de 2 segundos por imagem em uma GPU da classe 860M com NPU, segundo publicação no X.
Real-ESRGAN vs. Topaz e SeedVR2 em 2026
Hoje, o Real-ESRGAN disputa espaço tanto com suítes por assinatura quanto com ampliadores open source baseados em difusão, que regeneram detalhes em vez de apenas realçá-los.
| Real-ESRGAN | Topaz Gigapixel | ByteDance SeedVR2 | |
|---|---|---|---|
| Licença e preço | BSD-3, gratuito | US$ 149/ano no Personal, US$ 499/ano no Pro (preços oficiais) | Apache-2.0, gratuito |
| Hardware | Qualquer GPU Vulkan via ncnn | Aplicativo desktop na sua própria GPU | NVIDIA com muita VRAM (variantes 3B/7B) |
| Abordagem | GAN realça detalhes existentes | Suíte comercial de GAN/CNN, com controles por modelo | Difusão de uma etapa regenera detalhes |
| Vazão reportada | 1,7 fps em x4 720p fp16 (RTX 5090) | Proteus: 15 fps em 1080p, 7,3 fps em 4K | Classe 4K com difusão: 0,2–2 fps |
| Atenção para | Cintilação em vídeo e textura plana em danos pesados | Preço por assinatura | Excesso de nitidez documentado em vídeo gerado por IA a 720p |
Todos os números de vazão vêm de um benchmark aberto atualizado continuamente, executado em uma RTX 5090 em junho de 2026. As cargas de trabalho são diferentes — o Real-ESRGAN foi medido em x4 sobre entrada de 720p, em fp16, enquanto o Topaz Proteus foi testado em 1080p e 4K. Portanto, interprete os valores como ordens de grandeza e siga a hierarquia indicada pelo próprio benchmark: Real-ESRGAN para lotes baratos e prévias; SeedVR2-7B para 4K com nível de cinema.
Publicado pela ByteDance na ICLR 2026 sob Apache-2.0, o SeedVR2 regenera detalhes no estilo de difusão. É a troca inversa: segundo as notas de metodologia do benchmark, ampliadores por difusão se adaptam melhor a conteúdo sintético, mas podem inventar um rosto novo e variar entre quadros. Em bordas, ferramentas abertas mais novas já estão à frente. Um usuário do X, comparando Real-ESRGAN e FlashVSR, resumiu assim:
"O RealESRGAN acaba ficando com menos." - @dawidope, X
Usuários antigos também o abandonam quando detalhes estouram em fontes difíceis: "eu só percebo que ele às vezes estoura os detalhes", escreveu @realrebelai no X, antes de migrar para o Topaz como solução de emergência.
A rota por API elimina as dúvidas sobre hardware. O nightmareai/real-esrgan hospedado pela Replicate cobra US$ 2 por 1.000 imagens de saída, ou US$ 0,002 por imagem, aceita escala de até 10 com o controle de rosto GFPGAN, recomenda entradas abaixo de 1440p e já foi executado cerca de 97 milhões de vezes, segundo o contador da página. Uma previsão de exemplo na página foi concluída em aproximadamente 2,5 segundos. Se instalar qualquer coisa localmente for o obstáculo, o upscaler hospedado da AIReiter faz o mesmo trabalho pelo navegador.
Respostas rápidas: licença, hardware, vídeo e arquivos .pth
O Real-ESRGAN é gratuito para uso comercial?
Sim. O projeto usa a licença BSD 3-Clause, uma das mais permissivas do open source. Os binários ncnn convertidos e os pesos lançados acompanham o repositório; antes de lançar um produto comercial, leia o arquivo LICENSE de cada repositório.
O Real-ESRGAN exige uma GPU NVIDIA?
Não. A versão ncnn-vulkan e o Upscayl funcionam com Intel, AMD e NVIDIA via Vulkan. CUDA só importa na rota Python/PyTorch, na qual uma placa NVIDIA é o caminho mais rápido.
O Real-ESRGAN consegue ampliar vídeos?
Apenas quadro a quadro. O realesr-animevideov3 atende clipes de anime, e o benchmark aberto combina Real-ESRGAN com o filtro VapourSynth vs_temporalfix para prévias. Ainda assim, a cintilação temporal nunca desaparece por completo, pois cada quadro é ampliado separadamente.
Posso carregar um arquivo .pth no ncnn-vulkan?
Não diretamente: o ncnn requer arquivos convertidos .param/.bin. A conversão existe, mas tem limitações rígidas:
"Só funciona com modelos 4x da arquitetura antiga." - u/nmkd, r/GameUpscale
Qual backend de execução é mais rápido?
O modelo é o mesmo; o backend, não. Um usuário de longa data descobriu que o mesmo trabalho fica bem mais lento fora do Vulkan: "para mim, é muito mais lento do que quando uso Vulkan", relatou u/SouthernVisit3076 no r/software. Teste na sua própria placa antes de culpar o modelo.
Qual caminho usar hoje à noite
O Real-ESRGAN realça os pixels que você já tem; ferramentas de difusão os substituem. A escolha depende de seu material ser evidência ou estética:
| Sua situação | Faça isto |
|---|---|
| Fotos, sem terminal | Upscayl com o modelo Real-ESRGAN |
| Anime ou arte linear | Upscayl ou ncnn com anime_6B / realesrgan-x4plus-anime |
| Fotos em 2x | Rota Python com RealESRGAN_x2plus |
| Scans antigos, comprimidos ou ruidosos | realesr-general-x4v3 com -dn ajustado para cima |
| Retratos em que rostos importam | Python com --face_enhance |
| Clipes de vídeo em anime | ncnn com realesr-animevideov3 |
| Filmagem real ou vídeo 4K | Não use Real-ESRGAN — escolha SeedVR2 ou Topaz |
| Centenas de imagens, sem tempo de GPU | API: Replicate por US$ 0,002/imagem |
Leitura relacionada: comparativo de upscalers de vídeo com IA gratuitos e a análise da Replicate com preços e alternativas.