Real-ESRGAN 超分辨率实战:从环境搭建到 4 倍高清还原
一、引言
在实际项目中,我们经常遇到低分辨率图像需要放大的场景:监控视频取证、老照片修复、医学影像增强、卫星图像处理等。传统的双三次插值(Bicubic)放大后图像模糊、细节丢失严重。Real-ESRGAN是腾讯 ARC 实验室开源的盲超分辨率模型,能够将低分辨率图像放大 4 倍甚至更多,同时恢复逼真的纹理细节。
本文将带你从零开始搭建 Real-ESRGAN 环境,完成第一张图像的超分辨率还原。
二、Real-ESRGAN 技术原理速览
Real-ESRGAN 基于 ESRGAN(Enhanced Super-Resolution GAN)改进,核心创新在于:
- 高阶退化建模(High-order Degradation Model):传统超分模型假设输入是理想的下采样图像,但真实世界的低分辨率图像包含模糊、噪声、JPEG 压缩伪影等多种退化。Real-ESRGAN 使用二阶退化管线模拟真实退化过程:
HR → [Blur + Downsample + Noise + JPEG] → [Blur + Downsample + Noise + JPEG] → LRRRDBNet(Residual-in-Residual Dense Block Network):生成器采用 RRDB 结构,在残差块内部使用密集连接,最大化信息流动:
- 每个 RRDB 包含 3 个密集连接的卷积层
- 残差缩放因子 β=0.2,稳定训练
- 总共 23 个 RRDB 块,约 1600 万参数
U-Net 判别器 + 频谱归一化:增强判别器对全局和局部纹理的感知能力,避免伪影。
纯合成数据训练:完全使用合成的退化图像训练,但通过多样化的退化管线,在真实场景中表现出色。
三、环境搭建
3.1 创建虚拟环境
conda create-nrealesrganpython=3.9-yconda activate realesrgan3.2 安装依赖
# 克隆仓库gitclone https://github.com/xinntao/Real-ESRGAN.gitcdReal-ESRGAN# 安装 PyTorch(根据 CUDA 版本选择)pipinstalltorch==2.0.1torchvision==0.15.2 --index-url https://download.pytorch.org/whl/cu118# 安装其他依赖pipinstallbasicsr pipinstallfacexlib pipinstallgfpgan pipinstallopencv-python pipinstallnumpy3.3 下载预训练模型
# 下载通用模型(推荐)wgethttps://github.com/xinntao/Real-ESRGAN/releases/download/v0.1.0/RealESRGAN_x4plus.pth-Pweights/# 下载动漫专用模型(可选)wgethttps://github.com/xinntao/Real-ESRGAN/releases/download/v0.2.2.4/RealESRGAN_x4plus_anime_6B.pth-Pweights/四、图像超分辨率实战
4.1 命令行快速使用
# 单张图像 4 倍放大python inference_realesrgan.py\-nRealESRGAN_x4plus\-iinput.jpg\-ooutput.jpg\--outscale4\--face_enhance# 批量处理python inference_realesrgan.py\-nRealESRGAN_x4plus\-i./input_folder/\-o./output_folder/\--outscale4\--suffix_4x4.2 Python API 调用
importcv2importtorchimportnumpyasnpfrombasicsr.archs.rrdbnet_archimportRRDBNetfromrealesrganimportRealESRGANerdefsuper_resolve_image(input_path,output_path,scale=4):\"\"\" 使用 Real-ESRGAN 进行图像超分辨率 \"\"\"# 1. 加载模型model=RRDBNet(num_in_ch=3,num_out_ch=3,num_feat=64,num_block=23,num_grow_ch=32,scale=scale)# 2. 创建上采样器upsampler=RealESRGANer(scale=scale,model_path='weights/RealESRGAN_x4plus.pth',model=model,tile=400,# 分块处理,避免 OOMtile_pad=10,pre_pad=0,half=False# FP16 推理(需 GPU 支持))# 3. 读取图像img=cv2.imread(input_path,cv2.IMREAD_COLOR)h,w=img.shape[:2]print(f"Input:{w}x{h}")# 4. 超分辨率处理output,_=upsampler.enhance(img,outscale=scale)h_new,w_new=output.shape[:2]print(f"Output:{w_new}x{h_new}")# 5. 保存结果cv2.imwrite(output_path,output)print(f"Saved to{output_path}")returnoutput# 使用示例if__name__=='__main__':super_resolve_image('input.jpg','output_4x.png',scale=4)4.3 关键参数说明
| 参数 | 说明 | 推荐值 |
|---|---|---|
tile | 分块大小,显存不足时减小 | 400(8GB显存) |
tile_pad | 块边缘填充像素 | 10 |
pre_pad | 预处理填充 | 0 |
half | FP16 推理,降低显存占用 | True(RTX 20xx+) |
outscale | 输出放大倍数 | 4(默认) |
alpha_upsampler | 二次上采样方法 | ‘realesrgan’ |
4.4 人脸增强
Real-ESRGAN 内置了 GFPGAN 人脸增强:
upsampler=RealESRGANer(scale=4,model_path='weights/RealESRGAN_x4plus.pth',model=model,tile=400,face_enhance=True# 启用人脸增强)五、效果对比与评估指标
5.1 常用评估指标
fromskimage.metricsimportpeak_signal_noise_ratioaspsnrfromskimage.metricsimportstructural_similarityasssimimportlpips# PSNR & SSIMpsnr_value=psnr(gt_img,sr_img)ssim_value=ssim(gt_img,sr_img,channel_axis=2)# LPIPS(感知相似度)loss_fn=lpips.LPIPS(net='alex')lpips_value=loss_fn(gt_tensor,sr_tensor).item()5.2 典型效果数据
| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | 推理时间(512×512) |
|---|---|---|---|---|
| Bicubic | 26.88 | 0.825 | 0.340 | <1ms |
| ESRGAN | 27.51 | 0.835 | 0.195 | 120ms |
| Real-ESRGAN | 28.12 | 0.842 | 0.178 | 150ms |
| Real-ESRGAN+ | 28.35 | 0.848 | 0.165 | 180ms |
六、常见问题与解决方案
6.1 OOM(显存不足)
- 减小
tile参数(如 200) - 启用
half=True - 降低输入图像分辨率
6.2 输出图像偏色
- 检查输入图像是否为 RGB 格式
cv2.imread默认读取为 BGR,需转换:cv2.cvtColor(img, cv2.COLOR_BGR2RGB)
6.3 纹理过度锐化
- 使用
RealESRGAN_x4plus(通用模型)而非anime模型 - 调低
outscale
七、总结
Real-ESRGAN 是目前最实用的开源超分辨率方案之一,在盲超分场景下的效果远超传统插值方法。本文覆盖了从环境搭建、模型推理到参数调优的完整流程。下一篇我们将深入 RRDBNet 架构,解析其设计精髓。
参考资源:
- 项目地址:https://github.com/xinntao/Real-ESRGAN
- 论文:Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data
- 在线 Demo:https://huggingface.co/spaces/akhaliq/Real-ESRGAN