第一课:四条技术路线速览

你的使命是为业务场景做超分模型选型。选型前先要有地图——本课建立这张地图:四条路线的核心差异、效果-速度权衡的本质、以及 480p→4K 的现状。 预计用时 8 分钟。

1. 四条路线,一句话各自概括

路线代表模型一句话速度档位
CNN SRCNN, EDSR, RCAN 最小像素误差,重建准确但偏平滑 最快(0.01–0.05 s/帧)
GAN SRGAN, Real-ESRGAN 对抗训练生成真实纹理,速度与质量的平衡点 中等(0.03–0.10 s/帧)
Transformer SwinIR, HAT 全局建模,PSNR 上限最高但算不动 较慢
扩散模型 StableSR, FlashVSR, RCOD 生成先验最强,真实感天花板;多步极慢,单步蒸馏正在追赶 多步秒级 / 单步 0.03–0.28 s/帧
选型直觉
这四条路线没有绝对的赢家——它们分布在"保真度-真实感-速度"这个三角的不同顶点上。选型就是根据业务约束在这个三角上选位置。

2. 权衡的本质:fidelity vs realism

这是超分领域最重要的一条理论结论:Blau & Michaeli (CVPR 2018) 证明了 感知质量(realism)与失真度(distortion/fidelity)不可兼得 ——当重建精度(PSNR)逼近最优时,感知真实感必然下降 (The Perception-Distortion Tradeoff)。

对选型的意义
监控、医疗等场景要保真(不能幻觉),选 CNN/Transformer;老视频修复、画质增强要观感,选 GAN/扩散。先问自己:业务要的是"准"还是"真"?

3. 480p→4K 的速度现状(A100)

480p(854×480)到 4K(3840×2160)边长约放大 4.5 倍,像素总量增加约 20 倍。基于公开数据推算:

模型基准数据480p→4K 推算
Real-ESRGAN(GAN) 0.034 s @ 128→512 1 s/帧,30fps 视频 1 分钟约需 32 分钟
FlashVSR(单步扩散) 17 FPS @ 768×1408 2 FPS(像素量约 7.7 倍)
StableSR(多步扩散) 3.194 s @ 128→512 分钟级/帧,仅适合离线
关键结论
480p→4K 在 A100 上远未达到实时(<30 FPS),当前水平在亚秒到数秒每帧。实时化处理需要第三课的加速技术(蒸馏、稀疏注意力、量化、TensorRT)。

4. 自测(凭记忆作答)

Q1:哪条路线把感知真实感推向极致,但传统方案速度最慢?
多步扩散模型
轻量卷积模型
双三次插值法
窗口注意力法
Q2:保真度与真实感不可兼得,这一结论被称为?
感知失真权衡
偏差方差权衡
精度召回权衡
探索利用权衡
Q3:A100 上 480p→4K 超分的当前速度现状最接近?
约一帧一秒
约一帧一毫
实时六十帧率
实时三十帧率
Q4:业务要求"不幻觉、可采证",应优先哪条路线?
卷积重建路线
对抗生成路线
扩散生成路线
多步采样路线

5. 延伸

主读材料(本课最重要的一手来源)
Real-ESRGAN 项目页 —— 业界最广泛使用的实用超分模型,GAN 路线的标杆。阅读其 README,重点看它与 PSNR-oriented 方法的效果对比图,直观感受 fidelity-realism 权衡。
有疑问就问
我是你的老师。本课任何不清楚的地方——比如为什么 Transformer 自注意力是 O(N²)、幻觉纹理长什么样——随时向我提问。