超分加速技术速查表

速查参考 · 配套第三课使用 · 打印友好

四件武器

技术作用层面代表工作加速效果代价
蒸馏(多步→单步)算法步数FlashVSR, RCOD, TinySR12×(FlashVSR);5.68× + 参数 −83%(TinySR)蒸馏管道复杂;质量略低于教师
稀疏注意力计算图FlashVSR (LCSA)O(N²) → 近线性局部性假设,超长程依赖受损
Token 跳过计算图SkipSR720p −60%,1080p −70% 耗时误判区域质量不均
高压缩 VAE表示层TurboVSR (32×+8×)token 序列 −32×可能影响生成质量
量化 (PTQ)数值精度HarmoQ (2-bit)3.2× 加速,4× 显存节省极端位宽画质波动
模型轻量化架构Real-ESRGAN 优化版时间 −58%(234G→98G FLOPs)需重训/微调
TensorRT算子实现Real-ESRGAN 优化版T4 上 45ms→18ms(2.5×)工程投入,算子兼容
批量处理调度通用吞吐 +40%延迟换吞吐,实时不可用

组合规则

不同层面的技术加速比可近似叠乘;同一层面的会互相侵蚀。组合后必须用统一口径复测画质(PSNR 硬门槛)。
组合是否可叠乘示例估算
蒸馏 × 量化 × TensorRT✓ 三层不同
轻量化 × TensorRT✓ 近似1.08s × 0.42 × 0.4 ≈ 0.18 s/帧
轻量化 × 蒸馏△ 有重叠需实测
稀疏注意力 × Token 跳过△ 有重叠都在削减注意力计算

480p→4K 组合优化效果(A100 推算)

方案裸模型组合优化后跨越
Real-ESRGAN + 轻量化 + TensorRT≈ 1.08 s/帧≈ 0.18 s/帧(~5.5 FPS)离线 → 近实时批处理
FlashVSR + Token 跳过≈ 2.2 FPS≈ 5.5 FPS扩散质量进入批处理区间
一句话
先蒸馏解决数量级,再稀疏化砍掉浪费,最后量化 + TensorRT 收尾;每层各取一件武器,叠乘后复测画质。