速查参考 · 配套第三课使用 · 打印友好
| 技术 | 作用层面 | 代表工作 | 加速效果 | 代价 |
|---|---|---|---|---|
| 蒸馏(多步→单步) | 算法步数 | FlashVSR, RCOD, TinySR | 12×(FlashVSR);5.68× + 参数 −83%(TinySR) | 蒸馏管道复杂;质量略低于教师 |
| 稀疏注意力 | 计算图 | FlashVSR (LCSA) | O(N²) → 近线性 | 局部性假设,超长程依赖受损 |
| Token 跳过 | 计算图 | SkipSR | 720p −60%,1080p −70% 耗时 | 误判区域质量不均 |
| 高压缩 VAE | 表示层 | TurboVSR (32×+8×) | token 序列 −32× | 可能影响生成质量 |
| 量化 (PTQ) | 数值精度 | HarmoQ (2-bit) | 3.2× 加速,4× 显存节省 | 极端位宽画质波动 |
| 模型轻量化 | 架构 | Real-ESRGAN 优化版 | 时间 −58%(234G→98G FLOPs) | 需重训/微调 |
| TensorRT | 算子实现 | Real-ESRGAN 优化版 | T4 上 45ms→18ms(2.5×) | 工程投入,算子兼容 |
| 批量处理 | 调度 | 通用 | 吞吐 +40% | 延迟换吞吐,实时不可用 |
不同层面的技术加速比可近似叠乘;同一层面的会互相侵蚀。组合后必须用统一口径复测画质(PSNR 硬门槛)。
| 组合 | 是否可叠乘 | 示例估算 |
|---|---|---|
| 蒸馏 × 量化 × TensorRT | ✓ 三层不同 | — |
| 轻量化 × TensorRT | ✓ 近似 | 1.08s × 0.42 × 0.4 ≈ 0.18 s/帧 |
| 轻量化 × 蒸馏 | △ 有重叠 | 需实测 |
| 稀疏注意力 × Token 跳过 | △ 有重叠 | 都在削减注意力计算 |
| 方案 | 裸模型 | 组合优化后 | 跨越 |
|---|---|---|---|
| Real-ESRGAN + 轻量化 + TensorRT | ≈ 1.08 s/帧 | ≈ 0.18 s/帧(~5.5 FPS) | 离线 → 近实时批处理 |
| FlashVSR + Token 跳过 | ≈ 2.2 FPS | ≈ 5.5 FPS | 扩散质量进入批处理区间 |