从 GPU Utilization 的骗局,到模型真实计算量的度量。
从 GPU Utilization 的骗局到模型真实计算量的度量,理解 MFU 的定义、6N + 12lhqt 公式,以及 CNN / ViT / LLM 的计算差异。
从 MAC 与 FLOPs 的单位辨析,到 DeepSpeed / transformers 的计数实现,再到 CNN 与 ViT 的逐项公式拆解。
DeepSpeed Flops Profiler、PyTorch FlopCounterMode、fvcore、ptflops、calflops 的代码用法与输出解读。
当自动工具失灵时,如何手动补算 FlashAttention 并正确统计反向传播。
第 1 课建立 MFU 的核心直觉,第 2 课深入 FLOPs 计数细节与 CNN/ViT 拆解。两节课相互依赖,建议按编号顺序读。
每课末尾都有选择题。认真做——提取练习是加深记忆最有效的方式之一。
速查表把公式、架构差异和工具选型压缩成一张表,适合复习和面试前快速回顾。
每节课里都提醒你随时提问。具体模型的 MFU 该怎么算、工具输出怎么对齐,都可以继续聊。
以下内容来自 MISSION.md
✓ 拿到一个模型配置,能在 5 分钟内手算出训练一步的理论 FLOPs,并换算成 MFU
✓ 解释“6N”和“12lhqt”分别从哪里来,以及 causal mask 为什么要把 attention FLOPs 砍半
✓ 在 calflops、DeepSpeed Flops Profiler、fvcore / ptflops 之间根据场景选对工具
✓ 一眼看出 CNN、ViT、LLM 在 FLOPs 计算时的核心差异点