---
name: learn-flashattention
---

# Mission: 理解 FlashAttention 原理与 1-4 代演进

## Why（为什么学）

用户正在从事或希望从事大模型推理/训练的底层性能优化工作。FlashAttention 是当前 Transformer  attention 模块的事实标准实现，理解其原理和版本演进是阅读/修改 attention kernel、做 GPU 性能优化、面试/技术讨论的必备基础。

## What（学到什么程度）

1. 能从算法层面讲清 FlashAttention 的核心思想：**tiling + online softmax + recomputation**。
2. 能逐代比较 FlashAttention 1/2/3/4 的优化重点、目标硬件和关键瓶颈转移。
3. 能把每代优化映射到工程实现细节（loop order、CUDA instruction、async pipeline、低精度等）。
4. 最终能够独立阅读相关论文、代码和性能 profile，不再停留在"省内存"的模糊印象。

## How（学习方式）

- 每节课聚焦一个 tightly-scoped 的主题，配合伪代码、数值示例和交互式测验。
- 强调 "IO-aware" 的硬件直觉：HBM vs SRAM、Tensor Core、memory bandwidth、compute throughput。
- 提供参考文档（glossary、evolution cheat sheet）供课后快速回顾。
- 推荐高质量原文/原论文作为 primary source。

## 当前状态

- 背景：熟悉标准 Self-Attention 公式与计算量。
- 目标：工程实现与性能优化。
- 待加强：GPU 内存层次、CUDA kernel 细节、各代 FlashAttention 的硬件针对性设计。

## 相关记忆

- [[flashattention-glossary]]
- [[flashattention-evolution]]
