熟练 C/C++ 却没写过 GPU 代码?从 grid/block/thread 的心智模型起步,在真实 A100 上一步步写出、跑通、调优自己的 CUDA kernel。
GPU 编程的三层抽象:CUDA(线程级手写一切)→ Triton(块级编程+编译器生成 CUDA)→ Liger-Kernel(LLM 训练用的预写 Triton kernel 库)。含决策树:你的场景该选哪层,以及 +20% 吞吐 / -60% 显存的量化对比。
CUDA 的核心心智模型:从单个线程视角写代码。__global__ 与 <<< >>> 启动语法、四个内建变量、全局索引公式 blockIdx.x*blockDim.x+threadIdx.x、warp 与 SIMT。附在 A100 上跑通的 hello_threads.cu。