精心设计的动手式课程体系。每节课聚焦一个可消化的主题,建立扎实的知识体系。按顺序学习,循序渐进。
选择一个系列开始学习。每个系列都是独立完整的课程,涵盖特定领域的核心知识。
理解 torch.compile 的完整编译栈——Dynamo、Inductor、Triton,以及 TVM 和 TensorRT 的定位与适用场景。
面向有 C/C++ 基础、零 CUDA 经验的工程师。每节课聚焦一个可消化的主题,先建立硬件心智模型,再在远程 A100 上编译运行可验证的 kernel。
系统讲解 FlashAttention 的核心原理(tiling、online softmax、recomputation),并逐代对比 FlashAttention-1/2/3/4 在算法与硬件层面的关键优化。
以 MFU 为核心,学会手算模型理论 FLOPs、理解 6N 与 12lhqt 的推导,并能在 calflops、DeepSpeed Flops Profiler 等工具间做选型。
掌握 NVIDIA 视频硬件解码技术,涵盖 Orin NvMedia 和 x86 NVDEC 两大平台,包含 Video Codec SDK、FFmpeg 等实战方案。
从架构、数据工程、高效训练到推理部署,系统理解多模态大语言模型的设计与实践。
从 GAN 到扩散模型,深入理解视觉生成的核心范式与 SOTA 模型。掌握 DALL·E、Stable Diffusion、Flux 等前沿技术。
掌握 NeRF 与 3D Gaussian Splatting 的核心原理与工程实践,从隐式神经表示到实时渲染。
对比 CNN/GAN/Transformer/Diffusion 四条技术路线,量化速度瓶颈,拆解加速技术,最终形成可落地的超分选型决策能力。
从 MDP 基础到策略梯度、GAE、PPO 裁剪目标、GRPO 组内基线,最终具备用强化学习训练会“思考”的推理模型的能力。
根据你的兴趣和需求,从上方选择一个课程系列。每个系列都是独立完整的,不需要先学其他系列。
系列内的课程有依赖关系,建议按编号顺序学习。每节课聚焦一个具体主题,短小精悍。
标有"动手"标签的课程包含实践环节。在自己的环境里跑代码,亲眼看到结果,记忆更深刻。