GPU
Day 06 · Profiling 工具链
系统学习 GPU profiling 工具链:nsys 看系统级 timeline、ncu 做 kernel 深度分析、py-spy 抓 Python 热点、torch.profiler 串起训练全链路,建立先测量再优化的工程习惯。
Day 04 · CUDA 编程入门 (1)
从 Host 到 Device:理解 kernel 启动、Grid/Block/Thread 线程层级与 Global/Shared Memory 存储模型,动手实现 vector add 与 naive GEMM。
Day 05 · CUDA 编程入门 (2)
用 Shared Memory Tiling 优化矩阵乘:理解 bank conflict 与 coalesced access,实现 tiled GEMM 并用 Nsight Compute 分析性能瓶颈。
Day 02 · Linux / 容器基础回顾
深入 Linux 隔离原语 cgroups 与 namespaces,掌握 Docker GPU 容器的启动链路,动手编写 CUDA Dockerfile 并运行第一个 GPU 容器。
Day 03 · GPU 硬件与体系结构
拆解 GPU 微架构:从 SM、Warp 调度到 Tensor Core,理解 HBM-L2-SMEM 存储层级与算术强度,对比 A100/H100/H20 代际演进。
AI Infra 60 天系统学习路线
从 GPU 编程入门到 LLM 训推一体平台:覆盖 CUDA、PyTorch 内部机制、分布式训练、推理引擎、平台调度的全栈 60 天学习路线图。
Day 01 · AI Infra 全景与学习环境
AI Infra 60 天学习计划的起点:梳理从用户 prompt 到 GPU kernel 的完整链路,搭建开发环境,理解推理与训练基础设施的全景图。
AIInfra 学习