安橙的博客
  • 博文
  • 标签
  • 搜索

Distributed

  • Day 27 · 训练性能分析

    2026-06-20AIPyTorchCUDA

    学习训练性能分析的最小闭环:计算 MFU / HFU,用 Nsight Systems 抓一段训练 step,通过 NVTX、CUDA kernel、NCCL timeline 识别 compute、communication 与 pipeline bubble。

  • Day 28 · 周复盘 + 小项目

    2026-06-20AIDistributedTraining

    阶段 2 收官:复盘分布式训练 Infra 的 NCCL、DDP、ZeRO、TP、PP、SP/CP、DeepSpeed、checkpoint、data pipeline、算子加速与 profiling;在 2 卡或云上 8 卡训练一个约 125M GPT,记录 MFU,并完成 ZeRO-3 vs TP+PP 的硬件取舍笔记。

  • 上一页
  • 2 / 2
© 2026 安橙的博客