Megatron-LM

中文 Tutorial 入门书

📌 版本基线: NVIDIA/Megatron-LM · main · commit 432d76b2b8bf (2026-05-26) · 详见 版本基线表。

面向:第一次接触大规模分布式训练、想知道千亿参数模型到底是怎么训出来的工程师 / 研究者。

前置:会用 PyTorch 写过单卡训练脚本;理解 batch / loss / optimizer 基本概念;用过一两次 DDP。

本书的目标

把 NVIDIA Megatron-LM 这套"千亿参数预训练事实标准"的内部结构剥开给你看。读完后你应该可以:

目录

章节标题状态
序 为什么读这本书 ✅
第 1 章 项目背景与定位 ✅
第 2 章 环境准备与安装(NGC / pip / 源码 三条路径) ✅
第 3 章 快速上手:跑通最小可见的训练循环 ✅
第 4 章 核心概念:rank / parallel state / micro-batch ✅
第 5 章 配置系统:arguments.py 全字段拆解 ✅
第 6 章 数据流水线:indexed dataset 与 mmap ✅
第 7 章 张量并行 TP 与列并行 / 行并行的实现 ✅
第 8 章 流水线并行 PP 与 interleaved schedule ✅
第 9 章 序列并行 SP / 上下文并行 CP ✅
第 10 章性能优化:fused kernel / flash-attn / recompute / fp8 ✅
第 11 章OOM、NCCL hang、loss spike 排查指南 ✅
第 12 章Checkpoint:Megatron ↔ HuggingFace 互转 ✅
第 13 章源码导读:从 pretrain_gpt.py 顺藤摸瓜 ✅
附录 A 论文与延伸阅读 ✅

怎么读这本书

📁 配套源码:../../repos/megatron-lm/  ·  🔗 上一级:总目录