系统工程
分布式训练
从数据并行到多维混合并行,理解大模型训练的核心并行策略
通信量口径说明:本系列统一以每个训练步、每个 rank 发送 + 接收的数据量为口径,以参数量 为单位。默认分析假设前向传播时缓存了完整参数供反向使用()。若实现上反向传播需要重新聚合参数(如不缓存),通信量会增加到 。各章节中会标注具体场景。
| 你想做的事 | 需要的知识 |
|---|---|
| 训练 7B+ 参数的大模型 | DDP、ZeRO、FSDP |
| 理解 PyTorch FSDP 的工作原理 | ZeRO-3 vs FSDP 的分片差异 |
| 单层参数太大放不下单卡 | 张量并行(Column/Row Parallel) |
| 减少流水线气泡提升 GPU 利用率 | GPipe、1F1B 调度策略 |
| 理解 Megatron-LM 的并行策略 | 多维混合并行、ParallelContext |