数据并行
会员专享理解通信原语和 DDP 的梯度同步机制
在权益中心获取代码训练大模型的第一步,是让多块 GPU 一起干活。数据并行(Data Parallelism)是最直觉的方式:每块 GPU 持有完整的模型副本,各自处理不同的数据,最后把梯度汇总。本章我们先理解单卡的内存瓶颈,再学习多卡通信的基础,最后深入 DDP 的实现。
单卡训练的内存组成
一个 7B 参数的模型,fp16 权重只需要 14 GB(7B × 2 bytes),但在 80GB 的 A100 上却训练不了。内存都去哪了?
答案是:训练时 GPU 上不只存参数,还要存梯度和优化器状态。
混合精度训练的内存需求
登录以继续阅读
这是一篇付费内容,请登录您的账户以访问完整内容。
CookLLM文档