HCIE-AI SA:DeepSpeed进阶
1.概述
DeepSpeed是一种深度学习训练优化工具,旨在通过分布式训练和混合精度技术来提高训练速度和节省资源。
2. 目标

3. 大模型训练难点

4. DeepSpeed在大模型训练的优势
DeepSpeed是微软开发的一种深度学习训练优化工具,旨在通过分布式训练和混合精度技术来提高训练速度和节省资源。

5. DeepSpeed的推理特性
![]()
![]()
![]()
6. DeepSpeed的压缩特性
![]()
![]()
![]()
7. 大模型训练内存
7.1 Model States Memory
训练期间大部分的内存被模型状态(Models States),也就是:优化器参数(Optimizer states)、梯度(Gradients)和模型参数(Parameters)所消耗。
梯度、模型参数、优化器为参数更新计算的一阶动量(momentum)和二阶动量(variance),模型参数备份
Model States Memory计算


![]()
7.2 Residual States Memory

8. DeepSpeed简介

9. DeepSpeed训练特性
9.1 ZeRO优化器
9.1.1 ZeRO
![]()
ZeRO有两组优化,ZeRO-DP旨在减少模型状态的内存占用,ZeRO-R旨在减少剩余内存消耗。
![]()

① ![]()

② ![]()

③ ![]()

![]()

④ ![]()

⑤ ![]()

⑥ ![]()

9.1.2 ZeRO-Offload


9.1.3 ZeRO-Infinity




9.1.4 ZeRO++


ZeRO++的组成:




9.2 3D并行
![]()



该图具有32个工作线程的3D并行的示例。神经网络的层分为四个Pipeline阶段。每个Pipeline阶段内的层进一步划分为四个模型并行工作器。最后,每个Pipeline跨两个数据并行实例进行复制,并且ZeRO跨数据并行副本对优化器状态进行分区。

图中相同颜色表示同一个节点上的GPU:本图中有8个计算节点,每个节点有4个GPU,此3D拓扑图表示了该系统上GPU的映射关系。


9.3 通信优化
![]()
![]()
10. DeepSpeed推理特性

① 推理自适应并行



② 推理优化内核


③ 灵活的量化支持


11. 总结
本文首先介绍了DeepSpeed概况,然后详细介绍了它的主要特性ZeRO实现原理,在ZeRO基础上,DeepSpeed如何实现3D并行,最后讲解了DeepSpeed通信优化方法,笔试占比 6%。
- 点赞
- 收藏
- 关注作者
评论(0)