HCIE-AI SA:DeepSpeed进阶

举报
剑指南天 发表于 2026/07/08 11:49:32 2026/07/08
【摘要】 本文首先介绍了DeepSpeed概况,然后详细介绍了它的主要特性ZeRO实现原理,在ZeRO基础上,DeepSpeed如何实现3D并行,最后讲解了DeepSpeed通信优化方法,笔试占比 6%。

1.概述

DeepSpeed是一种深度学习训练优化工具,旨在通过分布式训练和混合精度技术来提高训练速度和节省资源。

2. 目标

   

3. 大模型训练难点

4. DeepSpeed在大模型训练的优势

DeepSpeed是微软开发的一种深度学习训练优化工具,旨在通过分布式训练和混合精度技术来提高训练速度和节省资源

5. DeepSpeed的推理特性

 

6. DeepSpeed的压缩特性

 

 

7. 大模型训练内存

7.1 Model States Memory

训练期间大部分的内存被模型状态(Models States),也就是:优化器参数(Optimizer states)、梯度(Gradients)和模型参数(Parameters)所消耗。

梯度、模型参数、优化器为参数更新计算的一阶动量(momentum)和二阶动量(variance),模型参数备份

Model States Memory计算

7.2 Residual States Memory

8. DeepSpeed简介

9. DeepSpeed训练特性

9.1 ZeRO优化器

9.1.1 ZeRO

ZeRO有两组优化,ZeRO-DP旨在减少模型状态的内存占用,ZeRO-R旨在减少剩余内存消耗


⑤ 

9.1.2 ZeRO-Offload

9.1.3 ZeRO-Infinity

 

 

9.1.4 ZeRO++

 

ZeRO++的组成:

   

9.2 3D并行

 

 

该图具有32个工作线程的3D并行的示例。神经网络的层分为四个Pipeline阶段。每个Pipeline阶段内的层进一步划分为四个模型并行工作器。最后,每个Pipeline跨两个数据并行实例进行复制,并且ZeRO跨数据并行副本对优化器状态进行分区。

图中相同颜色表示同一个节点上的GPU:本图中有8个计算节点,每个节点有4个GPU,此3D拓扑图表示了该系统上GPU的映射关系。

9.3 通信优化


10. DeepSpeed推理特性

 

① 推理自适应并行

   

       

   

② 推理优化内核

   

③ 灵活的量化支持

 

11. 总结

本文首先介绍了DeepSpeed概况,然后详细介绍了它的主要特性ZeRO实现原理,在ZeRO基础上,DeepSpeed如何实现3D并行,最后讲解了DeepSpeed通信优化方法,笔试占比 6%。

【版权声明】本文为华为云社区用户原创内容,未经允许不得转载,如需转载请自行联系原作者进行授权。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。