HCIE-AI SA:大模型压缩与部署

举报
剑指南天 发表于 2026/07/11 09:43:57 2026/07/11
【摘要】 本文主要介绍了模型部署和压缩相关内容以及大模型应用开发,笔试占比6%。

1.概述

本文主要介绍模型部署和压缩和一些大模型开发。

2. 目标

3. AI应用开发流程

4. 如何降低模型部署成本?

5. 模型压缩技术

5.1 小模型压缩方法

5.2 大模型压缩技术

由于Prefill是一次模型的推理,而Decoding则要反复迭代很多次,优化重点在降低带宽需求,而不是降低计算量

① KV Cache压缩技术

       Streaming LLM

     

       

         FastGen -- 自适应KV cache压缩

             

                     

             

MQA与GQA

② 大模型压缩技术

LLM Pruner:高效率大模型剪枝算法

     剪枝后的模型为了保持精度需要训练

One-shot权重稀疏化:大模型权重稀疏压缩,缓解存储与访存压力

大模型PTQ量化:高效率量化,W8A8、W8A16与W4A16是典型方式

权重低比特量化:INT4量化,模型压缩4倍,提升权重搬运效率

6. 模型压缩工具介绍

ModelSlim

训练加速-模型低秩分解

训练加速-模型稀疏加速训练

推理加速-大模型量化

推理加速-大模型稀疏量化和权重压缩

推理加速-训练后量化(ONNX)

推理加速-训练后量化(PyTorch)

推理加速-训练后量化(MindSpore)

推理加速-模型剪枝


推理加速-模型蒸馏

7. 大模型部署框架介绍

vLLM

HuggingFace TGI

DeepSpeed-MII

MindIE

8. 大模型应用开发

8.1 大模型应用开发流程

8.2 为什么需要RAG?

8.3 向量数据库

工作流程:

向量数据库解决的问题:

为什么使用向量数据库?

向量数据库构建

9. 总结

本文主要介绍了模型部署和压缩相关内容以及大模型应用开发,笔试占比6%。

【版权声明】本文为华为云社区用户原创内容,未经允许不得转载,如需转载请自行联系原作者进行授权。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。