HCIE-AI SA:大模型微调和安全治理
1.概述


2. 目标

3. 预训练和微调对比

4. 微调与提示工程、RAG对比
ICL(In-Context Learning)
In-Context Learning(又称上下文学习,语境学习, ICL)在不调整模型参数的情况下,仅用下游任务的示例就可以取得极佳的效果,即Few Shot;在模型能力足够强的时候,Zero Shot和One Shot也可以取得极佳的效果;
提示工程(Prompt Engineering)
当研究者发现可以在不更新参数的情况下,让LLM适应下游任务,于是开始研究如何更好的构造Prompt(提示词,即模型的输入),从而让模型的输出更准确,这样做的好处是将所有下游任务统一为预训练任务,然后利用不同的Prompt来完成不同的下游任务,模型无需为了下游任务更新参数,降低了模型使用成本。
RAG(检索增强生成,Retrieval-Augmented Generation)


5. 如何让一个英文好,中文不好的模型提高中文能力?

6. 大模型参数敏感性

7. LLM微调数据集构建

监督式微调能够利用预训练模型的参数和结构,避免从头开始训练模型,从而加速模型的训练过程,并且能够提高模型在目标任务上的表现。监督式微调在计算机视觉、自然语言处理等领域中得到了广泛应用。然而监督也存在一些缺点。首先,需要大量的标注数据用于目标任务的微调,如果标注数据不足,可能会导致微调后的模型表现不佳。其次,由于预训练模型的参数和结构对微调后的模型性能有很大影响,因此选择合适的预训练模型也很重要。
7.1 手动构建

指令微调思想:指令调整指以监督学习的方式在由(指令、输入[非必需]、输出)对组成的数据集上进一步训练大语言模型的过程,旨在缩减LLM的下一个词预测目标与用户使LLM遵守人类指令的目标之间的差距




7.2 自动构建

8. 微调分类

9. 全参微调

9.1 推理内存评估

9.2 训练内存评估

10. 低参微调

10.1 Freeze微调

Transformer模型主要由自注意力层和全连接层(FF层)构成。对于Transformer的每一层结构,自注意力层的参数量为4*d2,即WQ、WQ、WQ和WQ∈Rdxd;FF层的参数量为8*d2,即W1∈Rdx4d,W2∈Rdx4d。因此FF层占据了模型的2/3的参数,具有重要的研究价值。
10.2 Prompt Tuning

10.3 Prefix-Tuning

10.4 P-Tuning

10.5 P-Tuning v2


10.6 LoRA

10.7 QLoRA

11. 微调框架介绍


12. LLM安全治理



奖励模型数据集

PPO介绍

DPO介绍

13. 总结
本文主要介绍了大模型微调和LLM安全治理的内容,笔试占比12%。
- 点赞
- 收藏
- 关注作者
评论(0)