HCIE-AI SA:大模型算法架构

举报
剑指南天 发表于 2026/06/26 14:37:42 2026/06/26
【摘要】 本章介绍了大模型算法及其架构,了解其原理、技术创新。笔试占比18%。

1.概述

Google在 2017 年发表一篇论文《Attention Is All You Need》,提出了一种全新的模型架构——Transformer。Transformer不仅可以通过并行计算显著提升了训练效率,也可以通过注意力机制增强了模型对长距离依赖的建模能力。

2. 目标

3. 传统深度学习算法的问题

①扩展性差

②泛化能力受限

③复杂任务表现差

④多模态能力不足

4. Transformer详解

4.1 Transformer架构图

4.2 前馈神经网络层

前馈神经网络(Feed-Forward Network,简称 FFN)是 Transformer 编码器中每个子层的重要组成部分,紧接在多头注意力子层之后。它通过对每个位置的表示进行逐位置非线性的特征变换,进一步提升模型对复杂语义的建模能力。

4.3 自注意层

自注意力机制(Self-Attention)是 Transformer 编码器的核心结构之一,它的作用是在序列内部建立各位置之间的依赖关系,使模型能够为每个位置生成融合全局信息的表示。之所以被称为“自”注意力,是因为模型在计算每个位置的表示时,所参考的信息全部来自同一个输入序列本身。解决了循环神经网络信息信息丢失的问题,并且对词和全局信息的关系进行了建模。

自注意力的计算过程:

(1)生成Query、Key、Value向量

三个向量的计算公式如下:

(2)计算位置间相关性

评分函数采用向量点积形式。由于在高维空间中,点积的数值可能过大,会影响 softmax 的稳定性,因此在实际计算中对结果进行了缩放。最终的评分函数为:

其中是key向量的维度,用于缩放点积的幅度。这个分数越大,表示第 i 个位置越应该关注第 j 个位置的信息。对于整个序列,可以通过矩阵运算一次性计算所有位置之间的评分,计算公式如下图所示:

(3)计算注意力权重

在得到每个位置与所有位置之间的相关性评分后,模型会使用 softmax 函数进行归一化,确保每个位置对所有位置的关注程度之和为 1,从而形成一个有效的加权分布。

(4)加权汇总生成输出,统一了不同词对语义表达能力的量纲

总的来说公式:

从Q、K、V的应用,可以推测出参数的学习目标分别是表达更多词独立的语义,表达更多整体语义和均衡部分和整体的语义表达。

4.4 多头注意力机制(Multi-Head Attention)

一个句子往往同时包含多种类型的语义关系,通过多组独立的 Query、Key、Value 投影,让不同注意力头分别专注于不同的语义关系,最后将各头的输出拼接融合。

4.5 残差连接与层归一化

残差连接(Residual Connection)用于缓解深层神经网络中的梯度消失问题。其核心思想是:将子层的输入直接与其输出相加,形成一条跨越子层的“捷径”,其数学形式为:

层归一化(Layer Normalization,简称 LayerNorm)每个子层在残差连接之后都会进行层归一化。它的主要作用是规范输入序列中每个token的特征分布(某个token的表示可能在不同维度上有较大数值差异),提升模型训练的稳定性,抑制梯度爆炸。

4.6 位置编码(Positional Encoding)

为每个词引入一个表示其位置信息的向量,并将其与对应的词向量相加,作为模型输入的一部分。这样一来,模型在处理每个词时,既能获取词义信息,也能感知其在句子中的位置,从而具备对基本语序的理解能力。

Transformer 使用了一种基于正弦(sin)和余弦(cos)函数的位置编码方式,具体定义如下:


Transformer提出的这种编码方式具备以下优势:所有值都在[−1,1]范围内,数值稳定;编码方式固定、可预计算,无需训练;相同位置的编码在不同句子中保持一致;编码之间具有数学规律,便于模型在注意力机制中感知词语之间的相对位置关系。

4.7 Masked自注意力(Masked Self Attention)

解码器在自注意力机制中引入了遮盖机制(Mask)。该机制会在计算注意力时,阻止模型访问当前位置之后的词,只允许它依赖自身及前文的信息。这样,即使在并行训练时,模型也只能像逐词生成一样“看见”它应该看到的内容,从而保持训练与推理阶段的一致性。

Mask 机制的实现非常简单:只需将注意力得分矩阵中当前位置对其后续位置的评分设置为 −∞

编码器-解码器注意力的核心机制与前面讲过的自注意力机制完全一致,区别仅在于:Query 来自解码器当前的输入表示,即当前生成状态;Key和Value 来自编码器的输出表示,即整个源序列的上下文。

模型的训练:训练时,Transformer 将目标序列整体输入解码器,并在每个位置同时进行预测。为防止模型“看到”后面的词,破坏因果顺序,解码器在自注意力机子层中引入了 遮盖机制(Mask),限制每个位置只能关注它前面的词。这种机制让模型在结构上模拟逐词生成,但在实现上能充分利用并行计算,大幅提升训练效率。

模型推理:推理时,每一步都要重新输入整个已生成序列,模型需要基于全量前文重新计算注意力分布,决定下一个词的输出。整个过程必须顺序执行,无法并行。推理阶段,模型每一步都要重新输入当前已生成的全部词,通过自注意力机制建模上下文关系,预测下一个词。

4.8 Decoder与Encoder区别

5. Transformer工作流程

①获取输入

首先将每个输入的单词通过 Embedding 转换为词向量,然后与每一个单词的位置 Embedding 相加得到每一个单词的表示向量X。

②将输入传入 Encoder

将得到的单词表示向量矩阵传入 Encoder 中,经过数个 Encoder block 后可以得到句子所有单词的编码信息矩阵。

每一个 Encoder block 输出的矩阵维度与输入完全一致。

③将编码矩阵传递给 Decoder

将 Encoder 输出的编码信息矩阵传递到 Decoder 中,Decoder 依次会根据当前翻译过 1~i 的单词翻译第 i+1 个单词。

在整个过程中,翻译到第 i+1 个单词的时候,需要通过 Mask (掩盖)操作遮盖住第 i+1 之后的单词。

6. Transformer的优缺点

6.1 优点

①并行计算 ②全局信息 ③长距离依赖 ④拓展性强

6.2 Transformer 中存在的问题

①位置编码:Transformer中所使用的是绝对位置编码,缺少相对位置信息

②计算:⑴Q、K、V的存储会占用大量显存;⑵Q、K、V的计算会进行大量的IO;⑶注意力机制计算量庞大

计算复杂度统计:

7. Transformer的优化方式

7.1 位置编码

RoPE(旋转位置编码)的优点是:①序列长度灵活;②减少token间的依赖关系;③即保留绝对位置信息,又保留相对位置信息。

ALiBi

7.2 算力瓶颈

GMEE

FlashAttention

7.3 显存瓶颈

PagedAttention 是一种 KV Cache 显存管理 + 注意力计算机制。核心思想是:不再要求 KV Cache 在 GPU 显存中连续存储,而是将其切分为固定大小的 Block(页),通过块表(Block Table)映射到非连续的物理显存。

8. 大语言模型架构介绍

GLM

ChatGLM

LLaMA

LLaMA2

9. 多模态大模型架构介绍

9.1 DALL-E 2

9.2 Open-Sora

10. MoE结构介绍

10.1 MoE的工作流程

10.2 前向传播的具体步骤如下

(1)路由得分计算

Router 接收 Token 的隐藏表示,并通过线性映射为所有专家生成一组得分。

(2)选择 Top-k 专家

从得分中选取得分最高的 k 个专家,其余专家在本次计算中不参与处理。

(3)计算路由权重

对被选中的专家得分执行 softmax,得到归一化权重,用于表示各专家在最终输出中的贡献比例。

(4)专家执行前向计算

被激活的专家分别对输入 Token 进行独立计算,生成各自的输出。

(5)加权合并输出

将所有激活专家的输出按照路由权重加权求和,得到 Token 在 MoE 层的最终表示

10.3 负载均衡辅助损失

负载均衡辅助损失(Load Balancing Auxiliary Loss) 是一个额外加到总训练损失上的惩罚项,它的作用是鼓励路由器将 token 均匀地分配给各个专家,避免出现某些专家被频繁使用而其他专家几乎闲置的“专家坍塌”问题。

10.4 MoE的优缺点

10.5 MoE模型

GShard

Switch Transformer

GLam

Mixtrak 8x7B

10.6 MoE的常见并行计算方法

11. Deepseek算法解析及工程优化

11.1 DeepSeek-V3的架构创新

①MLA主要作用是通过优化KV-cache来减少显存占用,从而提升推理性能

②DeepSeekMoE

③MTP

④混合精度框架

⑤DualPipe

11.2 DeepSeek-R1

①GRPO

12. 总结

本章介绍了大模型算法及其架构,了解其原理、技术创新。笔试占比18%。

【版权声明】本文为华为云社区用户原创内容,未经允许不得转载,如需转载请自行联系原作者进行授权。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。