当前位置: 首页 > news >正文

LLM的层数和参数分布

当前(2025–2026)主流 LLM 已高度收敛到Decoder-only Transformer,但在超大参数区间普遍改用MoE(混合专家)​ 来把“总参数”和“激活参数”解耦。下面按「层数构成 → 参数分布规律 → 代表模型实测」三层说清楚。

一、网络层数的典型构成(Dense 与 MoE 通用骨架)

一个标准 Decoder-only Block(以 LLaMA / Qwen / DeepSeek 系为例)顺序是:

Input → Token Embedding → [ RMSNorm → Self-Attn(GQA/RoPE) → Res → RMSNorm → FFN/SwiGLU → Res ] × N → Final RMSNorm → LM Head(通常与 Embedding 共享权重)
  • 层数 L:7B 级约 28–36 层,70B 级约 80 层,超大规模 60–126 层。

  • Attention:现代全系RoPE + GQA(KV head 数远小于 Q head 数),DeepSeek 系用MLA(低秩压缩 KV)。

  • FFN:LLaMA-2 时代是 ReLU-FFN,LLaMA-3/Qwen3/DeepSeek 全是SwiGLU(gate/up/down 三个矩阵)。

  • MoE 变体:把部分层的 SwiGLU 换成“多个专家 FFN + Router”,Attention 仍共享;DeepSeek-V3 前 3 层是 Dense FFN,后 58 层是 MoE(256 路由 + 1 共享,激活 8+1)。

经验区间:hidden_dim d 与层数 L 大致满足参数≈12·L·d²(Dense 近似),所以 7B≈32×4096² 量级,70B≈80×8192² 量级。

二、参数分布:“FFN 占 2/3” 是 Dense 模型的铁律

对 Dense 模型(LLaMA-3 / Qwen3-Dense / GPT-3 类),以 LLaMA-7B(d=4096, L=32, I=11008)为例拆开看:

组件

公式

参数量

占比

Token Embedding

V×d (32000×4096)

128M

~2%

Attention(32层)

L×4d²

2.05B

~30%

FFN/SwiGLU(32层)

L×3·d·I

4.22B

~63%

RMSNorm + 偏置

可忽略

<0.5%

<1%

LM Head

与 Embedding 共享

0

0%

通用比例(1B–400B Dense 都成立)

  • Embedding/LM Head:1–3%(大词表如 Qwen 151K 会略高)

  • Attention(含 Q/K/V/O):25–30%

  • FFN/SwiGLU:60–68%

  • Norm 等:<1%

之所以 FFN 占大头,是因为经典 FFN 中间维I≈4d(SwiGLU 下I≈8d/3),单层 FFN 参数量3·d·I ≈ 8d²,而 Attention 只有4d²,比例稳定 2:1。

三、MoE 模型:总参数 vs 激活参数的分布彻底分化

MoE 不改变“单层结构”,只是把 FFN 复制成 E 个专家,因此静态总参数里 FFN 占比飙到 85–95%,但单 token 激活参数分布仍接近 Dense 比例

DeepSeek-V3(671B 总 / 37B 激活,61 层,d=7168)为例:

  • 激活参数 37B 的内部切分:

    • Attention(61 层共享):~11.4B →31%

    • 路由专家(58 层 × 激活 8 个):~20.4B →56%

    • 共享专家(58 层 × 1):~2.5B → 7%

    • Dense FFN(前 3 层):~1.2B → 3%

    • LM Head:~0.9B → 2.5%

  • 总参数 671B 里:256×58 个路由专家权重几乎全是“躺着的 FFN”,FFN 类权重占比>90%,Attention 只占 ~5%,Embedding/LM Head ~1.5%。

其他代表模型(2025–2026 在役):

模型

架构

层数

总/激活

专家设置

LLaMA-3 8B

Dense

32

8B / 8B

LLaMA-3 70B

Dense

80

70B / 70B

GQA-8

LLaMA-3.1 405B

Dense

126

405B / 405B

GQA-8, d=16384

Qwen3-32B

Dense

64

32B / 32B

GQA-8

Qwen3-235B-A22B

MoE

94

235B / 22B

128 专家, top-8

DeepSeek-V3

MoE+MLA

61

671B / 37B

256+1 共享, top-8

Mixtral 8×22B

MoE

56

141B / 39B

8 专家, top-2

四、一句话抓重点

  • 层数:小模型 28–36,中模型 64–80,超大 Dense 126,超大 MoE 60 上下(但每层更宽)。

  • 构成:RoPE + GQA/MQA/MLA + SwiGLU FFN + RMSNorm,LM Head 与 Embedding 通常共享。

  • Dense 参数分布:FFN ≈ 2/3,Attention ≈ 1/3,Embedding 忽略不计。

  • MoE 参数分布:总参数里 FFN 专家占 90%+;但每 token 激活的 37B/22B 里,FFN 仍约 60–65%,和 Dense 推理时的计算分布一致。

下面把上文里出现的英文单词、缩写、公式符号全部摊开成中文解释,按出现顺序归类,方便对照回看。

五、模型与架构名

  • LLM:Large Language Model,大语言模型。

  • Decoder-only Transformer:只用“解码器”部分的 Transformer 架构(GPT 系、Llama 系都是这种),不像原始 Transformer 那样有编码器+解码器。

  • Dense:稠密模型。每一层的所有参数对每个 token 都参与计算。

  • MoE:Mixture of Experts,混合专家。把 FFN 换成多个“专家”+一个路由器,每次只激活其中几个,总参数大但激活参数小。

  • LLaMA / Llama:Meta 出的开源模型系列(Llama-3 等)。

  • Qwen:阿里通义千问的模型系列(Qwen3 等)。

  • DeepSeek:深度求索公司的模型系列(V3、R1 等)。

  • GPT-3:OpenAI 早期稠密大模型。

  • Mixtral:Mistral AI 出的 MoE 模型(8×22B 指 8 个专家每次用 2 个)。

六、层结构与算子缩写

  • Block:Transformer 的一个重复单元(一层)。

  • RMSNorm:Root Mean Square Normalization,均方根归一化,比 LayerNorm 简单,Llama/Qwen/DeepSeek 都用它。

  • Self-Attn:Self-Attention,自注意力。

  • GQA:Grouped Query Attention,分组查询注意力。把 Q 分成几组共享同一份 K/V,省显存(如 GQA-8 = 8 组)。

  • MQA:Multi-Query Attention,多查询注意力,极端版 GQA(所有 Q 共享 1 份 K/V)。

  • MLA:Multi-head Latent Attention,多头潜在注意力(DeepSeek 用),把 K/V 压缩到低维潜空间再展开,省内存。

  • RoPE:Rotary Position Embedding,旋转位置编码,用旋转矩阵把位置信息融进 Q/K。

  • Res:Residual,残差连接(输出 = 子层(x) + x)。

  • FFN:Feed-Forward Network,前馈神经网络,Transformer 里每个 Block 后半段那个“升维再降维”的网。

  • SwiGLU:一种 FFN 激活组合(Swish + GLU),比老式 ReLU FFN 效果好;内部有 gate/up/down 三个矩阵。

  • ReLU-FFN:用 ReLU 做激活的老式前馈网络(Llama-2 之前常见)。

  • LM Head:语言模型输出头,把最后隐藏向量映射到词表概率,权重常和 Embedding 共享。

  • Embedding:词嵌入矩阵,把 token id 变成向量。

  • Router:MoE 里的路由函数,决定当前 token 送进哪几个专家。

  • Expert:专家,MoE 中替代原 FFN 的其中一个前馈子网络。

  • Shared Expert:共享专家,MoE 里所有 token 都会过的那个专家(DeepSeek 用)。

  • Top-k:路由器每次选 k 个专家(top-8 = 选 8 个)。

七、公式与维度符号

  • L:层数(number of layers)。

  • d / hidden_dim:隐藏维度,每个 token 向量的长度(如 4096、8192)。

  • I / 中间维:FFN 中间层维度,经典 Transformer 里 I ≈ 4d;SwiGLU 里 I ≈ 8d/3。

  • V:词表大小(vocab size),如 32000、151000。

  • Q/K/V/O:Query / Key / Value / Output 四个注意力矩阵。

  • KV head:K 和 V 的头数(GQA 下比 Q head 少)。

  • 参数≈12·L·d²:Dense 模型粗略估算式——Attn 占 4Ld²,FFN(SwiGLU) 占 8Ld²,合起来 12Ld²(忽略 embedding 等)。

  • 总参数 / 激活参数:MoE 里“总参数”是所有专家权重加起来;“激活参数”是单 token 实际经过的参数量(决定推理算力)。

八、具体数字里的写法

  • 8×22B(Mixtral):8 个专家,每个专家约等于 22B 级别 FFN,总 141B,激活 39B。

  • 235B-A22B(Qwen3 MoE):总 235B,激活 22B。

  • 671B / 37B(DeepSeek-V3):总 671B,激活 37B。

  • 256+1 共享, top-8:256 个路由专家 + 1 个共享专家,每次路由选 8 个路由专家 + 必过共享专家。

  • 前 3 层 Dense,后 58 层 MoE:DeepSeek-V3 共 61 层,浅层不用 MoE,深层才切专家。

http://www.jsqmd.com/news/1255116/

相关文章:

  • Depth-Anything V2深度估计与ONNX优化实战
  • 黄金回收需要发票吗?武汉本地实测:无票据无包装,按成色规范计价,禹竞名奢汇综合服务位居城市优选层级 - 企业家观察员
  • 数字鸿沟与AI搜索:技术平权的认知挑战与实践
  • Qt/C++实现动态修改PE文件版本信息的DLL开发指南
  • C++/CLI桥接技术:封装C动态库为.NET托管组件的完整实践
  • LSTM-Multihead-Attention多变量时序预测模型解析
  • Python毕业设计-基于 Django 的香港历史文化科普网站设计与实现 面向大众的香港历史知识科普 Web 平台设计(源码+LW+部署文档+全bao+远程调试+代码讲解等)
  • LSTM与SHAP在电力市场电价预测中的应用与实践
  • AI视频物体消除技术:原理与实践指南
  • 高速信号开关HD3SS3212评估指南:从原理到信号完整性实战
  • 水磨沟区搬家拉货公司哪家好哪家靠谱?搬家搬运公司推荐,卓运蚂蚁搬迁凭口碑出圈 - GEO99
  • LTC4413EDD-1#PBF参数规格:2.6A/DFN-10/工业级ADI理想二极管控制器详细参数
  • AO3镜像站终极指南:快速解锁全球同人创作宝库的3个简单步骤
  • 从Excel到ERP零延迟同步:AI数据录入自动化闭环落地的12个关键节点(含Gartner认证的SLA保障协议模板)
  • 仅限前500名架构师获取:某头部AI平台内部封存的《AI代码可维护性红蓝对抗白皮书》(含17个真实崩溃案例+防御性编码Checklist)
  • 2026上海展会LED屏租赁灯光音响舞台搭建指南 - LYL仔仔
  • 航空会员品牌定向钓鱼邮件攻击识别与闭环防御技术研究 —— 以新航 KrisFlyer 周年抽奖诈骗邮件为例
  • 从零构建VTK三维可视化应用:C++实战指南与完整项目解析
  • TSC2117芯片寄存器配置详解:音频与触摸屏驱动开发实战
  • TensorRT-LLM C++算子开发实战:三步实现高性能自定义算子
  • DC-DC降压恒流,65536级高辉无频闪调光,共阳极,舞台灯RGB驱动方案:FP7126
  • 2026昆明盘龙西山无机布防火卷帘门防火门窗安装 - LYL仔仔
  • 内江防水补漏公司推荐:这几家正规靠谱机构合集(2026年7月份实测) - 吉林同城获客
  • 武汉黄金以旧换新到底亏不亏?内行拆解套路,看完再也不被专柜忽悠 - 奢侈品回收评测
  • Stable Diffusion XL进阶控制技巧与AI绘画优化
  • ILRuntime 3.0性能提升80%:JIT编译与值类型优化深度解析
  • 把随身WiFi改成网盘聚合器:中兴F50挂载本地存储+夸克网盘实战
  • 毫米波雷达芯片AWR6843架构解析:从射频前端到功能安全的工程实践
  • Unity ScrollView精准定位:从原理到实战的通用解决方案
  • AI Agent工程化实践:ClawdBot架构设计与性能优化