大模型参数量级:规模、划分与「参数」到底是什么

从 GPT-2 的 15 亿到前沿模型的万亿级——参数量怎么量、怎么分、而又到底指哪些东西。

参数量级 参数构成 稠密/MoE 显存估算

一、参数量级概览

主流开源与商用大模型的参数量,大致落在 十亿(B)到万亿(T)区间。下面按量级从小到大排列(横轴为对数刻度,仅为示意):

10⁹ 10¹⁰ 10¹¹ 10¹² 10¹²+ GPT-2 · 1.5B Llama 3 · 8B Llama 3 · 70B GPT-3 · 175B Llama 3.1 · 405B DeepSeek-V3 · 671B GPT-4(估) · 1.8T 注:横轴为对数刻度,条长不按线性比例;GPT-4 为业界推测值
量级分层(经验划分)

二、参数量「怎么划分」

「划分」有两种常见口径,别混为一谈:

口径 A:按模型体量分层(上文已讲)

这是大家聊「大模型」时最常用的粗分:小 / 中 / 大 / 超大。但它只是规模描述,不是数学定义。

口径 B:按架构——稠密(Dense) vs 稀疏(MoE)

稠密模型 (Dense) 每个 token 激活 100% 参数 例:Llama 70B → 每 token 用满 70B 稀疏模型 (MoE) 每 token 只激活 1–2 个专家 例:DeepSeek-V3 总 671B,激活仅 37B

关键区分:总参数 vs 激活参数。 对 MoE 模型,「参数量」通常指总参数(所有专家之和),但实际每个 token 只用到其中一小部分(激活参数)。所以「671B 模型」不等于「每个字都要算 671B 次」。

三、「参数」到底指哪些参数

严格定义:大模型的「参数(parameters)」= 模型里所有可训练的权重(weights)和偏置(biases)的数量之和,也就是所有参数张量(tensor)里元素的总数。是所有参数加起来的总和,不是某一层的、也不是某一类的。

通常包含:优化器状态(Adam 的动量/方差)、激活值、KV 缓存、中间计算缓存——这些是训练/推理时的临时量,不算「模型本身的参数」。

参数量 = Σ 每个参数矩阵的 (行数 × 列数) + 所有偏置的元素数

记一次矩阵乘法 y = W·x + b,则这一层贡献 (d_out × d_in) 个权重 + d_out 个偏置。
把所有层(embedding、attention、FFN、norm、输出头)累加,得到总参数量。

一句话:「参数量」就是模型里全部可学习张量的元素个数之和。模型越大,这些矩阵越大、层数越多,参数就越多。

四、参数都「长」在哪些地方

以最常见的「解码器-only」Transformer(如 Llama、GPT)为例,参数主要来自四大块:

输入 Embedding 表:vocab × d_model 例 32000 × 4096 ≈ 1.3 亿 × L 层 Transformer Block(如 32 层) Self-Attention QKV + 输出投影 FFN / MLP 上/下/门投影 (SwiGLU) 每层再含 RMSNorm(极少量) 单层参数 ≈ 2 亿(以 d=4096, FFN=11008 为例) 输出层 LM Head:d_model × vocab 常与 Embedding 共享权重 → 不重复计入
Transformer Block 参数构成(以 Llama-7B 量级估算)
组件公式(每实例)约占比
Embedding 表vocab × d_model~2%
注意力 QKV 投影3 × d_model × d_model~12%
注意力输出投影d_model × d_model~4%
FFN(SwiGLU)3 × d_model × d_ff(d_ff≈4×d)~64%
RMSNorm / 偏置2 × d_model × 层数极小
LM Headd_model × vocab(常与 emb 共享)~2%

结论:FFN 是大头(约 2/3),其次是注意力;绝大多数参数在「矩阵乘法」里。

经验公式(稠密解码器模型)
N ≈ L × ( 12 × d_model² ) + 2 × vocab × d_model

其中 L = 层数,d_model = 隐藏维度,vocab = 词表大小。 FFN 取 d_ff≈4·d_model、注意力取全连接时,每层约 12·d²(含注意力 4·d² + FFN 8·d²)。

五、稠密 vs 稀疏(MoE)再强调

  • 稠密模型:总参数 = 激活参数。算得多、参数利用率高,但同样效果需要更少参数时不如 MoE 省算力。
  • MoE 模型:把 FFN 拆成多个「专家」,每个 token 只路由到少数几个专家。总参数巨大,但激活参数小,训练/推理更省。
  • 所以「参数量」宣传时,稠密模型说总参数=真实算力负担;MoE 说总参数≠真实算力负担,要看「激活参数」才公平。

六、参数 ↔ 存储 / 显存

每个参数用 BF16/FP16 存储时占 2 字节;用 INT8 约 1 字节;FP32 占 4 字节。

模型参数量BF16 权重推理最少显存(估)
Llama 7B7 × 10⁹≈ 14 GB~16–20 GB
Llama 70B7 × 10¹⁰≈ 140 GB~140–170 GB
GPT-3 175B1.75 × 10¹¹≈ 350 GB多卡才能跑

训练时还需优化器状态(Adam 约额外 12–16 字节/参数),显存需求是推理的数倍。

七、结语

要点回顾:

  • 量级:主流大模型在 1B–1T+;常见开源为 7B/13B/70B,前沿为数百 B 到万亿级(多为 MoE)。
  • 划分:两种口径——按体量分层(小/中/大/超大),以及按架构区分稠密 vs MoE(总参数 vs 激活参数)
  • 参数指什么:模型里所有可训练权重与偏置的总和(矩阵/向量的元素总数),不含优化器状态与激活缓存。
  • 长在哪:FFN(约 2/3) + 注意力 + Embedding/LM Head;可用 N≈12L·d² + 2·vocab·d 粗估。
  • 存储:BF16 下约 2 字节/参数,7B≈14GB、70B≈140GB。

提醒:参数多 ≠ 能力强。数据质量、训练方法、架构设计、对齐程度同样(甚至更重要)决定模型表现。参数量只是「容量上限」的一个维度。

文档生成于 2026-08-23 · 仅供学习参考。具体模型参数量以官方技术报告为准(部分如 GPT-4 为业界推测)。