大模型参数量级:规模、划分与「参数」到底是什么
从 GPT-2 的 15 亿到前沿模型的万亿级——参数量怎么量、怎么分、而又到底指哪些东西。
参数量级
参数构成
稠密/MoE
显存估算
一、参数量级概览
主流开源与商用大模型的参数量,大致落在 十亿(B)到万亿(T)区间。下面按量级从小到大排列(横轴为对数刻度,仅为示意):
量级分层(经验划分)
- 轻量 / 端侧(< 10B):0.5B–7B,可跑在手机/笔记本,中文社区常说的「小模型」多在 1B–14B。
- 中量级(10B–100B):7B、13B、34B,开源主力,单卡/多卡可部署。
- 重量级(100B–1T):GPT-3 175B、Llama 3 405B、DeepSeek-V3 671B。
- 超大规模(> 1T):多为 MoE 稀疏模型,GPT-4 级别。
二、参数量「怎么划分」
「划分」有两种常见口径,别混为一谈:
口径 A:按模型体量分层(上文已讲)
这是大家聊「大模型」时最常用的粗分:小 / 中 / 大 / 超大。但它只是规模描述,不是数学定义。
口径 B:按架构——稠密(Dense) vs 稀疏(MoE)
关键区分:总参数 vs 激活参数。 对 MoE 模型,「参数量」通常指总参数(所有专家之和),但实际每个 token 只用到其中一小部分(激活参数)。所以「671B 模型」不等于「每个字都要算 671B 次」。
三、「参数」到底指哪些参数
严格定义:大模型的「参数(parameters)」= 模型里所有可训练的权重(weights)和偏置(biases)的数量之和,也就是所有参数张量(tensor)里元素的总数。是所有参数加起来的总和,不是某一层的、也不是某一类的。
通常不包含:优化器状态(Adam 的动量/方差)、激活值、KV 缓存、中间计算缓存——这些是训练/推理时的临时量,不算「模型本身的参数」。
参数量 = Σ 每个参数矩阵的 (行数 × 列数) + 所有偏置的元素数
记一次矩阵乘法 y = W·x + b,则这一层贡献 (d_out × d_in) 个权重 + d_out 个偏置。
把所有层(embedding、attention、FFN、norm、输出头)累加,得到总参数量。
一句话:「参数量」就是模型里全部可学习张量的元素个数之和。模型越大,这些矩阵越大、层数越多,参数就越多。
四、参数都「长」在哪些地方
以最常见的「解码器-only」Transformer(如 Llama、GPT)为例,参数主要来自四大块:
Transformer Block 参数构成(以 Llama-7B 量级估算)
| 组件 | 公式(每实例) | 约占比 |
| Embedding 表 | vocab × d_model | ~2% |
| 注意力 QKV 投影 | 3 × d_model × d_model | ~12% |
| 注意力输出投影 | d_model × d_model | ~4% |
| FFN(SwiGLU) | 3 × d_model × d_ff(d_ff≈4×d) | ~64% |
| RMSNorm / 偏置 | 2 × d_model × 层数 | 极小 |
| LM Head | d_model × vocab(常与 emb 共享) | ~2% |
结论:FFN 是大头(约 2/3),其次是注意力;绝大多数参数在「矩阵乘法」里。
经验公式(稠密解码器模型)
N ≈ L × ( 12 × d_model² ) + 2 × vocab × d_model
其中 L = 层数,d_model = 隐藏维度,vocab = 词表大小。
FFN 取 d_ff≈4·d_model、注意力取全连接时,每层约 12·d²(含注意力 4·d² + FFN 8·d²)。
五、稠密 vs 稀疏(MoE)再强调
- 稠密模型:总参数 = 激活参数。算得多、参数利用率高,但同样效果需要更少参数时不如 MoE 省算力。
- MoE 模型:把 FFN 拆成多个「专家」,每个 token 只路由到少数几个专家。总参数巨大,但激活参数小,训练/推理更省。
- 所以「参数量」宣传时,稠密模型说总参数=真实算力负担;MoE 说总参数≠真实算力负担,要看「激活参数」才公平。
六、参数 ↔ 存储 / 显存
每个参数用 BF16/FP16 存储时占 2 字节;用 INT8 约 1 字节;FP32 占 4 字节。
| 模型 | 参数量 | BF16 权重 | 推理最少显存(估) |
| Llama 7B | 7 × 10⁹ | ≈ 14 GB | ~16–20 GB |
| Llama 70B | 7 × 10¹⁰ | ≈ 140 GB | ~140–170 GB |
| GPT-3 175B | 1.75 × 10¹¹ | ≈ 350 GB | 多卡才能跑 |
训练时还需优化器状态(Adam 约额外 12–16 字节/参数),显存需求是推理的数倍。
七、结语
要点回顾:
- 量级:主流大模型在 1B–1T+;常见开源为 7B/13B/70B,前沿为数百 B 到万亿级(多为 MoE)。
- 划分:两种口径——按体量分层(小/中/大/超大),以及按架构区分稠密 vs MoE(总参数 vs 激活参数)。
- 参数指什么:模型里所有可训练权重与偏置的总和(矩阵/向量的元素总数),不含优化器状态与激活缓存。
- 长在哪:FFN(约 2/3) + 注意力 + Embedding/LM Head;可用
N≈12L·d² + 2·vocab·d 粗估。
- 存储:BF16 下约 2 字节/参数,7B≈14GB、70B≈140GB。
提醒:参数多 ≠ 能力强。数据质量、训练方法、架构设计、对齐程度同样(甚至更重要)决定模型表现。参数量只是「容量上限」的一个维度。