你可能听过"预训练 + 微调",但预训练才是那块最贵、最重的地基—— 它在海量文本上"从零练起",让模型先学会语言与常识。下面从定义、与微调的区别、工作原理到它产出的"基座模型",全程图解。
一句话:在海量无标注文本上,用"预测下一个词"这种自监督任务,从零(或随机初始化)训练出一个具备通用语言与世界知识的模型。产物叫基座模型 / 基础模型(Base Model)。
一个形象比喻:预训练是"上大学通识课"——学通用能力;微调是"岗前培训"——学某个岗位的具体活儿。二者数据量、目标、成本天差地别。
| 维度 | 预训练 Pre-training | 微调 Fine-tuning |
|---|---|---|
| 出发点 | 随机初始化 / 从头 | 在预训练权重之上 |
| 数据规模 | 万亿级 token(海量) | 千~万级样本(小批) |
| 是否需标注 | 否(自监督) | 是(人工标注) |
| 训练目标 | 预测下一个词 | 按任务答对 / 模仿示范 |
| 算力成本 | 极高(千卡·月) | 低(几卡·天) |
| 产出 | 基座模型(Base) | 领域/任务模型 |
| 谁来做 | 大厂 / 研究机构 | 个人 / 中小企业也能做 |
本质仍是神经网络训练那套老循环,只是规模大到极致。整个流程可以拆成六步:
来源包括网页(Common Crawl)、书籍、维基、代码仓库(GitHub)、论文等。关键是去重、去毒、去隐私,再混合成万亿 token 的语料。数据质量直接决定模型上限。
模型"看不懂"汉字或字母,只能处理数字。先用 BPE / WordPiece 等算法把文本切成词片(Token),再映射成 ID 喂进网络。中文通常 1–2 字一个 Token,英文一个词约 1–3 个 Token。
切好的 Token 序列送进 Transformer(一堆堆叠的注意力层)。模型根据前面所有词,输出"下一个词"的概率分布,取最可能那个。
算出损失后,反向传播求梯度,Adam / AdamW 优化器据此更新全部参数 θ。这一步在数千张 GPU 上并行,对海量数据反复多轮(epoch),直到模型"续写"能力收敛。
预训练之所以"天价",卡在三个要素;而规模的量变,会换来能力的质变。
当模型与数据规模跨过某道门槛,会突然"冒出"小模型完全没有的能力:少样本学习、链式推理、代码生成、跨语言迁移……这就是"大力出奇迹"。
预训练只产出"基座模型"。要让它真正好用,后面还要接 SFT 和 RL。三阶段合起来,才是今天你用的对话大模型。
预训练 = 在海量无标注文本上,用"预测下一个词"的自监督任务,从零练出一个通用基座模型。 它解决的是"模型从哪来"——先把语言规律和世界知识"装进"数百亿参数里, 产物叫 Base Model。它和微调是上下游关系: 预训练造"通才"(贵、海量、无标注),微调把通才调成"专家"(便宜、小批、有标注), 之后通常还要接 SFT + RL 才能变成好用的对话模型。 一句话:预训练是地基,微调是装修,RL 是软装——少了哪块,房子都不算真正能住。