预训练让模型"学会说话",监督微调让模型"照葫芦画瓢", 而强化学习(RL)才是让模型"学会什么是好答案"的那一步。 下面从定义、在训练流程中的位置、核心原理到作用,配图讲透。
一句话:智能体在环境里不断"试错",根据获得的"奖励"调整自己的行为,目标是让长期拿到的奖励总和最大。
一个现代对话大模型(如 ChatGPT)通常要过三道训练工序。RL 是最后、也最关键的"对齐"环节。
| 工序 | 学什么 | 数据 | 目标 |
|---|---|---|---|
| 预训练 | 语言规律 + 世界知识 | TB 级无标注文本 | 预测下一个词 |
| SFT | 模仿人类的回答格式 | 人工编写 (指令, 回答) | 照葫芦画瓢 |
| RL / RLHF | 哪种回答"更好" | 人类偏好对比 (A 好 / B 差) | 最大化偏好奖励 |
RLHF 不是一步到位,而是先造一个"打分老师"(奖励模型),再用强化学习去训练"答题学生"(语言模型)。
给同一问题让模型生成两个回答 A 和 B,让人标注"哪个更好",得到大量 (A 优于 B) 的对比。用这些对比训练一个奖励模型,它学会给任意回答打"好坏分"。
把语言模型当作"策略",让它对问题生成回答,奖励模型给回答打分,再用 PPO(近端策略优化)算法朝"能拿高分"的方向更新模型权重。同时加一个 KL 惩罚:别为了刷分把模型改得"面目全非"、偏离原 SFT 模型太远。
前半句追求高奖励,后半句 β·KL 防止"跑偏/翻车"。这正是 RLHF 的稳定性秘诀。
传统 RLHF 要单独训练奖励模型 + 跑 PPO 强化学习,又贵又难调。2023 年提出的 DPO(直接偏好优化)做了一次"减法"。
SFT 教模型"像人一样答",但模型不知道"答得好不好"。RL 把"好"定义成可优化的目标,带来几个关键收益:
2024–2025 年出现新范式:不再只靠人工偏好,而是用"可验证的奖励"做 RL。例如数学题"答案对就给分"、代码"跑通测试就给分"。这催生了 DeepSeek-R1、OpenAI o1/o3 这类"会自己思考/反思"的推理模型——RL 让模型学会了"多想几步、自我检验"。
凡是"光会答还不够,得答得让人满意 / 答得正确"的地方,RL 都大显身手。
大模型的 RL(主要是 RLHF)= 用"奖励信号"替代标准答案来训练语言模型: 先由人类偏好训练一个奖励模型当"老师",再用 PPO(或更新的 DPO)让模型生成"老师更喜欢"的回答, 并靠 KL 约束防止跑偏。它的作用是对齐——让模型更有用、更安全、更诚实、更会推理。 近年更进一步:用"答案对错"等可验证奖励直接练推理,诞生了 DeepSeek-R1、o1 这类思考型模型。 一句话:预训练教"知识",SFT 教"格式",RL 教"品味与对错"。