大模型训练 · 可视化讲解

大模型的强化学习
RL 到底是什么

预训练让模型"学会说话",监督微调让模型"照葫芦画瓢", 而强化学习(RL)才是让模型"学会什么是好答案"的那一步。 下面从定义、在训练流程中的位置、核心原理到作用,配图讲透。

第 1 步 · 定义

什么是强化学习(RL)?

一句话:智能体在环境里不断"试错",根据获得的"奖励"调整自己的行为,目标是让长期拿到的奖励总和最大。

经典 RL(如打游戏)
智能体 = 玩家;环境 = 游戏画面;动作 = 按键;奖励 = 得分。每一步都有即时反馈,靠大量试错练出策略。
大模型里的 RL(RLHF)
智能体 = 语言模型;环境 = 人类的偏好判断;动作 = 生成下一个词;奖励 = "这个答案好不好"(由奖励模型打分)。目标是生成人类更喜欢的回答。
经典 RL 循环 智能体 Agent 玩家 环境 Env 游戏画面 动作 a 新状态 s + 奖励 r 得分 r 大模型 RL 循环 语言模型 Policy 生成回答 奖励模型 RM 人类偏好 回答 y 奖励 r(偏好分) 偏好高分
图 1:左=经典 RL(即时环境反馈);右=大模型 RL(用"奖励模型"替代人类,给整段回答打分)
在大模型里,RL 最主流的形态叫 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。它的核心不是"背答案",而是用一个"老师"(奖励模型)告诉模型哪个回答更好
第 2 步 · 放到坐标系里

RL 站在大模型训练的哪一环?

一个现代对话大模型(如 ChatGPT)通常要过三道训练工序。RL 是最后、也最关键的"对齐"环节。

① 预训练 海量文本 · 自监督 · 学"语言与知识" ② 监督微调 SFT 示范数据 · 学会"按指令作答" ③ RL / RLHF 偏好反馈 · 学会"什么是好答案" 越往后:数据越少、目标越"主观"、越贴近人的喜好
图 2:三阶段训练流水线——预训练打基础,SFT 立规矩,RL 调品味

三道工序,各解决一个不同问题

工序学什么数据目标
预训练语言规律 + 世界知识TB 级无标注文本预测下一个词
SFT模仿人类的回答格式人工编写 (指令, 回答)照葫芦画瓢
RL / RLHF哪种回答"更好"人类偏好对比 (A 好 / B 差)最大化偏好奖励
SFT 让模型"会答",RL 让模型"答得好、答得让人舒服"。没有 RL,模型往往"答非所问"或"有用的废话";加上 RL,才能对齐到人类真实意图。
第 3 步 · 原理(重点)

RLHF 是怎么运作的:三步走

RLHF 不是一步到位,而是先造一个"打分老师"(奖励模型),再用强化学习去训练"答题学生"(语言模型)。

① 收集人类偏好,训练奖励模型(RM)

给同一问题让模型生成两个回答 A 和 B,让人标注"哪个更好",得到大量 (A 优于 B) 的对比。用这些对比训练一个奖励模型,它学会给任意回答打"好坏分"。

问题 + 回答A / 回答B 模型生成两版 人类标注偏好 A 比 B 更好 训练奖励模型 RM 学会给回答打 r RM 可打分 新回答 → r 分 例:问"怎么学微积分?" A:"先看极限,再学导数与积分…" → RM 打 +2.3 B:"微积分就是算面积吧" → RM 打 -0.8
图 3:奖励模型 = 把"人类偏好"压缩成一个可自动打分的神经网络

② 用 PPO 强化学习优化"答题学生"

把语言模型当作"策略",让它对问题生成回答,奖励模型给回答打分,再用 PPO(近端策略优化)算法朝"能拿高分"的方向更新模型权重。同时加一个 KL 惩罚:别为了刷分把模型改得"面目全非"、偏离原 SFT 模型太远。

目标:max E[ rRM(回答) ]   −   β · KL( 当前模型 ‖ 参考模型 )

前半句追求高奖励,后半句 β·KL 防止"跑偏/翻车"。这正是 RLHF 的稳定性秘诀。

③ 循环迭代,越练越"对齐"

① 模型生成回答 给定问题 ② RM 给奖励 r 打分反馈 ③ PPO 更新权重 + KL 约束 ④ 更好的 模型 反复迭代 → 回答越来越符合人类喜好
图 4:RLHF 闭环——生成、打分、更新、再生成,循环优化
第 4 步 · 进阶原理

RLHF 很贵?于是有了 DPO

传统 RLHF 要单独训练奖励模型 + 跑 PPO 强化学习,又贵又难调。2023 年提出的 DPO(直接偏好优化)做了一次"减法"。

RLHF(PPO 路线)
训练奖励模型 RM → 用 PPO 强化学习优化 → 需同时加载策略、参考、奖励、价值四个模型。算力大、易不稳定。
DPO(直接优化)
完全不要显式奖励模型,也不要 PPO。直接把"偏好对比"变成一个分类损失,像做监督学习一样训练。便宜、稳定、好复现。
RLHF(两步,重) 偏好数据 训练 RM RM 打分 PPO 优化 对齐模型 DPO(一步,轻) 偏好数据 chosen / rejected 对齐 直接 一个分类损失,像普通训练一样搞定,无需 RM / PPO
图 5:DPO 把"训练 RM + RL"压缩成一步直接优化,显著降低门槛
如今很多开源模型(如 Llama、Mistral 系列的对齐版)都走 DPO 路线。但 RLHF/PPO 在"奖励可精细设计"时仍有上限优势,二者并存。
第 5 步 · 为什么需要

RL 到底起了什么作用?

SFT 教模型"像人一样答",但模型不知道"答得好不好"。RL 把"好"定义成可优化的目标,带来几个关键收益:

① 对齐人类意图
让模型真正"理解你想要什么",而不是机械复述。有用性(Helpfulness)显著提升。
② 安全性 / 无害
通过"拒绝有害请求得分更高"的偏好,降低有毒、违法、危险内容(Harmlessness)。
③ 诚实 / 少幻觉
偏好"承认不知道"胜过"编造",让模型更愿意说"我不确定",间接抑制幻觉。
④ 风格与格式
偏好数据可以塑造语气、长度、结构,让回答更简洁、有条理、贴合场景。

⑤ 更近一步:用 RL 直接"练推理"

2024–2025 年出现新范式:不再只靠人工偏好,而是用"可验证的奖励"做 RL。例如数学题"答案对就给分"、代码"跑通测试就给分"。这催生了 DeepSeek-R1、OpenAI o1/o3 这类"会自己思考/反思"的推理模型——RL 让模型学会了"多想几步、自我检验"。

问题(数学/代码) 带可验证答案 模型生成"思考链" 多步推理过程 规则验证器 答案对/测试过? 奖励 ± 对=+ 错=− 把"答案正确性"当奖励 → 模型越练越会推理
图 6:可验证奖励的 RL(RLVR)——用"对错"代替"人类打分",专门强化推理能力
第 6 步 · 用在哪

典型应用与经典案例

凡是"光会答还不够,得答得让人满意 / 答得正确"的地方,RL 都大显身手。

💬 对话对齐
ChatGPT 用 RLHF 把"能聊天"变成"聊得贴心、安全"。
🧮 数学推理
DeepSeek-R1 / o1 用可验证奖励练出长思考、自我校验。
💻 代码生成
用"单元测试是否通过"作奖励,提升代码一次跑通率。
🛡️ 安全护栏
偏好"拒绝有害请求",降低越狱与有毒输出。
📝 摘要/写作
偏好"忠实、简洁、无编造",改善长文质量。
🎮 游戏/控制
经典 RL 主场:AlphaGo、机器人控制、资源调度。
传统对齐型 RL 推理增强型 RL(新) RLHF 对话 安全/无害偏好 RLVR 数学/代码 工具调用/Agent 奖励 奖励从"主观偏好" 走向"客观可验证"
图 7:RL 在大模型上的两条主线——对齐人类 vs 增强推理
⚠️ RL 不是万能药:① 奖励模型也会被"骗"(reward hacking,模型找到刷分漏洞却没真变好);② 偏好数据有偏见,会放大人类偏见;③ RL 成本高、易不稳定。所以工程上常 SFT + RL 配合,并用 KL 约束兜底。
收尾 · 一句话带走

所以,大模型的 RL 到底是什么

大模型的 RL(主要是 RLHF)= 用"奖励信号"替代标准答案来训练语言模型: 先由人类偏好训练一个奖励模型当"老师",再用 PPO(或更新的 DPO)让模型生成"老师更喜欢"的回答, 并靠 KL 约束防止跑偏。它的作用是对齐——让模型更有用、更安全、更诚实、更会推理。 近年更进一步:用"答案对错"等可验证奖励直接练推理,诞生了 DeepSeek-R1、o1 这类思考型模型。 一句话:预训练教"知识",SFT 教"格式",RL 教"品味与对错"