大模型的"思考"到底是什么?

为什么有的模型会"先想后答",有的"脱口而出"?既然底层都是同一个大模型,开不开"思考"开关,对模型来说实现的原理究竟有什么不同?本文用图解把这件事拆开讲清楚。

Chain-of-Thought RLVR 强化学习 Test-time Compute 推理模型 vs 通用模型 System 1 / System 2

1. 什么是大模型的"思考"能力

先说结论:大模型的"思考",本质上就是在给出最终答案之前,先生成一段"推理过程"。这段过程可能是可见的(如 DeepSeek-R1 的 <think>…</think> 块),也可能是隐藏的(如 OpenAI o 系列的"内部思维链")。无论可见与否,它的作用都是一样的——让模型把难题拆成多步,逐步逼近正确答案。

这恰好对应认知科学里 Kahneman 提出的双系统理论:人类既有"快思考"(直觉、自动、不费力),也有"慢思考"(逻辑、逐步、耗能)。大模型的开/关思考,映射的就是这两种模式。

System 1 · 快思考(不开思考) • 直觉式、自动触发 • 直接输出答案 • 快、省 token、但易错 典型:日常问答、补全、 简单分类、闲聊 问题 → 答案 System 2 · 慢思考(开思考) • deliberate、逐步推导 • 先生成推理链再作答 • 慢、耗 token、但更准 典型:数学、代码、逻辑、 多步规划、复杂分析 问题 → 思考 → 答案
图 1 · 大模型的"开/不开思考" ≈ 人类双系统:快思考 vs 慢思考
关键认知:"思考"不是模型多装了一个推理引擎,而是同一个 next-token 预测器,被训练/引导去"多走几步再下结论"。

2. 开思考 vs 不开思考,差别在哪

同一个问题,两种模式下的输出结构完全不同。下面用一道简单数学题示意。

不开思考 直接作答

问题:一箱苹果 12 个,3 箱加半箱是多少个?

42 个。

模型直接吐出结论,没有中间步骤。跳步容易算错(这里正确值其实是 42,但稍复杂的题就会翻车)。

开思考 先想后答

问题:同上

<think>
3 箱 = 12×3 = 36
半箱 = 12÷2 = 6
合计 = 36 + 6 = 42
</think>
42 个。

模型先生成完整推理链,每步都可被校验,最终答案更可靠。

不开思考:一条短路径 用户输入 模型直接生成 最终答案 token 答案输出 开思考:多一段"思维链" 用户输入 生成 推理链 token (多步拆解 / 自检 / 回溯) 答案输出
图 2 · 不开思考 = 直达答案;开思考 = 在答案前插入一段"思考 token"

什么时候该开 / 该关

场景建议原因
数学 / 代码 / 逻辑推理多步推导,思维链显著提升正确率
长文本摘要 / 翻译 / 抽取无需推导,开思考只会拖慢、加成本
实时对话 / 闲聊 / 补全要低延迟,思考会显得"卡顿"
复杂规划 / 决策分析需要权衡多选项、逐步推演
海量并发、成本敏感看情况思考 token 数倍于答案,需权衡性价比

3. 不都是大模型吗?架构有区别吗

这是最常见、也最关键的误解。答案是:推理模型和普通聊天模型,底层架构几乎一模一样,都是 Transformer 解码器(Decoder-only)。它们没有多装一个"推理芯片"或"逻辑模块"。

核心观点:差异不发生在架构层,而发生在训练层。推理能力是"训"出来的,不是"搭"出来的。一个 1.5B 的小模型经过推理训练,也能表现出思考行为;一个大模型如果没训过,照样不会一步步推理。
共享底座:Transformer 解码器 next-token prediction · 自回归生成 普通聊天模型 训练数据:通用语料 + 指令 目标:直接对齐人类回答 RLHF:偏好奖励(主观) 行为:问题 → 答案 代表:GPT-4o / 多数通用模型 推理模型 训练数据:+ 大量"带推理过程"样本 目标:学会先推理再作答 RLVR:可验证奖励(客观) 行为:问题 → 思考 → 答案 代表:o1/o3 · R1 · QwQ · Qwen3
图 3 · 架构相同,训练数据与训练目标不同 → 行为不同
🏗️

架构:相同

都是 Decoder-only Transformer。推理模型并没换个新结构。

📚

数据:不同

推理模型额外用海量"长思维链 + 可验证答案"的样本训练。

🎯

目标:不同

普通模型对齐"好回答";推理模型对齐"好过程→好答案"。

4. 思考到底是怎么"实现"的(原理拆解)

把"思考"拆到底层,其实是三件事叠加:能力涌现 → 训练固化 → 推理时展开。下面逐层讲。

4.1 思维链(CoT)是"涌现"出来的

2022 年 Google 的论文《Chain-of-Thought Prompting》发现:只要在两步之间提示模型"一步步思考",大模型在数学/常识推理上的准确率就会大幅跳升。说明"分步推理"的能力,本来就藏在模型参数里,只是需要被"激活"。这就是思维链(Chain-of-Thought, CoT)。

4.2 思考不是"多了一个模块",而是"多了一些 token"

从自回归生成的视角看,模型永远只做一件事:根据已有 token,预测下一个 token。"思考"只是让模型在"用户问题"和"最终答案"之间,先预测出一大串中间推理 token。这些 token 走的是和答案 token 完全相同的通路——没有特殊硬件、没有独立引擎。

[system] [用户问题] <think> 步骤1… 步骤2… 自检… 回溯… </think> [最终答案]

紫色部分 = 思考 token,它们和答案 token 共用同一套生成机制

4.3 特殊分隔符 token 在训练中被"固化"

像 DeepSeek-R1 的 <think>…</think>、Qwen 的 enable_thinking 这类机制,本质是训练时让模型学会:遇到需要推理的任务,就先输出一对特殊标记,把推理过程"包"起来。开关的作用,是通过系统提示或采样参数,告诉模型本次是否要输出这段包裹内容

所以"开/关思考"对模型意味着:同一个权重,在不同提示/标志下表现出两种输出模式。关掉思考 ≠ 模型失去推理能力,只是被引导跳过思维链、直接作答。

4.4 真·"思考"还会自检与回溯

高级推理模型生成的思维链,不只是线性罗列步骤,还会:尝试多条路径发现矛盾后回溯对自己做验证。这正是它比"提示一下 CoT"更稳的原因——这些策略是在强化学习里被奖励出来的。

思维链的内部展开:分支 · 自检 · 回溯 问题 路径A 路径B 自检 回溯(发现B走不通) 结论
图 4 · 思考不是直线,而是带分支与回溯的探索过程

5. 训练阶段:模型是怎么"学会思考"的

推理模型的关键在训练,核心是RLVR(Reinforcement Learning with Verifiable Rewards,带可验证奖励的强化学习)。以 DeepSeek-R1 为例,流程如下:

问题+标准答案 (数学/代码) 模型生成推理+答案 (含思维链) 可验证校验 答案对?过程对? 奖励信号(+正确 / −错误) 更新权重 GRPO/PPO
图 5 · RLVR 训练循环:用"答案是否正确"作为客观奖励,逼模型学会走对推理路径

可验证奖励(Verifiable)

数学题能对/错、代码能运行/报错——奖励来自"客观校验",不靠人打分,所以可大规模自动化。

🔄

策略优化(GRPO/PPO)

同一题采样多条推理路径,对的打高分、错的打低分,逐步把模型推向"更爱走正确推理"的方向。

🪞

蒸馏(Distillation)

用大模型生成的思维链去教小模型,于是 1.5B 小模型也能"学会思考",证明能力来自训练。

📐

SFT 冷启动

先用少量高质量长思维链样本做监督微调,给强化学习一个"会思考"的好起点。

澄清一个误区:普通模型的 RLHF 用的是"人类偏好"奖励(主观、难验证);推理模型用的是"答案对错"奖励(客观、可验证)。这是两者训练目标最本质的分野。

6. 推理阶段:思考的"开销"从哪来

开思考后,模型在同一个生成循环里多跑了很多步。这一步步的"思考 token"要逐个预测,因此:延迟变长、token 消耗变多、算力变贵——但准确率通常更高。这被称为 Test-time Compute(推理时计算 / 测试时算力):把更多算力花在"想"上,而不是"堆参数"。

同样的模型,思考 = 更多推理时 token 生成步数(token 数) → 答案 思考 答案 思考 token 显著增加
图 6 · 开思考 ≈ 在推理时投入更多计算(Test-time Compute)
维度不开思考开思考
生成 token 数少(仅答案)多(思维链 + 答案)
首字延迟高(要先想完)
成本高(token 计费翻倍起)
复杂题准确率较低较高
可控性直接给答案可调"思考深度/budget"

7. 成本与权衡:思考不是越多越好

思考能提升准确率,但存在边际递减与"过度思考":简单题硬要长篇推理,既浪费又可能绕晕自己。因此实际系统中常见这些设计:

🎚️

思考预算(Budget)

限制最大思考 token 数,或设 reasoning effort(低/中/高)档位,控制开销。

🧭

路由(Router)

小模型先判断难度:简单题直答,难题才交给推理模型,兼顾成本与质量。

⚖️

抽样投票

同一题多次采样多条思维链,投票取多数(self-consistency),进一步提升稳定性。

经验法则:能直接答对的,别开思考;会算错、要推演的,开。把"思考"当成一种按需付费的算力,而不是默认全开。

8. 一句话心智模型

🧩 大模型永远只是"下一个 token 预测器"。
"思考"不是换了个模型,而是同一个模型被训练成"先吐一串推理 token 再给答案"
开/关思考 = 同一权重下,被提示引导走 / 不走那段思维链;
推理模型与普通模型的真差异,发生在训练(数据 + RLVR 目标),而非架构。