大模型 LLM · 科普图解
大模型的前世今生
从 1990 年代靠"数词频"的统计语言模型,到 2022 年引爆全球的 ChatGPT,再到今天会推理、能看图、跑在手机上的智能体——一张时间轴 + 多张图解,把大模型的来龙去脉讲清楚。
01引子:什么是大模型
大模型(Large Language Model, LLM)是一类用海量文本训练出来的、参数规模以"十亿(B)"为单位的神经网络。给它一句话,它能"续写"出接下来最合理的文字——聊天、写代码、翻译、总结,本质上都是"预测下一个词"。
🧠超大参数
从亿级到万亿级参数(GPT-3 约 1750 亿),容量越大越能记住/泛化复杂模式。
📚海量数据
在几乎"整个互联网"规模的语料上预训练,习得语言、知识、逻辑。
🚀涌现能力
规模跨过阈值后,突然"解锁"翻译、推理、编程等小模型做不到的能力。
为什么 2022 突然火了?不是技术一夜突破,而是积累到位:Transformer(2017)+ 规模定律(Scaling Law)+ RLHF 对齐(2022)三股力量汇合,最终由 ChatGPT(2022.11.30)把"能对话、像人"的体验推到大众面前,5 天用户破百万,两月破亿。
02前世:大模型进化时间轴
把视角拉长到 30 年,大模型不是凭空出现,而是沿着"更好的表示 → 更长的依赖 → 更大的规模 → 更好的对齐"一步步走来的。
统计语言模型 1990s–2000s
用 n-gram(n 个词同现频率)预测下一个词,靠"平滑"处理未见组合。简单但数据稀疏、记不住长依赖。
神经语言模型 NNLM 2003
Bengio 等人首用神经网络建模语言,把词映射成稠密向量,开启"表示学习"时代。
Word2Vec 2013
Mikolov(Google)提出"词向量":"国王 − 男人 + 女人 ≈ 女王",证明语义可计算。
Seq2Seq + Attention 2014
编码器-解码器登场,Bahdanau 引入注意力机制——翻译时"动态看源句",解决长句遗忘。
Transformer 2017 · 关键拐点
Google《Attention Is All You Need》彻底抛弃 RNN,纯注意力架构可并行训练、捕捉任意距离依赖——大模型的地基就此奠定。
GPT-1 / BERT 双雄 2018
OpenAI GPT-1(生成式、从左到右);Google BERT(双向编码、填空式)。"预训练 + 微调"范式确立。
GPT-2 2019
15 亿参数,展现零样本能力:不微调也能写新闻、续故事,惊艳也引发"被滥用"担忧。
GPT-3 2020 · 规模拐点
1750 亿参数,提出上下文学习(In-Context Learning):给几个例子就能学会新任务,无需改参数。
InstructGPT / RLHF 2022 · 对齐拐点
用人类反馈强化学习(RLHF)让模型"听话、有用、安全",而非只是续写。这是 ChatGPT 好用的真正秘密。
ChatGPT 引爆 2022.11.30
对话体验破圈,5 天破百万、2 月破亿用户,开启全民 AI 时代。
GPT-4 / 开源浪潮 2023
GPT-4(多模态、更强推理);Meta LLaMA 开源引爆社区,Mistral、Falcon 等跟进,国产大模型元年(文心、通义、智谱、DeepSeek)。
推理模型 o1 / DeepSeek-R1 2024–2025
OpenAI o1 引入"慢思考/思维链推理";DeepSeek-R1(2025.1)开源推理模型 + 极致性价比,再次引爆,标志模型进入"会思考"阶段。
读时间轴的姿势:三个"拐点"最重要——2017 Transformer(架构)、2020 GPT-3(规模)、2022 RLHF(对齐)。ChatGPT 只是这三件事的"成果发布会"。
03三大关键拐点(图解)
① Transformer:把"循环"换成"全局注意力"
旧架构 RNN 像"逐字读信",看到后面忘了前面,且无法并行。Transformer 让每个词一眼看到所有词,谁和谁相关就给多少注意力。
② 自注意力直观:Q / K / V 三剑客
每个词生成三个向量:Query(我要找什么)、Key(我是什么)、Value(我提供什么)。用 Q 和所有 K 算相似度得到"注意力权重",再按权重汇总 V。
Attention(Q,K,V) = softmax( Q·Kᵀ / √d ) · V
③ 三阶段训练:预训练 → SFT → RLHF
今天的大模型不是"一次性炼成",而是分三步,越往后越"像人"。
04今生:大模型怎么"思考"
剥开外壳,今天的大模型内核仍是"温柔的概率机器"——它不停地算"下一个词最可能是什么",只是规模大到涌现出了惊人的能力。
🔁自回归生成
一个词一个词往外吐,每生成一个词都把前文当作上下文再算一次。所以"胡说"会越滚越大——这叫幻觉。
🔡Token 化
文字先切成 Token(词/字/片段)再算。中英文 Token 数不同,计费与长度都按 Token 算。
📈Scaling Law
参数、数据、算力越大,Loss 越按幂律下降。规模本身就是能力来源之一。
✨涌现能力
规模跨过某阈值,突然具备小模型没有的推理/翻译/编程能力,难以线性外推。
规模定律(Scaling Law)直觉图
在双对数坐标下,模型越大、数据越多、算得越多,错误率(Loss)越按直线下降——这是"大力出奇迹"的数学依据。
重要常识:大模型没有真正的记忆、也没有意识。每次对话都是从空白开始,所谓"记忆"靠外部注入上下文(见本仓库 memory 系列)。它只是在"以极高概率续写看似合理的文本"。
05模型家族对比
不同路线解决不同问题:Encoder 擅长"理解",Decoder 擅长"生成",Encoder-Decoder 擅长"转换"。
| 架构 | 代表 | 擅长 | 典型用途 |
| Encoder(编码) | BERT、RoBERTa | 理解、分类、抽取 | 情感分析、搜索引擎、NER |
| Decoder(解码/生成) | GPT 系列、LLaMA、Qwen | 生成、对话、推理 | ChatGPT、写作、编程、Agent |
| Encoder-Decoder | T5、BART | 序列转换 | 翻译、摘要、改写 |
主流大模型速览
OpenAI🟢GPT-4 / o 系列
能力标杆,多模态 + 推理(o1/o3),闭源商用为主。
Meta🔵LLaMA 系列
开源生态基石,催生海量社区模型(Mistral 等)。
Google🟡Gemini
原生多模态,超长上下文(百万 token 级)。
Anthropic🟠Claude
长文本、强对齐、Agent 友好,工程口碑好。
中国🇨🇳DeepSeek / Qwen
DeepSeek 以低成本+开源推理出圈;通义千问全尺寸开源。
中国🇨🇳文心 / 智谱 / 豆包
头部厂商大模型,深耕中文与行业场景。
怎么选:要最强通用能力且预算足 → GPT/Claude;要私有化/可控成本 → LLaMA / Qwen / DeepSeek 开源系;要超长文档/多模态 → Gemini。国产化合规场景优先国内模型。
06训练流水线:从数据到上线
- 数据清洗:去重、去隐私、去低质,数据质量 >> 数据数量(垃圾进垃圾出)。
- 预训练:最烧钱一步,在数万亿 token 上自监督续写,学"通识"。
- SFT(监督微调):用高质量"指令—回答"教它按人类方式作答。
- RLHF / RLAIF:用偏好反馈(人或 AI 标注)进一步对齐价值观与安全边界。
- 评测与红队:跑基准 + 对抗测试,发现漏洞与偏见。
- 部署推理:量化、蒸馏、KV Cache 优化,让模型跑得快、跑得便宜(含端侧)。
07现状与挑战
幻觉(Hallucination):一本正经地编造事实/引用。缓解靠检索增强(RAG)、引用溯源、置信度校准。
成本与能耗:训练/推理都贵,推动量化、MoE 稀疏、端侧小模型。
安全与对齐:越狱、偏见、滥用(深度伪造、钓鱼)。需红队 + 护栏 + 法规。
可控与可解释:"黑箱"难审计,关键场景要求决策可追溯。
知识时效:训练截止后不懂新事,靠联网/知识库外挂补。
长上下文 & 记忆:窗口有限、跨会话无状态,需外部记忆机制。
08未来趋势
🤖Agent 化
从"问答"到"干活":自动规划、调用工具、操作软件,成为数字员工。
🧩多模态
文本/图像/音频/视频统一理解生成,世界模型初现。
🧠慢思考推理
o1 / R1 式"先想后答",数学、代码、科学推理持续突破。
📱端侧/小模型
手机本地跑模型,隐私好、零延迟、低成本普及。
🌐开源平权
LLaMA / Qwen / DeepSeek 拉平能力差距,人人可定制。
🔗具身智能
大模型接管机器人/自动驾驶的"大脑",连接物理世界。
一句话展望:大模型正从"会聊天的文本生成器"演进为"能感知、会推理、可行动、连世界"的智能底座。前世是算法与数据的积累,今生是工程与对齐的成熟,未来是属于 Agent 与多模态的。
09一张图总结
前世(架构+数据+规模+对齐)铸就了今生(LLM 能力),而能力正流向千行百业的应用。