大模型 LLM · 科普图解

大模型的前世今生

从 1990 年代靠"数词频"的统计语言模型,到 2022 年引爆全球的 ChatGPT,再到今天会推理、能看图、跑在手机上的智能体——一张时间轴 + 多张图解,把大模型的来龙去脉讲清楚。

01引子:什么是大模型

大模型(Large Language Model, LLM)是一类用海量文本训练出来的、参数规模以"十亿(B)"为单位的神经网络。给它一句话,它能"续写"出接下来最合理的文字——聊天、写代码、翻译、总结,本质上都是"预测下一个词"。

🧠超大参数

从亿级到万亿级参数(GPT-3 约 1750 亿),容量越大越能记住/泛化复杂模式。

📚海量数据

在几乎"整个互联网"规模的语料上预训练,习得语言、知识、逻辑。

🚀涌现能力

规模跨过阈值后,突然"解锁"翻译、推理、编程等小模型做不到的能力。

为什么 2022 突然火了?不是技术一夜突破,而是积累到位:Transformer(2017)+ 规模定律(Scaling Law)+ RLHF 对齐(2022)三股力量汇合,最终由 ChatGPT(2022.11.30)把"能对话、像人"的体验推到大众面前,5 天用户破百万,两月破亿。
统计语言模型数词频 · n-gram 神经网络词向量 · 序列 Transformer注意力 · 2017 大模型 + 对齐预训练·RLHF·Chat 范式迁移:从"规则/统计"到"数据驱动的自监督学习" 一句话:让模型自己从文本里"学语言规律",而不是人类手把手写规则

02前世:大模型进化时间轴

把视角拉长到 30 年,大模型不是凭空出现,而是沿着"更好的表示 → 更长的依赖 → 更大的规模 → 更好的对齐"一步步走来的。

统计语言模型 1990s–2000s
n-gram(n 个词同现频率)预测下一个词,靠"平滑"处理未见组合。简单但数据稀疏、记不住长依赖。
神经语言模型 NNLM 2003
Bengio 等人首用神经网络建模语言,把词映射成稠密向量,开启"表示学习"时代。
Word2Vec 2013
Mikolov(Google)提出"词向量":"国王 − 男人 + 女人 ≈ 女王",证明语义可计算。
Seq2Seq + Attention 2014
编码器-解码器登场,Bahdanau 引入注意力机制——翻译时"动态看源句",解决长句遗忘。
Transformer 2017 · 关键拐点
Google《Attention Is All You Need》彻底抛弃 RNN,纯注意力架构可并行训练、捕捉任意距离依赖——大模型的地基就此奠定。
GPT-1 / BERT 双雄 2018
OpenAI GPT-1(生成式、从左到右);Google BERT(双向编码、填空式)。"预训练 + 微调"范式确立。
GPT-2 2019
15 亿参数,展现零样本能力:不微调也能写新闻、续故事,惊艳也引发"被滥用"担忧。
GPT-3 2020 · 规模拐点
1750 亿参数,提出上下文学习(In-Context Learning):给几个例子就能学会新任务,无需改参数。
InstructGPT / RLHF 2022 · 对齐拐点
用人类反馈强化学习(RLHF)让模型"听话、有用、安全",而非只是续写。这是 ChatGPT 好用的真正秘密。
ChatGPT 引爆 2022.11.30
对话体验破圈,5 天破百万、2 月破亿用户,开启全民 AI 时代。
GPT-4 / 开源浪潮 2023
GPT-4(多模态、更强推理);Meta LLaMA 开源引爆社区,Mistral、Falcon 等跟进,国产大模型元年(文心、通义、智谱、DeepSeek)。
推理模型 o1 / DeepSeek-R1 2024–2025
OpenAI o1 引入"慢思考/思维链推理";DeepSeek-R1(2025.1)开源推理模型 + 极致性价比,再次引爆,标志模型进入"会思考"阶段。
读时间轴的姿势:三个"拐点"最重要——2017 Transformer(架构)2020 GPT-3(规模)2022 RLHF(对齐)。ChatGPT 只是这三件事的"成果发布会"。

03三大关键拐点(图解)

① Transformer:把"循环"换成"全局注意力"

旧架构 RNN 像"逐字读信",看到后面忘了前面,且无法并行。Transformer 让每个词一眼看到所有词,谁和谁相关就给多少注意力。

RNN(串行·易遗忘) x₁ x₂ x₃ x₄ 必须按顺序走,越往后越难记住 x₁ Transformer(全局·可并行) x₁ x₂ x₃ x₄ 每个词直接关注所有词,距离不再是障碍 多头自注意力 = 从多个角度同时看"谁和谁相关" 位置编码补上"词序"信息,GPU 可大规模并行训练

② 自注意力直观:Q / K / V 三剑客

每个词生成三个向量:Query(我要找什么)Key(我是什么)Value(我提供什么)。用 Q 和所有 K 算相似度得到"注意力权重",再按权重汇总 V。

Attention(Q,K,V) = softmax( Q·Kᵀ / √d ) · V
输入句子 Q 查询 K 键 V 值 注意力权重 加权输出 Q·K 算相关度 → softmax 归一化 → 乘 V 汇总信息

③ 三阶段训练:预训练 → SFT → RLHF

今天的大模型不是"一次性炼成",而是分三步,越往后越"像人"。

① 预训练 Pre-train海量文本 · 学语言/知识 ② 指令微调 SFT问答对 · 学"按指令做" ③ 人类对齐 RLHF人类偏好 · 学"有用/安全" 成本递减:预训练烧钱最多(千卡×月),RLHF 数据贵但量小

04今生:大模型怎么"思考"

剥开外壳,今天的大模型内核仍是"温柔的概率机器"——它不停地算"下一个词最可能是什么",只是规模大到涌现出了惊人的能力。

🔁自回归生成

一个词一个词往外吐,每生成一个词都把前文当作上下文再算一次。所以"胡说"会越滚越大——这叫幻觉

🔡Token 化

文字先切成 Token(词/字/片段)再算。中英文 Token 数不同,计费与长度都按 Token 算

📈Scaling Law

参数、数据、算力越大,Loss 越按幂律下降。规模本身就是能力来源之一。

涌现能力

规模跨过某阈值,突然具备小模型没有的推理/翻译/编程能力,难以线性外推。

规模定律(Scaling Law)直觉图

在双对数坐标下,模型越大、数据越多、算得越多,错误率(Loss)越按直线下降——这是"大力出奇迹"的数学依据。

规模(参数 / 数据 / 算力,对数) Loss(对数) 小模型 大模型:错误更低
重要常识:大模型没有真正的记忆、也没有意识。每次对话都是从空白开始,所谓"记忆"靠外部注入上下文(见本仓库 memory 系列)。它只是在"以极高概率续写看似合理的文本"。

05模型家族对比

不同路线解决不同问题:Encoder 擅长"理解",Decoder 擅长"生成",Encoder-Decoder 擅长"转换"。

架构代表擅长典型用途
Encoder(编码)BERT、RoBERTa理解、分类、抽取情感分析、搜索引擎、NER
Decoder(解码/生成)GPT 系列、LLaMA、Qwen生成、对话、推理ChatGPT、写作、编程、Agent
Encoder-DecoderT5、BART序列转换翻译、摘要、改写

主流大模型速览

OpenAI

🟢GPT-4 / o 系列

能力标杆,多模态 + 推理(o1/o3),闭源商用为主。

Meta

🔵LLaMA 系列

开源生态基石,催生海量社区模型(Mistral 等)。

Google

🟡Gemini

原生多模态,超长上下文(百万 token 级)。

Anthropic

🟠Claude

长文本、强对齐、Agent 友好,工程口碑好。

中国

🇨🇳DeepSeek / Qwen

DeepSeek 以低成本+开源推理出圈;通义千问全尺寸开源。

中国

🇨🇳文心 / 智谱 / 豆包

头部厂商大模型,深耕中文与行业场景。

怎么选:要最强通用能力且预算足 → GPT/Claude;要私有化/可控成本 → LLaMA / Qwen / DeepSeek 开源系;要超长文档/多模态 → Gemini。国产化合规场景优先国内模型。

06训练流水线:从数据到上线

数据清洗去重·过滤 预训练千卡×月 SFT指令对齐 RLHF偏好对齐 评测红队·基准 部署推理API·端侧
  • 数据清洗:去重、去隐私、去低质,数据质量 >> 数据数量(垃圾进垃圾出)。
  • 预训练:最烧钱一步,在数万亿 token 上自监督续写,学"通识"。
  • SFT(监督微调):用高质量"指令—回答"教它按人类方式作答。
  • RLHF / RLAIF:用偏好反馈(人或 AI 标注)进一步对齐价值观与安全边界。
  • 评测与红队:跑基准 + 对抗测试,发现漏洞与偏见。
  • 部署推理:量化、蒸馏、KV Cache 优化,让模型跑得快、跑得便宜(含端侧)。

07现状与挑战

幻觉(Hallucination):一本正经地编造事实/引用。缓解靠检索增强(RAG)、引用溯源、置信度校准。
成本与能耗:训练/推理都贵,推动量化、MoE 稀疏、端侧小模型。
安全与对齐:越狱、偏见、滥用(深度伪造、钓鱼)。需红队 + 护栏 + 法规。
可控与可解释:"黑箱"难审计,关键场景要求决策可追溯。
知识时效:训练截止后不懂新事,靠联网/知识库外挂补。
长上下文 & 记忆:窗口有限、跨会话无状态,需外部记忆机制。

08未来趋势

🤖Agent 化

从"问答"到"干活":自动规划、调用工具、操作软件,成为数字员工。

🧩多模态

文本/图像/音频/视频统一理解生成,世界模型初现。

🧠慢思考推理

o1 / R1 式"先想后答",数学、代码、科学推理持续突破。

📱端侧/小模型

手机本地跑模型,隐私好、零延迟、低成本普及。

🌐开源平权

LLaMA / Qwen / DeepSeek 拉平能力差距,人人可定制。

🔗具身智能

大模型接管机器人/自动驾驶的"大脑",连接物理世界。

一句话展望:大模型正从"会聊天的文本生成器"演进为"能感知、会推理、可行动、连世界"的智能底座。前世是算法与数据的积累,今生是工程与对齐的成熟,未来是属于 Agent 与多模态的。

09一张图总结

Transformer 架构(2017) 海量数据 巨大规模 (Scaling) 人类对齐 (RLHF) 大模型 LLM:生成 · 推理 · 多模态 对话助手 智能体 Agent 编程/科研 多模态创作

前世(架构+数据+规模+对齐)铸就了今生(LLM 能力),而能力正流向千行百业的应用