范式对照 · 用我自己的话讲清楚

大模型(LLM)
和传统 NLP 工程,
到底差在哪?

不是"谁更强"的问题,而是做事的方式整个变了:从"一任务一模型、手工搭流水线",变成"一个模型、靠说话下指令"。下面从原理、架构、工程到落地,一层层拆开。

判别式 → 生成式 流水线 → 单模型 监督标注 → 预训练 + 涌现 特征工程 → Prompt / RAG / Agent
先记住这条主线

传统 NLP 在"教模型做某件事",
LLM 在"听懂人话去办事"

① 任务组织
传统:每个任务单独建一条流水线、单独标注、单独训模型。LLM:所有任务共用一个模型,换句话(Prompt)就行。
② 输出范式
传统:判别式,输出标签 / 概率 / 结构化字段。LLM:生成式,直接吐出一段连贯文本。
③ 能力来源
传统:能力上限被人工标注数据锁死。LLM:靠海量无标注语料预训练,规模到了会"涌现"出没教过的能力。

一句话记忆:大模型不是把 NLP 做得更好,而是把"怎么定义一个 NLP 任务"这件事本身重写了。过去你要先拆任务、找数据、训模型;现在你用中文把需求说清楚,它就去执行。

先看旧世界

一、传统 NLP 工程长什么样

传统做法的核心是流水线(pipeline):一个完整任务被切成一串顺序步骤,每一步用一个专门的小模型或规则模块处理,上一步的输出喂给下一步。

原始文本 分词 词性标注 实体识别 句法分析 任务模型 标签 错误逐级传导:前面一步错,后面全错
图 1:传统 NLP 的串联流水线。每个色块都是一道独立的工序,有自己的模型、数据和标注。

三个时代的小结

① 规则 / 词典时代
正则、关键词、句法规则。可解释、可控,但覆盖率低、换领域要重写。
② 特征工程时代
TF-IDF、词袋、n-gram 做表示,SVM / 最大熵 / CRF 做分类。瓶颈在"人怎么把文本变成机器能吃的数字"。
③ 深度学习时代
TextCNN、RNN/LSTM、BiLSTM+CRF、Seq2Seq。表示由模型自己学,但仍是一个任务一套网络、一份标注。

四类核心痛点

1. 错误累积传导

分词错了 → 词性标错 → 实体识别错 → 意图分错。级联失败,且越往后越难定位是哪一步出的问题。

2. 迁移成本极高

从电商客服换到医疗问诊,实体类型、意图体系、知识库全变了,几乎等于重新养一支模型团队、重新标数据。

3. 任务各自为政

分类、抽取、翻译、摘要各是各的模型,没法互相借力;"一个系统能干所有事"在传统范式里不成立。

4. 理解 / 生成是两套

判别式模型只能打标签,要生成文本得另搭生成模型,分析与生成被割裂在两个系统里。

典型工具链:分词用 jieba / HanLP、英文用 spaCy / NLTK;分类用 scikit-learn;序列标注用 CRF++ 或 BiLSTM+CRF;训练用 TensorFlow / PyTorch。每一个环节都要人盯。
过渡态

二、BERT:半只脚迈进新时代

2018 年 BERT 带来的最大变化是"预训练 + 微调"两阶段:先在海量无标注文本上把"通用语言能力"学成一个 backbone,下游任务只在这个 backbone 上接一个小任务头、用少量标注微调。

预训练任务
MLM(随机遮词让模型猜)、NSP(判断两句是否相邻)。模型由此学到词义、句法、上下文关系。
下游微调
接分类头做情感分析、接序列标注头做 NER、接抽取头做问答。一份 backbone,多个轻量头。
但 BERT 只走了一半

它输出的是"表示"(向量),不是"文本"。要做分类得接分类头,做 NER 得接标注头,做问答得接抽取头——不同任务还是要不同的微调副本,理解和生成依然分离。

所以 BERT 解决了"特征通用",没解决"任务统一"。它把"每个任务从头训"降级成"每个任务微调一个头",但范式本质没变:仍然是"一任务一适配"。

新世界的核心

三、LLM 的本质:预测下一个 token

LLM 把所有 NLP 任务统一成一个目标:给定前面一段文本,预测"接下来最可能是什么字 / 什么 token"。这个目标叫 CLM(Causal Language Modeling,因果语言建模)。GPT、Claude、Qwen、DeepSeek 本质上都是"自回归 + 因果掩码"的语言模型。

输入上下文 "把下面的句子翻译成英文:我喜欢编程。" 生成中… "I like coding." 自回归:每生成一个 token,就把它拼回上下文,再预测下一个……循环到结束
图 2:自回归生成。模型不会"一次想好整句",而是一个字一个字往外续。

Prompt:统一的任务接口

因为所有任务都被压成了"续写文本",所以只要换一种说法,同一个模型就能切换工作模式。翻译、分类、抽取、写代码……对 LLM 来说都是"prompt + 续写"。

翻译 Prompt 分类 Prompt 抽取 Prompt 生成 / 代码 Prompt 同一个 LLM 自回归 · 预测下一个 token 连贯文本输出 翻译结果 / 标签 / JSON / 代码 … 不改动模型结构,只换 Prompt,一个模型处理所有任务
图 3:Prompt 是统一接口。任务差异从"不同的模型"收敛成"不同的提示词"。

顺带一个关键能力:上下文学习(In-Context Learning)

LLM 还能在不更新任何参数的情况下,仅靠 Prompt 里给的几条示例(few-shot)甚至零示例(zero-shot),就学会一个新任务的格式。这是传统模型做不到的——传统模型少样本基本就废了,LLM 能"现学现卖"。

示例:在 Prompt 里写"负面:这服务太差了。正面:物流很快。→ 这条『客服态度恶劣』是?",LLM 不用训练就能续出"负面"。这正是"任务定义权"交到自然语言手里的体现。
一张表记牢

四、六维核心区别对照

维度传统 NLP 工程LLM 大模型工程
任务组织一任务一流水线,模块串联一个模型,Prompt 切换任务
输出范式判别式:标签 / 概率 / 结构化字段生成式:连续自然语言文本
能力来源显式监督训练,喂什么学什么大规模预训练 + 涌现,学到没教过的
数据需求高度依赖人工标注,换任务重标预训练用互联网无标注文本;下游少量示例即可
迁移方式换领域基本重训整套 pipeline改 Prompt / 给 few-shot 即可迁移
错误特性错误逐级传导,难以事后修复端到端,可在生成中自我纠正(但仍可能幻觉)
工程重心标注、特征、选型、调参、F1 评测Prompt、RAG、上下文、微调、评测与护栏

注意:这不是"谁取代谁"的胜负表。传统方法的确定性、可解释、低延迟在大量场景依然不可替代(见第八节)。

落到干活

五、工程团队的活儿,完全变了

这不是"多了一个更强的模型",而是 NLP 项目的工作方式被重写。同样的"做一个智能客服 / 做一个文档抽取"需求,两种范式的拆解方式天差地别。

过去做 NLP 项目

  1. 需求 → 拆成哪些子任务(分类?抽取?匹配?)
  2. 每个子任务去哪找 / 标多少数据
  3. 选模型(SVM?BiLSTM?BERT 哪个变体?)
  4. 做特征 / 微调 / 调超参
  5. 用 F1、Accuracy、Precision/Recall 评测每个模块

核心技能:分词、句法、特征工程、模型调参、标注规范设计。

现在做 LLM 项目

  1. 需求 → 写成 Prompt / 系统提示词
  2. 知识不够?接 RAG 取外部资料
  3. 要稳定风格 / 领域能力?做 SFT / LoRA 微调
  4. 多步任务?编排 Agent(工具调用、规划)
  5. 用 LLM-as-Judge、人工抽检、线上 AB 评测

核心技能:Prompt 设计、RAG 系统、上下文管理、Agent 编排、对齐微调、护栏与评测。

工具栈对照

传统栈
jieba / spaCyscikit-learnCRF++TensorFlowsklearn / 自建评测
LLM 栈
LangChain / LlamaIndexvLLM / Ollama(推理)RAGAS / DeepEval(评测)OpenAI / 通义 / 文心(API)PEFT / Unsloth(微调)
一句话:传统工程在"和模型结构、特征、参数较劲";LLM 工程在"和数据、上下文、评测、成本较劲"。前者是算法活,后者更像产品 + 数据 + 系统工程活。
为什么这么简单却这么强

六、规模 + 数据:从量变到质变

"预测下一个字"目标这么朴素,为什么能学到推理、翻译、编程?关键在于两个杠杆一起放大:

数据杠杆
CLM 不需要人工标注,互联网上几乎所有文本都是训练语料。GPT-3 用约 3000 亿 token,Llama 3 用约 15 万亿 token。
模型杠杆
参数量从 BERT 的 3 亿,到 GPT-3 的 1750 亿,再到后来千亿 / 万亿级。容量越大,能塞进的参数化"知识"越多。
Loss ≈ f(参数 N, 数据 D, 算力 C) —— 三者同时放大,能力随规模平滑下降损失
任务能力 模型 / 数据规模(对数) 传统模型:靠标注,能力很快到天花板 涌现临界点:规模越过阈值后能力跳变 LLM:规模越大,能力持续解锁
图 4:传统模型能力被标注数据封顶;LLM 随规模上升,并在临界点"涌现"出新能力。
关于"涌现"的清醒认识

"涌现"指规模超过临界点后,模型突然表现出训练目标里没显式教过的能力(多步推理、跨语言、工具使用)。但近年研究也指出:部分"涌现"可能是评测指标(如精确匹配)的非线性造成的观测假象。无论机制如何,"更大规模 + 更多数据"确实稳定带来更强泛化是工程事实。趋势也从"堆参数"转向"参数不必最大、数据要够多"。

别神话,也别贬低

七、各自适合什么,又坑在哪

传统 NLP 仍值得用

  • 高确定性、强合规:金融风控标签、合同字段抽取,要可解释、可审计
  • 低延迟、低成本:边缘设备、海量请求的简单分类,不值得为 LLM 付推理钱
  • 小样本 / 封闭集:类别固定、数据充足时,小模型又快又稳
  • 精确结构化:固定 schema 的抽取,传统模型准确率上限更高

LLM 擅长,但要防坑

  • 开放生成、多任务、少样本:对话、写作、跨任务迁移
  • 知识问答:配合 RAG 接外部资料,缓解"忘事"
  • 坑 1 幻觉:会自信地编内容,必须加检索 + 引用 + 校验
  • 坑 2 成本高 / 延迟大:要管上下文长度、批处理、缓存、量化
  • 坑 3 可解释弱:难说清"为啥给这答案",高合规场景要护栏
实战经验:很多生产系统不是"二选一",而是混合架构——LLM 做理解 / 路由 / 生成,传统小模型做精确抽取 / 校验 / 兜底。让各自待在最擅长的地方。
打个比方

八、从"专用函数"到"通用计算机"

理解 LLM 颠覆性的最好类比:传统模型像专用函数——输入固定、输出固定、功能单一;LLM 像一台通用计算机——你给它不同的"程序"(Prompt),它就执行不同的任务。

传统:N 个专用小机器人 分词 分类 抽取 翻译 各管一摊,互不通用 LLM:1 个机器人 + Prompt 漏斗 同一个 LLM 翻译 分类 问答 一个模型,靠不同 Prompt 切换所有能力
图 5:从"一事一模型"到"一事一提示"。变化的是任务的表达权,不在模型本身。

LLM 真正的颠覆不在于某项任务比传统模型更强,而在于它把"任务定义权"从工程师手里交给了自然语言。过去要先定义任务、拆 pipeline、标数据、训模型;现在你用人类语言描述需求,模型就去理解并执行。

如果被人问起

九、面试怎么答,以及总结

回答框架(30 秒版)

  1. 先讲范式:传统 NLP 是"一任务一模型"的流水线,判别式输出标签;LLM 把所有任务统一成"预测下一个 token",靠 Prompt 表达任务,生成式输出文本。
  2. 再讲架构:BERT 实现了"预训练 + 微调",但任务头仍各管各的;LLM 连任务头都省了,一个 backbone 通吃。
  3. 最后讲涌现:规模到临界点后冒出训练目标没教的能力,这是 LLM 区别于传统 NLP 最本质的特征;同时补一句"实际生产常混合架构,各取所长"。
一句话总结

大模型不是"更好的 NLP 工具",而是把 NLP 的问题定义方式、工程组织方式、能力边界全部改写了一遍。传统方法没消失,只是从"主角"变成"精密部件"——和 LLM 一起组成今天的生产系统。

原理:下一个 token 预测 接口:Prompt / 少样本 能力:预训练 + 涌现 工程:RAG / 微调 / Agent / 护栏 结合:混合架构最务实