Transformer 架构

三种架构范式:BERT / GPT / T5 怎么选

Encoder-only(BERT)、Decoder-only(GPT)、Encoder-Decoder(T5)本质区别在「注意力能看到多远」和「要不要生成」。本文用掩码图讲清,并解释为什么 LLM 时代 Decoder-only 胜出。

一句话回答

三种范式由注意力掩码决定:Encoder-only 双向看全句(理解型)、Decoder-only 只能看过去(生成型)、Encoder-Decoder 编码器双向 + 解码器因果 + cross-attention(Seq2Seq)。LLM 时代 Decoder-only 几乎通吃。

Encoder-only(BERT 系)

双向自注意力:每个 token 能看前后所有 token。适合「给一段文本,抽信息」的理解型任务。

擅长:分类、NER、抽取式问答、语义相似度、检索召回。
代表:BERT、RoBERTa、DeBERTa。
不擅长:自由生成(它没有「续写」的训练目标)。

Decoder-only(GPT 系)

因果注意力(causal mask):位置 i 只能看 ≤ i 的 token,看不到未来。天然适配「自回归生成」——这正是 LLM 的本职。

擅长:文本生成、对话、代码、推理、Few-shot/ICL/CoT 全建立在这之上。
代表:GPT 系列、Llama、Qwen、DeepSeek、Claude、Gemini。

Encoder-Decoder(T5/BART 系)

编码器双向理解源文本,解码器因果生成,两者通过 cross-attention 连接(解码器 query 去查编码器输出)。适合「输入一段、输出一段」的转化任务。

擅长:翻译、摘要、改写、问答生成。
代表:T5、BART、mT5、FLAN-T5。

注意力掩码对比

可见矩阵(●=可见 ○=不可见),每行是「该位置能看到谁」 Encoder(双向) Decoder(因果) Enc-Dec 编码器=双向 解码器=因果 cross-attn 连两者 ● 全可见 ▽ 三角(只看过去)

为什么 LLM 时代 Decoder-only 胜出

理解型任务(如检索召回、分类)仍常用 BERT 类小模型,便宜又快;但「通用对话大模型」几乎全是 Decoder-only。

对比与选型

范式注意力强项代表选型建议
Encoder-only双向理解/抽取BERT分类、NER、召回
Decoder-only因果生成/通用GPT/Llama对话/代码/推理(默认)
Encoder-Decoder双向+因果+crossSeq2SeqT5/BART翻译/摘要/改写

总结