Encoder-only(BERT)、Decoder-only(GPT)、Encoder-Decoder(T5)本质区别在「注意力能看到多远」和「要不要生成」。本文用掩码图讲清,并解释为什么 LLM 时代 Decoder-only 胜出。
三种范式由注意力掩码决定:Encoder-only 双向看全句(理解型)、Decoder-only 只能看过去(生成型)、Encoder-Decoder 编码器双向 + 解码器因果 + cross-attention(Seq2Seq)。LLM 时代 Decoder-only 几乎通吃。
双向自注意力:每个 token 能看前后所有 token。适合「给一段文本,抽信息」的理解型任务。
因果注意力(causal mask):位置 i 只能看 ≤ i 的 token,看不到未来。天然适配「自回归生成」——这正是 LLM 的本职。
编码器双向理解源文本,解码器因果生成,两者通过 cross-attention 连接(解码器 query 去查编码器输出)。适合「输入一段、输出一段」的转化任务。
| 范式 | 注意力 | 强项 | 代表 | 选型建议 |
|---|---|---|---|---|
| Encoder-only | 双向 | 理解/抽取 | BERT | 分类、NER、召回 |
| Decoder-only | 因果 | 生成/通用 | GPT/Llama | 对话/代码/推理(默认) |
| Encoder-Decoder | 双向+因果+cross | Seq2Seq | T5/BART | 翻译/摘要/改写 |