LLM 训练与规律

缩放定律 Scaling Laws:大模型为什么越大越聪明

Scaling Laws 揭示:模型性能随参数量/数据量/算力平滑提升且可预测。Kaplan 说「越大越好」,Chinchilla 纠正为「数据和参数要等比例涨」。本文讲清幂律、Chinchilla 启示与「涌现」的关系。

一句话回答

Scaling Laws:在足够大的范围内,测试loss 随参数量 N、数据量 D、算力 C 各自呈幂律下降——可预测、平滑、没有突然的拐点。这解释了「堆资源就能变强」。但「涌现能力」是另一回事(见下)。

Kaplan 2020:三个独立幂律

OpenAI 早期发现,只要另两个固定,loss 与每个变量都满足幂律:

L(N) ∝ N^{-α}    L(D) ∝ D^{-β}    L(C) ∝ C^{-γ}

指数 α,β,γ 都是小常数(约 0.05~0.1)。含义:翻倍资源,loss 只降一点点——但持续堆,确实一直在降。

测试 loss 随规模(对数轴)平滑下降,无拐点 规模 → loss 幂律平滑下降
当时结论偏向「模型越大越好」,于是一度流行训超大模型但数据喂不够。

Chinchilla 2022:数据也要等比例涨

DeepMind 的 Chinchilla 论文纠正了一个关键误区:在固定算力预算下,最优不是「超大模型+少量数据」,而是模型大小 N 和训练数据 D 近似等比例增长。

给定算力 C:N_opt ∝ C^{0.5}    D_opt ∝ C^{0.5}
著名结论:70B 参数的模型,最优训练数据应是约 1.4T tokens(而不是 GPT-3 的 300B)。Chinchilla 用更少参数+更多数据,效果反超同算力的超大模型。如今"数据不够"是大模型训练的主要瓶颈之一。

算力-数据-参数 三角

给定总算力 C,要在 N(参数)和 D(数据)之间分配。Chinchilla 给的是等比例这条最优线:

实践含义:
• 想省推理成本 → 小模型 + 足量数据(Chinchilla 路线)
• 想追上限 → 加大 C,N、D 一起加
• 数据质量比数量更重要——脏数据堆再多也亏

涌现能力(Emergent):和 Scaling 是两件事

有些能力(多步推理、算术、翻译小语种)在模型小的时候几乎为 0,跨过某个规模阈值后突然「出现」——这叫涌现。

涌现:某能力在阈值附近「跳变」(而非平滑) 阈值
争议:有研究认为「涌现」部分是评测指标非线性(如精确匹配 0/1)造成的假象;若用平滑指标(如交叉熵),很多能力其实也是平滑提升的。所以「涌现」≠「违背 Scaling Law」,二者是「平滑 loss」与「能力突现观感」的不同切面。

实践启示

误区纠正
模型越大越好固定算力下,N、D 应等比例(Chinchilla)
数据随便堆数据质量与足量同样关键,脏数据有害
涌现=魔法拐点多为指标非线性,底层仍平滑可预测
loss 降就够下游能力看具体任务,需配合评测

总结