Scaling Laws 揭示:模型性能随参数量/数据量/算力平滑提升且可预测。Kaplan 说「越大越好」,Chinchilla 纠正为「数据和参数要等比例涨」。本文讲清幂律、Chinchilla 启示与「涌现」的关系。
Scaling Laws:在足够大的范围内,测试loss 随参数量 N、数据量 D、算力 C 各自呈幂律下降——可预测、平滑、没有突然的拐点。这解释了「堆资源就能变强」。但「涌现能力」是另一回事(见下)。
OpenAI 早期发现,只要另两个固定,loss 与每个变量都满足幂律:
指数 α,β,γ 都是小常数(约 0.05~0.1)。含义:翻倍资源,loss 只降一点点——但持续堆,确实一直在降。
DeepMind 的 Chinchilla 论文纠正了一个关键误区:在固定算力预算下,最优不是「超大模型+少量数据」,而是模型大小 N 和训练数据 D 近似等比例增长。
给定总算力 C,要在 N(参数)和 D(数据)之间分配。Chinchilla 给的是等比例这条最优线:
有些能力(多步推理、算术、翻译小语种)在模型小的时候几乎为 0,跨过某个规模阈值后突然「出现」——这叫涌现。
| 误区 | 纠正 |
|---|---|
| 模型越大越好 | 固定算力下,N、D 应等比例(Chinchilla) |
| 数据随便堆 | 数据质量与足量同样关键,脏数据有害 |
| 涌现=魔法拐点 | 多为指标非线性,底层仍平滑可预测 |
| loss 降就够 | 下游能力看具体任务,需配合评测 |