🧊 前沿科技知识库
全部 / 人工智能(AI)

预训练与缩放定律

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·基础原理 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

预训练是 LLM 通过海量文本以自监督方式学习通用语言能力的基础阶段。其核心工程问题是"算力—数据—参数"三者的最优配比,以及如何在超大规模下保持训练稳定、并保证数据质量。缩放定律(Scaling Laws)为这一配比提供了经验性数学指引。

最新进展(2025–2026)

2025–2026 年,业界对缩放定律的实践从"纯训练算力最优"转向"面向部署的产品最优":

核心技术与关键概念

Kaplan 定律与 Chinchilla 之争

早期 Kaplan 等人的缩放定律建议将大部分算力投入模型参数量。2022 年 DeepMind 的论文《Training Compute-Optimal Large Language Models》(即 Chinchilla 论文)对此提出挑战:作者训练了 400 多个不同规模/数据配比的模型,认为在固定算力预算下,模型规模与数据应大致同比例增长,最优 token/参数比约为 20:1(即 10B 参数模型约需 200B token)(Chinchilla Scaling Laws: Compute-Optimal LLM Training、What Are AI Scaling Laws?)。据此,团队训练了 67B 参数的 Chinchilla,以相近算力预算超越了更大的模型(Resolving Discrepancies in Compute-Optimal Scaling of Language Models)。

具体对比上,Gopher 为 280B 参数、约 300B token(每参数约 1.1 token);Chinchilla 为 70B 参数、1.4T token(每参数约 20 token)(Chinchilla Optimality)。

后续研究指出 Kaplan 与 Hoffmann(Chinchilla)之间存在方法论差异,并尝试调和这两种结论(Resolving Discrepancies in Compute-Optimal Scaling)。Chinchilla 的核心结论 D = 20N 被广泛引用,但实践中 FLOPs 往往并非首要约束,模型常被训练远超过 Chinchilla 时长(Scaling Inference-Efficient Language Models)。

质量感知与"计算—数据"缩放定律(2025–2026)

Chinchilla 框架只考虑模型规模与数据量,未形式化数据质量。2025 年有研究引入无量纲的"数据质量参数 Q",提出质量感知缩放定律,把损失建模为模型规模、数据量与数据质量的联合函数(Scaling Laws Revisited: Modeling the Role of Data Quality in Language Model Pretraining)。一项被 ICLR 2026 收录的研究构建了 QualityPajama(含 23 个不同质量干预的数据集),训练 2000 多个模型系统测量"过滤 / 去重 / LLM 改写"如何重塑神经缩放定律的全部五个参数,发现数据干预会同时改变缩放系数与指数(而架构改动主要影响系数)(How Text Quality Interventions Reshape Neural Scaling Laws for LLMs)。

针对"高质量数据有限"的现实,另一项工作提出"计算—数据"(CD)缩放定律:经典 compute-optimal 假设数据可随算力自由增长,而 data-optimal 假设语料固定、算力可无限增加;CD 缩放通过引入"词元有效性函数 η"统一两种极端情形(Bridging Compute- and Data-Optimal Pretraining、Bridging Compute- and Data-Optimal Pretraining(智源社区))。

数据清洗与去重

预训练数据的质量决定模型上限。典型流水线包括:

数据墙与合成数据

研究界普遍担忧高质量公开文本即将耗尽:多项工作引用 Villalobos 等人(2022)的估计,认为可获得的高质量公开文本可能在 2026–2028 年间被耗尽,预训练因而进入"数据墙"(data wall)区间——从"吞吐能力问题"转变为"控制问题",即在每一步优化中该让哪些 token 塑造模型(OPUS: Towards Efficient and Principled Data Selection in LLM Pre-training in Every Iteration)。LLMOrbit 亦把"数据稀缺(预计 2026–2028 年高质量文本耗尽)"列为持续缩放面临的首要瓶颈(LLMOrbit)。有分析进一步把预训练的"三重缩放墙"概括为:成本指数级增长、数据存量有限、以及每一点增量收益都要求指数级投入(Scaling Walls, Data Exhaustion, and the Technical Limits of Pre-Training in 2026)。

合成数据被视为延缓数据墙的路径之一:SynPro 通过"改写"与"重排版"把同一份有机数据呈现为多样形式,并用强化学习以质量、忠实度与数据影响力为奖励进行优化,报告称其解锁的有效 token 量是简单重复的 5.2 倍、是当时最优网页改写基线 RePro 的 3.0 倍(Generating Pretraining Tokens from Organic Data for Data-Bound Scaling)。但合成数据并非免费午餐:一项系统研究指出,在 TXBK 混合中约 33% 合成数据的效果稳定优于 67%,且随模型变大,合成数据的相对收益会减弱(Demystifying Synthetic Data in LLM Pre-training);另有研究系统考察了提示设计、生成器模型与源数据对合成预训练数据质量的影响(How Can We Synthesize High-Quality Pretraining Data?)。

训练不稳定与损失尖峰

超大规模预训练普遍遭遇梯度不稳定与损失尖峰(loss spike),可能引发灾难性发散,迫使团队回滚 checkpoint 并跳过数据批次(ZClip: Adaptive Spike Mitigation for LLM Pre-Training)。常见成因包括:学习率过高、梯度爆炸、数值溢出/下溢(尤其在长序列或低精度下),以及大集群中 GPU 显存或网络的静默数据损坏(比特翻转)(Training Stability: Diagnosing and Fixing Loss Spikes)。缓解手段包括:

算力—数据—参数权衡

综合来看,配比决策需同时考虑三方面:训练算力预算(Chinchilla 视角)、部署推理成本(产品视角,倾向于宁小勿大、宁训久勿训短)以及数据可得性(数据墙视角)。Llama 3 报告拟合出最优训练 token 数随算力预算的幂律关系 N⋆(C) = AC^α,并得到 (α, A) = (0.53, 0.29)(The Llama 3 Herd of Models)。

趋势与争议

参考来源

← 后训练与对齐方法提示工程与上下文工程(Prompt & Context Engineering) →