预训练进展主要来自数据:六年计算效率提升中数据改进贡献是模型的3.24倍
talkingdev • 2026-09-09
3189 views
一项针对2019年至2025年预训练进展的拆解分析显示,计算效率提升的主要来源正从模型架构转向数据侧。研究发现,数据改进带来的计算效率增益约为模型改进的3.24倍,且两者基本相互独立、不存在显著交互效应。过去几年中,多数模型研究实质是在移除或推迟规模化过程中的约束条件,例如上下文长度、训练不稳定性和推理成本等。值得注意的是,数据改进的边际收益可能随模型规模增大而下降:对大型模型而言,数据质量与配比的优化影响相对有限,而小型模型则能从高质量数据中获得显著提升。这一结论对行业资源分配具有参考意义,意味着在算力昂贵的预训练阶段,提升数据治理、去重、过滤和课程设计,可能比单纯追求模型结构创新带来更高性价比的回报。当然,这并不否定模型研究价值,而是提示两者需并行推进。
核心要点
- 2019至2025年预训练计算效率提升中,数据改进贡献是模型改进的3.24倍
- 数据与模型改进基本独立,多数模型研究聚焦移除或推迟规模化约束
- 数据质量对小模型收益显著,但对更大模型影响可能减弱