数据质量评估体系构建
建立数据与模型性能之间的定量关联,让样本价值随模型状态、训练阶段和目标能力动态更新。
面向大模型训练全周期的数据优化:训练前评估、选择与生成高价值数据, 训练中依据模型状态动态配比与编排,以更少无效计算获得更高模型收益。
中国科学技术大学 · 认知智能全国重点实验室
训练数据问题贯穿大模型训练全周期。训练前,重复数据会消耗大量算力在无效 Token 上, 低质量数据则会放大梯度与数值波动;训练中,数据分布、难度和领域结构与模型状态不匹配, 会造成性能干扰、收敛变慢和训练不稳定。
建立数据与模型性能之间的定量关联,让样本价值随模型状态、训练阶段和目标能力动态更新。
从海量存量数据中识别有效样本,并围绕能力缺口定向生成高质量、低重复、目标对齐的数据。
结合模型状态和训练反馈,动态调整多领域数据比例、训练顺序与采样频率。
| 训练阶段 | 核心瓶颈 | 数据优化任务 | 期望收益 |
|---|---|---|---|
| 训练前 | 数据冗余、低质量、目标能力覆盖不足 | 价值评估、数据选择、目标数据合成 | 减少无效 Token,提升训练稳定性 |
| 训练中 | 分布不一致、领域干扰、难度与阶段不适配 | 动态配比、课程编排、反馈驱动调度 | 加快收敛,提升性能并降低波动 |
数据冗余使模型需要遍历更多 Token 才能获得同等能力;噪声、错误和偏离目标的数据则会扰乱训练信号。 因此,训练前的关键不是简单扩大数据规模,而是判断哪些数据在当前模型状态下真正有价值, 并围绕能力缺口补充高质量目标数据。
同一样本在早期、中期和后期训练阶段的价值不同,静态评分容易错过当前最需要的数据。
领域、难度、质量、长度和格式会共同影响目标能力,不同数据类型的真实贡献关系仍不清晰。
样本价值依赖已有数据和当前模型状态,真正有效的数据需要动态比较、排序与确认。
生成数据需要同时对齐目标能力与样本质量,避免领域偏离、难度错位、事实错误和样式重复。
当训练数据进入模型后,静态混合难以跟随能力短板迁移;难度和领域结构随训练阶段变化, 还会放大 Loss 与梯度波动。训练中的数据优化需要同时解决“以什么比例训练”和“以什么顺序训练”。
Data-centric AI 的核心不是一次性筛选,而是让数据策略随模型能力和训练动态持续更新。 从质量度量到模型反馈,形成可迭代的数据优化闭环。
刻画数据质量、有效规模、训练预算与模型性能之间的尺度关系。
用模型状态和训练反馈驱动数据选择、配比与调度策略更新。
联动训练吞吐、算子效率和算力预算,优化单位计算资源的能力增益。
面向大模型高效训练,未来研究将围绕数据价值评估、模型状态感知的动态调度与数据演化更新展开, 以更高质量的数据供给提升单位算力下的模型收益。
Data-centric AI 将数据效率、训练效率和迭代效率统一到同一优化目标下: 在训练预算受限、算力资源有限的条件下,让每一份数据和每一次计算都产生更明确的能力增益。