Data-centric AI

面向大模型训练全周期的数据优化:训练前评估、选择与生成高价值数据, 训练中依据模型状态动态配比与编排,以更少无效计算获得更高模型收益。

中国科学技术大学 · 认知智能全国重点实验室

TL;DR: 大模型性能不仅由模型规模和算力决定,也受到数据价值、质量、比例与训练顺序的直接制约。 Data-centric AI 将数据从静态训练材料转变为可评估、可选择、可合成、可配比和可动态调度的优化对象, 最终目标是在给定训练预算下提升单位算力收益。

研究概览

训练数据问题贯穿大模型训练全周期。训练前,重复数据会消耗大量算力在无效 Token 上, 低质量数据则会放大梯度与数值波动;训练中,数据分布、难度和领域结构与模型状态不匹配, 会造成性能干扰、收敛变慢和训练不稳定。

📊

数据质量评估体系构建

建立数据与模型性能之间的定量关联,让样本价值随模型状态、训练阶段和目标能力动态更新。

🧩

数据选择与合成

从海量存量数据中识别有效样本,并围绕能力缺口定向生成高质量、低重复、目标对齐的数据。

⚙️

数据配比与调度

结合模型状态和训练反馈,动态调整多领域数据比例、训练顺序与采样频率。

训练阶段 核心瓶颈 数据优化任务 期望收益
训练前 数据冗余、低质量、目标能力覆盖不足 价值评估、数据选择、目标数据合成 减少无效 Token,提升训练稳定性
训练中 分布不一致、领域干扰、难度与阶段不适配 动态配比、课程编排、反馈驱动调度 加快收敛,提升性能并降低波动

训练前:数据价值评估、选择与生成

数据冗余使模型需要遍历更多 Token 才能获得同等能力;噪声、错误和偏离目标的数据则会扰乱训练信号。 因此,训练前的关键不是简单扩大数据规模,而是判断哪些数据在当前模型状态下真正有价值, 并围绕能力缺口补充高质量目标数据。

挑战 1:建立数据与模型性能间的理论关联

🔄

样本价值随模型状态变化

同一样本在早期、中期和后期训练阶段的价值不同,静态评分容易错过当前最需要的数据。

🧭

数据贡献难以稳定量化

领域、难度、质量、长度和格式会共同影响目标能力,不同数据类型的真实贡献关系仍不清晰。

挑战 2:选择与生成高质量数据

🔎

从海量数据中筛出有效样本

样本价值依赖已有数据和当前模型状态,真正有效的数据需要动态比较、排序与确认。

🧪

面向能力缺口定向生成

生成数据需要同时对齐目标能力与样本质量,避免领域偏离、难度错位、事实错误和样式重复。

训练中:数据配比与动态编排

当训练数据进入模型后,静态混合难以跟随能力短板迁移;难度和领域结构随训练阶段变化, 还会放大 Loss 与梯度波动。训练中的数据优化需要同时解决“以什么比例训练”和“以什么顺序训练”。

  • 1
    领域贡献方向不一致 同一领域数据会跨能力产生正负迁移,增益与干扰并存,难以用单一指标比较。
  • 2
    候选比例验证成本高 数据域偏好随训练进程变化,小模型或短训练得到的代理结果未必能外推到目标阶段的真实收益。
  • 3
    训练反馈带噪声且滞后 Reward、Loss 和方差动态具有噪声与滞后性,需要先识别可靠学习进展,再判断当前优化重点。
  • 4
    编排动作必须稳定执行 反馈最终要转化为数据顺序和采样频率;更新过急会造成权重突变与 Loss 震荡。

数据优化闭环

Data-centric AI 的核心不是一次性筛选,而是让数据策略随模型能力和训练动态持续更新。 从质量度量到模型反馈,形成可迭代的数据优化闭环。

  1. 数据质量度量
  2. 样本价值评估
  3. 数据选择与合成
  4. 数据配比优化
  5. 课程与动态调度
  6. 模型反馈更新
📐

理论层

刻画数据质量、有效规模、训练预算与模型性能之间的尺度关系。

🔁

机制层

用模型状态和训练反馈驱动数据选择、配比与调度策略更新。

🧮

系统层

联动训练吞吐、算子效率和算力预算,优化单位计算资源的能力增益。

数据选择、动态调度与演化更新

面向大模型高效训练,未来研究将围绕数据价值评估、模型状态感知的动态调度与数据演化更新展开, 以更高质量的数据供给提升单位算力下的模型收益。

三个关键瓶颈

  • 1
    数据如何选择 低价值或无效数据持续浪费算力资源。
  • 2
    数据如何动态调度 数据与模型状态不匹配会造成能力干扰与收敛困难。
  • 3
    数据演化更新 数据需随模型能力、训练阶段与反馈信号持续演化更新。

总结

从“更多数据”转向“更有价值的数据”,从“静态混合”转向“模型状态感知的动态调度”。

Data-centric AI 将数据效率、训练效率和迭代效率统一到同一优化目标下: 在训练预算受限、算力资源有限的条件下,让每一份数据和每一次计算都产生更明确的能力增益。