数据枯竭?成本飙升?首篇“数据价值密度”综述划重点:五大策略四大挑战
导语:首篇“数据价值密度”综述发布,五大策略四大挑战,破解大模型训练数据枯竭难题。
当训练数据枯竭、训练成本飙升,大语言模型(LLM)训练之路该何去何从?作为提升LLM性能的主流核心范式,持续扩充训练数据量的传统做法正面临严峻挑战。研究表明,目前互联网上可获取的高质量数据年增长率不足10%,难以满足LLM训练数据大规模增加的需求。同时,该范式引导的LLM训练动辄需要数千万GPU小时的算力开销,产生了巨额资源消耗与碳排放,让堆数据策略难以为继。

本文由来自上海交通大学和上海人工智能实验室的多位研究者共同完成,受到上海市“通用人工智能大模型”基础研究专项支持。共同第一作者为孙亦刘、陆彦超与曹家熙,共同通讯作者为来自上海交通大学自动化与感知学院的宫辰教授与刘伟副教授。团队长期致力于机器学习及大模型方面的研究。

图1:左:大模型数据扩展面临的三大挑战。右:互联网可用数据量与LLM训练数据量的增长趋势对比。
数据价值密度(DVD):从概念到分类
如何在有限的数据规模下获取更多的训练收益,已经成为LLM训练的关键问题。目前,研究者在该领域已展开了大量的探索,例如s1、Less-Is-More Reasoning (LIMO) Hypothesis和Rho-1,但该领域仍缺乏统一的研究视角和系统的工作梳理。在这一背景下,研究团队发布了该领域的首篇系统性综述,首次提出了“数据价值密度”(Data Value Density,DVD)这一核心概念并给出数学定义。

论文标题:Data Value Density Enhancement for Large Language Model Training: A Comprehensive Survey
论文链接:https://ssrn.com/abstract=6618802
数学定义:设D为数据集,C为上下文信息(如模型能力分布、任务特征),V(D|C)衡量数据集D在训练上下文C下对模型性能提升的总贡献价值,μ(D)衡量数据集D的规模。该领域研究的目标是构建一个新数据集,使其价值密度大于原数据集(Δf>0)。

基于这一定义,作者将现有方法划分为五大方向,并做出了四大核心贡献:
- 贡献一:首次提出“DVD”概念,为大模型训练全阶段的数据优化确立了明确的研究目标。
- 贡献二:基于DVD的定义,将现有方法划分为五大方向,厘清了技术发展的完整脉络。
- 贡献三:梳理了目前用于数据价值密度增强领域的代表性数据集,深度剖析了不同任务的数据内在特性。
- 贡献四:指出了数据价值密度增强领域所面临的挑战,为未来研究指明方向。
五大分类:从提升价值到压缩规模
基于DVD数学定义中分子V(D|C)与分母μ(D)的动态变化关系,作者将数据价值密度增强领域划分为五大类别:
- V(D|C)提升,μ(D)不变:在数据规模固定时提升数据价值,包括数据调度、数据混合、增强式生成等策略。
- V(D|C)不变,μ(D)下降:在数据价值不变时降低规模,包括重复数据去除、数据蒸馏等。
- V(D|C)提升,μ(D)下降:在价值提升的同时压缩规模,包括负价值数据去除等。
- V(D|C)略降,μ(D)暴降:价值轻微下降但规模大幅下降,包括高价值数据筛选等。
- V(D|C)暴增,μ(D)略增:规模轻微上升但价值大幅提升,包括数据进化等策略。

图2:DVD增强方法分类框架
此外,作者用一张示意图展示了不同类型策略实施前后数据集内部的变化。
高频数据集与多领域对比
Survey还整理了DVD增强研究中高频使用的数据集,分为三大板块:
- 文本理解:从万亿Token的无标签预训练语料到有标签后训练数据。
- 复杂推理:包含MATH、GPQA、OpenThoughts、AIME等推理数据集,覆盖逻辑推理与常识推理。
- 垂直领域:医疗、法律、金融等领域的相关数据集。
同时,文章将DVD增强与上下文学习、能力密度、样本效率和主动学习进行了深度对比,打通了不同研究范式之间的底层逻辑。
四大挑战:黑盒、成本、人工与自动化、垂直领域
尽管DVD增强技术已取得一定成果,但仍面临四大挑战:
- “黑盒”可解释性差:现有方法高度依赖人类经验,缺乏严谨的理论框架。
- 实施成本昂贵:虽然减少了训练数据量,但额外成本(如大规模采样、训练打分模型)可能巨大。
- 人工与自动化的两难:专家标注质量可控但成本高,模型自动化效率高但易引入幻觉。
- 垂直领域研究空白:专业领域数据稀缺,通用方法在垂直领域表现较差,急需针对性策略。
本篇Survey从首创的DVD视角出发,系统地梳理了大模型训练数据价值密度增强领域的完整路线图,有助于解决当下LLM训练数据枯竭与算力开销大等问题,推动大模型训练模式从粗放式数据消耗向精准化知识萃取的根本性跨越。