从“模型越大越好”到“数据怎么喂更重要”——这句话在大模型圈子里已经流传了一段时间,但真正把它做成可落地方法的工作并不多。最近,OpenCSG 研究团队发表了一篇论文:《Rethinking Data Mixing from the Perspective of Large Language Models》,提出了一种新的数据混合框架 DoGraph,尝试从模型自身的训练动态出发,重新定义“数据该怎么配比”这个问题。
一、大模型训练的难题:不是数据越多越好,而是比例怎么配
训练一个大语言模型,需要海量文本数据。但这些数据从来不是均匀分布的——互联网上爬取的 web 文本(如C4、CommonCrawl)动辄上万亿 token,而学术论文(ArXiv)、代码(GitHub)、专业书籍这类高质量数据则相对稀缺。如果直接按数量比例混合,模型会被汹涌的通用网页文本“淹没”,专业能力的训练信号反而被稀释。
这并不是一个新问题。研究者很早就意识到,训练数据的混合比例(data mixing strategy)对最终模型性能有着决定性影响。GPT-3、LLaMA、Mistral 等知名模型在发布时都会披露自己的数据配方——哪类来源占多少比例——这本身就说明了数据调度的重要性。
然而,现有的大多数方法都面临一个共同局限:它们依赖人类预先定义的数据域(domain)。比如,把数据分成 Wikipedia、书籍、代码、新闻、论文等几个大类,然后用各种算法(强化学习、损失比较、缩放定律拟合)来决定每类数据的权重。这类方法看起来直觉合理,但其实隐藏着一个根本性的假设:人类定义的“域”,就是模型学习时感知到的“域”。

二、人类眼中的数据域,未必是模型眼中的数据域
当我们说“Wikipedia 的数据”和“GitHub 的代码”属于不同的域,这是基于人类的分类直觉。但对模型来说,它并不是在“读 Wikipedia”或“读代码”——它在做的是根据输入文本,计算梯度,更新参数。模型真正“感受到”的数据区别,是通过梯度方向的差异体现的:如果两条数据对模型参数的更新方向非常相似,模型就会把它们视为同类;反之,则视为不同的域。
一个非常直观的可视化实验,研究者在训练的不同 epoch 下,收集了来自不同来源(C4、Wikipedia、Book、ArXiv、GitHub 等)数据样本的梯度方向,并用 PCA(主成分分析)将高维梯度投影到二维空间,观察各类数据的分布。
在训练初期,不同来源的数据在梯度空间中形成了相当清晰的聚类——Wikipedia是一簇,代码是一簇,网页文本是一簇。但随着训练持续推进,这些聚类开始互相渗透、边界模糊,最终在 PCA 投影中彼此重叠。这说明:模型对数据域的感知,并不是静止的,而是随着训练不断重塑的。

这个发现意味着什么?意味着如果我们在训练一开始就按照固定的人工标签分好域、配好比例,然后一路保持不变,这个策略实际上是在用第 0 步时的模型感知来指导整个训练过程。而到了训练中后期,模型已经发展出截然不同的内部数据结构,固定的域划分早已不再贴合实际。
这种从模型参数更新角度看数据的方式被称为 gradient geometry / gradient signatures——每一条训练样本在当前模型状态下产生的梯度方向,就是这条数据在模型眼中的“身份证”。不同数据的梯度签名越相似,它们在模型的“感知世界”里就越接近同一个域。
三、DoGraph:让模型根据梯度变化动态调整数据权重
认识到“模型眼中的域”与“人类标签的域”存在本质差异之后,研究团队提出了 DoGraph——一个基于图约束重加权(graph-constrained reweighting)的数据混合框架。它的核心思路是:不再完全依赖固定的人工域标签,而是在训练过程中,持续从模型自身的梯度信号里识别潜在的域结构,并动态调整各域权重。
听起来有些抽象,我们来拆解它的工作流程。

每个训练轮次开始时,DoGraph 会对当前批次的每条样本计算梯度,然后使用随机投影(random projection)将极高维度的梯度向量压缩到低维空间——这一步是工程上的关键,避免了直接操作亿级参数梯度带来的计算爆炸问题。
压缩后的梯度向量,会通过 K-means 聚类算法分组,形成 m 个模型中心的潜在域(model-centric domains)。这里的“域”不再是“这条数据来自 Wikipedia”,而是“这条数据在当前模型状态下产生的梯度方向,与这 m 个簇中的哪一个最接近”。每个域内所有样本的平均梯度,反映了这个域对模型参数的综合影响方向和强度。
接下来,DoGraph 会通过一个优化步骤来求解各域的权重:目标是让各域的加权梯度组合,能够更稳定地推动模型向更好的方向收敛。实验中对不同优化目标进行了对比,最终采用了基于“域内梯度不确定性(uncertainty)”的目标函数——直觉上,如果一个域内的数据梯度方向非常一致(低不确定性),说明这个域目前对模型来说是“学得比较稳定”的;而梯度方向混乱(高不确定性)的域,则需要更谨慎地调度权重,以避免引入噪声。
最终,根据计算出的各域权重,对每条样本的梯度进行加权,更新模型参数。这整套流程会随着训练持续迭代——域的划分和权重,会跟随模型的学习状态不断演化,而不是在训练开始时就固定下来。
在训练后期,即便原始人类来源标签已经高度混杂,DoGraph 仍能在梯度空间中清晰地抽取出 m=11 个潜在域,展示出模型内部真实存在的、超越表面来源标签的数据结构。

四、从 GPT-2 到 LLaMA:更稳定的泛化表现
方法再有新意,也需要用数据说话。这项工作在多个模型规模和数据集上进行了系统性评估,覆盖了从 GPT-2 Small(210M)到LLaMA-3.2-3B 的不同量级,以及 SlimPajama 和 The Pile 两个主流预训练数据集。评估指标涵盖 9 个稳定 benchmark:HellaSwag、PiQA、OpenBookQA、COPA、LogiQA、WinoGrande、SciQ、ARC-Easy 和 Lambada。
先看最核心的一组数据。在 GPT-2 Medium(300M)+ SlimPajama 的主实验中,DoGraph 与六种对比方法的 benchmark 平均分和验证集困惑度(Perplexity)结果如下:


DoGraph 以 37.9 分位列第一,高于表现次优的 Dynamic Loss-Based(37.2 分),更明显优于 DoReMi(36.5)、RegMix(35.7)和 Uniform(35.4)。在验证集困惑度(PPL,越低越好)方面,DoGraph 的 PPL 为 3.09,也是所有对比方法中最低的,相比 Uniform(4.13)下降幅度相当显著。值得注意的是,RegMix 和 Data Mixing Law 尽管在部分 benchmark 上表现尚可,但在 PPL 上却高达 4.50 以上,说明其模型收敛质量存在明显短板。
这个优势在更大规模模型上同样稳定。在实验里,LLaMA-1.1B + The Pile 上 DoGraph 平均分为 42.5;LLaMA-3.2-3B + The Pile 上达到 43.1;在更小的 GPT-2 Small + SlimPajama 设置下,DoGraph 平均分为36.4。跨越多个模型规模、两个不同的训练数据集,DoGraph 都表现出稳定的竞争优势,说明这套方法并非只对特定规模或特定数据集“调出来的”,具有较好的泛化性。

此外,消融实验中展示了聚类数目 m 对验证集 PPL 的影响,结果呈现 U 型曲线:m 太少,无法捕捉梯度空间中的真实结构;m 太多,则会过度切分梯度空间,引入冗余噪声。m=11是一个相对较好的平衡点。这个结果也侧面说明,“模型眼中的域”确实比人工定义的 7 个 SlimPajama 来源类别更细腻,但也并非无限可分。

计算开销方面,展示了在 2 块 NVIDIA H200 GPU 上的运行时间对比。DoGraph 完成预训练总用时 20.37 小时,相比 RegMix 仅增加了约 4.51%的额外运行时间——而 RegMix 在性能上远不如 DoGraph。换句话说,DoGraph 用较小的计算代价换来了更好的训练质量。

五、OpenCSG的价值:把数据治理做到模型训练深处
OpenCSG在国内 AI 社区中,通常以开源平台和语料建设见长。DoGraph的发表,展示了 OpenCSG 团队在另一个层面上的投入:对大模型底层训练机制的原理性研究。数据怎么配比、配比策略对模型参数更新的影响、如何从训练动态中反向识别数据结构——这些问题,不是产品功能迭代能解决的,需要真正深入到梯度、优化和训练动力学的层面。
OpenCSG的研究思路,不是把数据治理停留在“清洗干净、标注准确”的层面,而是继续追问:什么样的数据,在什么样的训练阶段,以什么样的比例进入模型,能最有效地转化为模型能力?这是一个横跨数据工程和训练机制的深度问题。
DoGraph正是这种思考方式的落地:它把数据调度问题从“人工经验配方”推向“训练动态驱动的自适应调度”,为数据混合策略提供了一种更模型中心、更可解释的路径。
从平台到研究的延伸也值得关注。OpenCSG 在语料建设、数据质量评估上的长期积累,为这类研究提供了天然的实验土壤。当一个团队同时深度参与数据平台建设和训练方法研究,他们能在两个方向上互相印证:平台侧看到的数据质量问题,能反哺训练方法的设计;训练侧发现的规律,能反过来指导语料建设策略。
值得强调的是,该方法并不是在宣称“解决了所有数据混合问题”——DoGraph 是在特定实验设置下(decoder-only Transformer、预训练阶段)验证的,实际落地到超大规模训练中还有诸多工程挑战。但作为一种方法论上的推进,它有着清晰的意义:推动数据治理从经验规则走向训练动态驱动,让“高质量数据如何真正转化为模型能力”这个问题,有了更系统、更可解释的答案。
六、DoGraph 与现有方法:一张表看清差异
为了更直观地理解 DoGraph 相较于现有方法的不同,我们从几个关键维度做一次横向对比。


可以看出,现有主流方法的核心差异在于:是否依赖固定的人工域标签,以及是否能感知训练过程中模型状态的变化。Uniform 最简单,完全不做域区分;DoReMi、DOGE、RegMix 等方法引入了更复杂的优化机制,但域划分仍然是静态的、人工预定义的。DoGraph 的核心突破在于:把“域是什么”这个问题本身也纳入了训练循环,让模型的梯度信号来回答。
结语:数据调度,是大模型竞争的下一个主战场
如果说 2023 年大模型竞争的关键词是“规模”,2024 年是“推理效率”,那么越来越多的迹象表明,数据质量、数据调度和训练机制正在成为下一个真正拉开差距的地方。再大的模型,如果训练数据配比失当,也很难达到潜在的能力上限;而精心调度的数据,可能让中等规模的模型超越更大的竞争对手。
《Rethinking Data Mixing from the Perspective of Large Language Models》这篇论文,提供的不仅是一个具体的算法(DoGraph),更是一种看待数据混合问题的新框架:不要只问“这些数据从哪里来”,更要问“在当前训练状态下,模型如何感知这些数据”。当我们把视角从数据的人类属性,转移到数据在模型梯度空间中的动态结构,许多原本模糊的问题开始变得可测量、可优化。

当然,这项工作也有其边界。当前实验集中在预训练阶段的decoder-only 模型,DoGraph 在指令微调、强化学习对齐等阶段的效果还有待验证。梯度的计算和存储,在超大规模(千亿参数级)训练中仍是工程挑战。这些,也许正是接下来值得继续探索的方向。
大模型的下半场,数据不再只是“原材料”,而是可以被精细调度、动态感知、持续优化的训练信号。OpenCSG 发表这篇论文,是把长期积累的数据工程实践推向基础方法研究的一次探索——也是对“高质量数据如何真正转化为模型能力”这个核心命题,给出的一份认真的学术回答。
论文链接
arxiv:2604.07963——Rethinking Data Mixing from the Perspective of Large Language Models
ACL 论文链接:aclanthology.org/2026.a
行业标杆地位的验证
OpenCSG发布的FineWeb-Edu-Chinese作为全球下载量排名前三的中文预训练数据集,累计下载超百万次,其价值已经得到业界广泛认可:
- 学术领域:被斯坦福大学、清华大学、中国人民大学高瓴人工智能学院、上海人工智能实验室、北京智源研究院等 20 余家顶尖机构的论文引用。旗下 Chinese Fineweb Edu 已成为中文 NLP 研究的核心数据资源,被 100 + 篇学术论文引用,在 NeurIPS、ACL、EMNLP、ICLR 等国际顶会及 Nature 子刊、JMLR 等权威期刊中作为核心实验数据集,支撑大模型预训练、指令微调等前沿研究,合作机构还包括鹏城实验室、西南电子技术研究所、西班牙国家级超算中心(Barcelona Supercomputing Center)及 Mozilla Data Collective等全球顶尖科研单位。
- 产业应用:支撑 Llama3-Chinese、DeepSeek 等知名模型训练,并被中国移动、中国联通、英伟达(NVIDIA)、苹果公司(Apple Inc.)、OPPO、美团、阿里巴巴、蚂蚁集团、面壁智能(ModelBest)、Krafton等领军企业采用。Chinese Fineweb Edu 已从实验室走向产业场景,为创业公司到头部企业的研发团队提供可靠支撑,切实推动中文 NLP 应用从理论落地到生产实践。
- 生态影响:下载数量累计超百万次,数据体量达 2.42TB,覆盖 9.57 亿条高质量文本,已孵化出 10 余个垂直领域微调模型。同时,OpenCSG 通过开源打分模型和完整工具链,输出数据治理方法论,带动行业从 “模型参数内卷” 转向 “数据基建完善”,显著降低中小开发者与研究机构的入门门槛。
- 开源生态:OpenCSG 坚持“开源即文化”的理念,通过透明、共创、共享的社区文化,与全球开发者、工程师和 AI 原生企业共同构建智能体生态。

关于OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。
