OpenCSG 最新研究成果入选 ACL 2026:DoGraph 探索大模型数据混合新范式
从“模型越大越好”到“数据怎么喂更重要”——这句话在大模型圈子里已经流传了一段时间但真正把它做成可落地方法的工作并不多。最近OpenCSG 研究团队发表了一篇论文《Rethinking Data Mixing from the Perspective of Large Language Models》提出了一种新的数据混合框架 DoGraph尝试从模型自身的训练动态出发重新定义“数据该怎么配比”这个问题。一、大模型训练的难题不是数据越多越好而是比例怎么配训练一个大语言模型需要海量文本数据。但这些数据从来不是均匀分布的——互联网上爬取的 web 文本如C4、CommonCrawl动辄上万亿 token而学术论文ArXiv、代码GitHub、专业书籍这类高质量数据则相对稀缺。如果直接按数量比例混合模型会被汹涌的通用网页文本“淹没”专业能力的训练信号反而被稀释。这并不是一个新问题。研究者很早就意识到训练数据的混合比例data mixing strategy对最终模型性能有着决定性影响。GPT-3、LLaMA、Mistral 等知名模型在发布时都会披露自己的数据配方——哪类来源占多少比例——这本身就说明了数据调度的重要性。然而现有的大多数方法都面临一个共同局限它们依赖人类预先定义的数据域domain。比如把数据分成 Wikipedia、书籍、代码、新闻、论文等几个大类然后用各种算法强化学习、损失比较、缩放定律拟合来决定每类数据的权重。这类方法看起来直觉合理但其实隐藏着一个根本性的假设人类定义的“域”就是模型学习时感知到的“域”。二、人类眼中的数据域未必是模型眼中的数据域当我们说“Wikipedia 的数据”和“GitHub 的代码”属于不同的域这是基于人类的分类直觉。但对模型来说它并不是在“读 Wikipedia”或“读代码”——它在做的是根据输入文本计算梯度更新参数。模型真正“感受到”的数据区别是通过梯度方向的差异体现的如果两条数据对模型参数的更新方向非常相似模型就会把它们视为同类反之则视为不同的域。一个非常直观的可视化实验研究者在训练的不同 epoch 下收集了来自不同来源C4、Wikipedia、Book、ArXiv、GitHub 等数据样本的梯度方向并用 PCA主成分分析将高维梯度投影到二维空间观察各类数据的分布。在训练初期不同来源的数据在梯度空间中形成了相当清晰的聚类——Wikipedia是一簇代码是一簇网页文本是一簇。但随着训练持续推进这些聚类开始互相渗透、边界模糊最终在 PCA 投影中彼此重叠。这说明模型对数据域的感知并不是静止的而是随着训练不断重塑的。这个发现意味着什么意味着如果我们在训练一开始就按照固定的人工标签分好域、配好比例然后一路保持不变这个策略实际上是在用第 0 步时的模型感知来指导整个训练过程。而到了训练中后期模型已经发展出截然不同的内部数据结构固定的域划分早已不再贴合实际。这种从模型参数更新角度看数据的方式被称为 gradient geometry / gradient signatures——每一条训练样本在当前模型状态下产生的梯度方向就是这条数据在模型眼中的“身份证”。不同数据的梯度签名越相似它们在模型的“感知世界”里就越接近同一个域。三、DoGraph让模型根据梯度变化动态调整数据权重认识到“模型眼中的域”与“人类标签的域”存在本质差异之后研究团队提出了 DoGraph——一个基于图约束重加权graph-constrained reweighting的数据混合框架。它的核心思路是不再完全依赖固定的人工域标签而是在训练过程中持续从模型自身的梯度信号里识别潜在的域结构并动态调整各域权重。听起来有些抽象我们来拆解它的工作流程。每个训练轮次开始时DoGraph 会对当前批次的每条样本计算梯度然后使用随机投影random projection将极高维度的梯度向量压缩到低维空间——这一步是工程上的关键避免了直接操作亿级参数梯度带来的计算爆炸问题。压缩后的梯度向量会通过 K-means 聚类算法分组形成 m 个模型中心的潜在域model-centric domains。这里的“域”不再是“这条数据来自 Wikipedia”而是“这条数据在当前模型状态下产生的梯度方向与这 m 个簇中的哪一个最接近”。每个域内所有样本的平均梯度反映了这个域对模型参数的综合影响方向和强度。接下来DoGraph 会通过一个优化步骤来求解各域的权重目标是让各域的加权梯度组合能够更稳定地推动模型向更好的方向收敛。实验中对不同优化目标进行了对比最终采用了基于“域内梯度不确定性uncertainty”的目标函数——直觉上如果一个域内的数据梯度方向非常一致低不确定性说明这个域目前对模型来说是“学得比较稳定”的而梯度方向混乱高不确定性的域则需要更谨慎地调度权重以避免引入噪声。**最终根据计算出的各域权重对每条样本的梯度进行加权更新模型参数。**这整套流程会随着训练持续迭代——域的划分和权重会跟随模型的学习状态不断演化而不是在训练开始时就固定下来。在训练后期即便原始人类来源标签已经高度混杂DoGraph 仍能在梯度空间中清晰地抽取出 m11 个潜在域展示出模型内部真实存在的、超越表面来源标签的数据结构。四、从 GPT-2 到 LLaMA更稳定的泛化表现方法再有新意也需要用数据说话。这项工作在多个模型规模和数据集上进行了系统性评估覆盖了从 GPT-2 Small210M到LLaMA-3.2-3B 的不同量级以及 SlimPajama 和 The Pile 两个主流预训练数据集。评估指标涵盖 9 个稳定 benchmarkHellaSwag、PiQA、OpenBookQA、COPA、LogiQA、WinoGrande、SciQ、ARC-Easy 和 Lambada。先看最核心的一组数据。在 GPT-2 Medium300M SlimPajama 的主实验中DoGraph 与六种对比方法的 benchmark 平均分和验证集困惑度Perplexity结果如下DoGraph 以 37.9 分位列第一高于表现次优的 Dynamic Loss-Based37.2 分更明显优于 DoReMi36.5、RegMix35.7和 Uniform35.4。在验证集困惑度PPL越低越好方面DoGraph 的 PPL 为 3.09也是所有对比方法中最低的相比 Uniform4.13下降幅度相当显著。值得注意的是RegMix 和 Data Mixing Law 尽管在部分 benchmark 上表现尚可但在 PPL 上却高达 4.50 以上说明其模型收敛质量存在明显短板。这个优势在更大规模模型上同样稳定。在实验里LLaMA-1.1B The Pile 上 DoGraph 平均分为 42.5LLaMA-3.2-3B The Pile 上达到 43.1在更小的 GPT-2 Small SlimPajama 设置下DoGraph 平均分为36.4。跨越多个模型规模、两个不同的训练数据集DoGraph 都表现出稳定的竞争优势说明这套方法并非只对特定规模或特定数据集“调出来的”具有较好的泛化性。此外消融实验中展示了聚类数目 m 对验证集 PPL 的影响结果呈现 U 型曲线m 太少无法捕捉梯度空间中的真实结构m 太多则会过度切分梯度空间引入冗余噪声。m11是一个相对较好的平衡点。这个结果也侧面说明“模型眼中的域”确实比人工定义的 7 个 SlimPajama 来源类别更细腻但也并非无限可分。计算开销方面展示了在 2 块 NVIDIA H200 GPU 上的运行时间对比。DoGraph 完成预训练总用时 20.37 小时相比 RegMix 仅增加了约 4.51%的额外运行时间——而 RegMix 在性能上远不如 DoGraph。换句话说DoGraph 用较小的计算代价换来了更好的训练质量。五、OpenCSG的价值把数据治理做到模型训练深处OpenCSG在国内 AI 社区中通常以开源平台和语料建设见长。DoGraph的发表展示了 OpenCSG 团队在另一个层面上的投入对大模型底层训练机制的原理性研究。数据怎么配比、配比策略对模型参数更新的影响、如何从训练动态中反向识别数据结构——这些问题不是产品功能迭代能解决的需要真正深入到梯度、优化和训练动力学的层面。OpenCSG的研究思路不是把数据治理停留在“清洗干净、标注准确”的层面而是继续追问什么样的数据在什么样的训练阶段以什么样的比例进入模型能最有效地转化为模型能力这是一个横跨数据工程和训练机制的深度问题。DoGraph正是这种思考方式的落地它把数据调度问题从“人工经验配方”推向“训练动态驱动的自适应调度”为数据混合策略提供了一种更模型中心、更可解释的路径。从平台到研究的延伸也值得关注。OpenCSG 在语料建设、数据质量评估上的长期积累为这类研究提供了天然的实验土壤。当一个团队同时深度参与数据平台建设和训练方法研究他们能在两个方向上互相印证平台侧看到的数据质量问题能反哺训练方法的设计训练侧发现的规律能反过来指导语料建设策略。值得强调的是该方法并不是在宣称“解决了所有数据混合问题”——DoGraph 是在特定实验设置下decoder-only Transformer、预训练阶段验证的实际落地到超大规模训练中还有诸多工程挑战。但作为一种方法论上的推进它有着清晰的意义推动数据治理从经验规则走向训练动态驱动让“高质量数据如何真正转化为模型能力”这个问题有了更系统、更可解释的答案。六、DoGraph 与现有方法一张表看清差异为了更直观地理解 DoGraph 相较于现有方法的不同我们从几个关键维度做一次横向对比。可以看出现有主流方法的核心差异在于是否依赖固定的人工域标签以及是否能感知训练过程中模型状态的变化。Uniform 最简单完全不做域区分DoReMi、DOGE、RegMix 等方法引入了更复杂的优化机制但域划分仍然是静态的、人工预定义的。DoGraph 的核心突破在于把“域是什么”这个问题本身也纳入了训练循环让模型的梯度信号来回答。结语数据调度是大模型竞争的下一个主战场如果说 2023 年大模型竞争的关键词是“规模”2024 年是“推理效率”那么越来越多的迹象表明数据质量、数据调度和训练机制正在成为下一个真正拉开差距的地方。再大的模型如果训练数据配比失当也很难达到潜在的能力上限而精心调度的数据可能让中等规模的模型超越更大的竞争对手。《Rethinking Data Mixing from the Perspective of Large Language Models》这篇论文提供的不仅是一个具体的算法DoGraph更是一种看待数据混合问题的新框架不要只问“这些数据从哪里来”更要问“在当前训练状态下模型如何感知这些数据”。当我们把视角从数据的人类属性转移到数据在模型梯度空间中的动态结构许多原本模糊的问题开始变得可测量、可优化。当然这项工作也有其边界。当前实验集中在预训练阶段的decoder-only 模型DoGraph 在指令微调、强化学习对齐等阶段的效果还有待验证。梯度的计算和存储在超大规模千亿参数级训练中仍是工程挑战。这些也许正是接下来值得继续探索的方向。大模型的下半场数据不再只是“原材料”而是可以被精细调度、动态感知、持续优化的训练信号。OpenCSG 发表这篇论文是把长期积累的数据工程实践推向基础方法研究的一次探索——也是对“高质量数据如何真正转化为模型能力”这个核心命题给出的一份认真的学术回答。论文链接arxiv:2604.07963——Rethinking Data Mixing from the Perspective of Large Language ModelsACL 论文链接aclanthology.org/2026.a行业标杆地位的验证OpenCSG发布的FineWeb-Edu-Chinese作为全球下载量排名前三的中文预训练数据集,累计下载超百万次其价值已经得到业界广泛认可:学术领域被**斯坦福大学、清华大学、中国人民大学高瓴人工智能学院、上海人工智能实验室、北京智源研究院等 20 余家顶尖机构的论文引用。旗下 Chinese Fineweb Edu 已成为中文 NLP 研究的核心数据资源被 100 篇学术论文引用在 NeurIPS、ACL、EMNLP、ICLR 等国际顶会及 Nature 子刊、JMLR 等权威期刊中作为核心实验数据集支撑大模型预训练、指令微调等前沿研究合作机构还包括鹏城实验室、西南电子技术研究所、西班牙国家级超算中心Barcelona Supercomputing Center及 Mozilla Data Collective**等全球顶尖科研单位。产业应用:支撑 Llama3-Chinese、DeepSeek 等知名模型训练并被中国移动、中国联通、英伟达NVIDIA、苹果公司Apple Inc.、OPPO、美团、阿里巴巴、蚂蚁集团、面壁智能ModelBest、Krafton等领军企业采用。Chinese Fineweb Edu 已从实验室走向产业场景为创业公司到头部企业的研发团队提供可靠支撑切实推动中文 NLP 应用从理论落地到生产实践。生态影响:下载数量累计超百万次数据体量达 2.42TB覆盖 9.57 亿条高质量文本已孵化出 10 余个垂直领域微调模型。同时OpenCSG 通过开源打分模型和完整工具链输出数据治理方法论带动行业从“模型参数内卷” 转向 “数据基建完善”显著降低中小开发者与研究机构的入门门槛。开源生态OpenCSG 坚持**“开源即文化”**的理念通过透明、共创、共享的社区文化与全球开发者、工程师和 AI 原生企业共同构建智能体生态。关于OpenCSGOpenCSG是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps是人工智能领域的一种AI原生方法论由OpenCSG开放传神提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。

相关新闻

BeeWorks厂商服务能力深度调研:从技术自主到长期运维的全面评估

BeeWorks厂商服务能力深度调研:从技术自主到长期运维的全面评估

选择私有化部署即时通讯,为什么必须深挖厂商的服务能力?企业选择私有化的企业IM,不是在购买一个标准软件,而是在选择一个长期的技术合作伙伴。部署实施、系统集成、定制开发、信创适配、长期运维——每一个环节都考验着即时通讯软…

2026/7/31 21:13:07阅读更多 →
League Akari:英雄联盟自动化工具终极指南与实战配置

League Akari:英雄联盟自动化工具终极指南与实战配置

League Akari:英雄联盟自动化工具终极指南与实战配置 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit League Akari(又名…

2026/7/31 21:11:07阅读更多 →
KMS_VL_ALL_AIO:企业级系统激活的智能化解决方案

KMS_VL_ALL_AIO:企业级系统激活的智能化解决方案

KMS_VL_ALL_AIO:企业级系统激活的智能化解决方案 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 在数字化的今天,无论是个人用户还是企业组织,都面临着软件授…

2026/7/31 21:11:07阅读更多 →
古典密码学核心:置换与代换原理及Python实战解析

古典密码学核心:置换与代换原理及Python实战解析

1. 项目概述:从“密信”到“比特流”的古典密码之旅最近在整理一些历史遗留的旧项目代码,翻出来一个早年写的、用于教学演示的古典加密算法工具箱。看着那些用凯撒、维吉尼亚、栅栏加密过的字符串,突然觉得挺有意思。在当今这个AES、RSA、ECC…

2026/7/31 22:27:36阅读更多 →
Python中文分词利器jieba:从入门到实战的完整指南

Python中文分词利器jieba:从入门到实战的完整指南

1. 项目概述:为什么我们需要jieba?在中文世界里处理文本,第一道坎往往不是复杂的算法,而是最基础的“分词”。想象一下,你拿到一篇没有空格的中文文章,比如“我爱自然语言处理”,计算机怎么知道…

2026/7/31 22:27:36阅读更多 →
从零到大师:3步实现Stable Diffusion油画风格迁移,附赠12种经典画派Prompt词库(限免24小时)

从零到大师:3步实现Stable Diffusion油画风格迁移,附赠12种经典画派Prompt词库(限免24小时)

更多请点击: https://intelliparadigm.com 第一章:AI生成油画画效果 AI生成油画效果已成为数字艺术创作的重要技术路径,其核心在于将普通照片或图像通过深度学习模型(如风格迁移网络、扩散模型)映射为具有笔触质感、颜…

2026/7/31 22:27:36阅读更多 →
C# Excel Interop 深度指南:从基础操作到高级图表与资源管理

C# Excel Interop 深度指南:从基础操作到高级图表与资源管理

1. 项目概述:为什么选择 Interop 来操作 Excel?在 C# 项目中处理 Excel 文件,开发者面前通常摆着好几条路:用开源的 NPOI、EPPlus,或者用微软官方的 Open XML SDK,再就是我们今天要深入聊的Microsoft.Offic…

2026/7/31 22:27:36阅读更多 →
Java转大模型:我的Agent项目上线第一天就崩了,权限配置是最大坑

Java转大模型:我的Agent项目上线第一天就崩了,权限配置是最大坑

如果你正准备往大模型方向转,《Java转大模型实战,第一道门槛可能不是算法》这类问题别只看热度。更重要的是判断自己该补哪块能力,以及怎么证明你真的会。摘要从Java后端转大模型开发,很多人以为要先啃数学和算法,其实…

2026/7/31 22:27:36阅读更多 →
Unity数据驱动UI框架OpenGUI:告别拖拽绑定,拥抱声明式开发

Unity数据驱动UI框架OpenGUI:告别拖拽绑定,拥抱声明式开发

1. 项目概述:为什么Unity开发者需要OpenGUI?如果你在Unity里做过稍微复杂一点的UI,比如一个带有多级菜单、动态列表和状态切换的游戏设置界面,你大概率经历过这样的痛苦:在Hierarchy里拖拽几十个GameObject&#xff0c…

2026/7/31 22:25:35阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/31 20:44:05阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/31 17:41:43阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/31 20:44:05阅读更多 →
物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:40阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:41阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:41阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/31 0:49:33阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/31 5:08:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/31 16:02:17阅读更多 →