微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 中国人民大学、上海交通大学与上海人工智能实验室联手:让AI自己决定"今天吃什么数据",训练效率提升66%

中国人民大学、上海交通大学与上海人工智能实验室联手:让AI自己决定"今天吃什么数据",训练效率提升66%

2026-06-25 16:11
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-25 16:11 科技行者

这项由中国人民大学、上海交通大学、上海人工智能实验室、中国电子科技集团公司第十五研究所以及LiblibAI联合开展的研究,发表于2026年第43届国际机器学习大会(ICML 2026),地点在韩国首尔,论文编号为arXiv:2505.23878。有兴趣深入了解的读者可以通过该编号查阅完整论文。

**大模型的"偏食"问题**

每个孩子都经历过偏食的阶段——喜欢吃糖果,不爱吃蔬菜。然而家长和营养师都知道,均衡饮食才能让孩子真正健康成长。训练大型语言模型(就是ChatGPT这类AI),其实面临着一模一样的困境。

互联网上的文字数据浩如烟海,有百科全书、新闻报道、编程代码、学术论文、小说故事、法律文件……训练AI时,究竟该喂多少新闻、多少代码、多少小说,这个比例的调配,就像给孩子安排一日三餐的营养配比,直接决定了AI最终能学到什么、能做什么。

传统做法是在训练开始之前,由研究人员根据经验或简单计算,提前确定好各类数据的比例,然后整个训练过程就按这个固定菜单进食,直到结束。这就好比在孩子出生的那一天,家长就给接下来十八年的每一顿饭全部排好菜单,完全不考虑孩子不同成长阶段的营养需求变化。不难想象,这种"一刀切"的做法会留下不少遗憾。

而这项研究提出的方法,叫做**AC-ODM(Actor-Critic Online Data Mixing,演员-评论家在线数据混合)**,核心思路就是让AI在训练过程中,根据自己当前的"消化吸收状况",实时动态调整接下来吃哪类数据、吃多少。更妙的是,这套系统还能从一个"小AI"身上学到经验,然后把经验迁移给真正要训练的"大AI",既省钱又高效。

**一、从"固定菜单"到"智能点餐":数据混合问题的前世今生**

在AI训练领域,数据混合策略一直是个核心难题。早期的研究,包括DoReMi、DoGE、RegMix、CHAMELEON等方法,都属于"静态策略"阵营。它们的共同特点是:在训练开始之前,通过各种方式(比如训练一个小的代理模型来估算各类数据的重要性,或者用数学公式计算不同数据之间的关联度)确定好一个固定的数据配比,然后整个训练过程就照此执行,不再改变。

这类方法有其合理性——毕竟提前做好规划总比毫无章法强。但问题在于,AI在训练过程中的状态是不断变化的。训练初期,AI对所有知识都很陌生,什么都需要;训练中期,它已经掌握了一些基础,某些类型的数据可能变得更有价值;训练后期,它可能在某些方向上已经"吃饱"了,继续喂同类数据收益递减。固定菜单无法捕捉这种动态变化,就像给正在长个子的青少年还按照婴幼儿的配方调配营养,显然不合时宜。

于是,研究者开始探索"动态策略"。ODM(Online Data Mixing)采用了类似"多臂老虎机"的方式——把不同类型的数据当成不同的老虎机,根据每次"拉杆"(喂数据)的反馈,动态调整下次选哪个。PiKE则关注不同数据类型的梯度冲突问题(梯度可以理解为AI在学习时大脑中产生的"思维方向"),当两类数据让AI产生相反的"思维方向"时,就降低冲突严重的那类数据的比例。

这些动态方法比静态方法效果更好,但仍有明显不足:要么计算开销太大,要么灵活性不够,难以同时适应"从零开始训练"和"使用预先准备好的数据集"这两种截然不同的应用场景。AC-ODM正是为了同时解决这些问题而诞生的。

**二、强化学习登场:让一个"智能经纪人"来决定今天吃什么**

AC-ODM的核心思路来自强化学习——这是AI领域中一种让机器通过不断尝试和获取反馈来学会做决策的方法,AlphaGo打败围棋世界冠军就用到了类似原理。

在AC-ODM的框架里,整个大模型训练过程被设计成一个"环境",就像一个游戏世界。在这个世界里,有一个专门的"智能经纪人"(也叫策略代理),它的任务只有一个:根据当前大模型的状态,决定接下来从哪些类型的数据中各取多少来组成这一批训练数据。

这个"智能经纪人"由两部分组成,就像一家公司里的两种角色。"演员"(Actor)负责做出实际决策,具体说就是输出各类数据的采样权重——"这一批训练数据,百科文章占30%,代码占25%,新闻占15%……"。"评论家"(Critic)则负责评估演员做出的决策到底有多好,就像公司里的审计部门,给演员的每个决策打分,让演员知道哪些决策值得坚持、哪些需要改进。两者相互配合,共同迭代进步,这正是"演员-评论家"框架名称的由来。

经纪人在做决策时,需要了解大模型当前的"身体状况",也就是训练状态。AC-ODM设计了一套信息采集方案:收集当前训练到第几步了、每类数据分别见过多少次、每类数据当前的损失值是多少(损失值可以理解为AI在这类数据上还有多少"不懂的地方")、损失值相比上一步变化了多少、大模型里某些关键层的权重大小以及这些权重的变化幅度。这六类信息组合在一起,就构成了经纪人观察大模型状态的"传感器"。

在大模型吃下一批数据之后,它的"大脑"(也就是模型参数)就会根据数据进行调整。AC-ODM会在此时计算一个"奖励信号",告诉经纪人这次的数据配比选得好不好。这个奖励信号的设计极为精妙,也是整个研究最核心的创新之处。

**三、"梯度对齐":好的数据配比究竟好在哪里**

要理解AC-ODM的奖励机制,可以用一个"团队协作"的比喻来理解。

AI在学习每一类数据时,都会产生一个"学习方向"(在数学上叫做梯度向量)。这个方向指示着模型参数应该往哪里调整才能在这类数据上表现更好。把所有类型数据的学习方向加权合并,就得到了最终的参数更新方向。

现在关键问题来了:如果百科文章的学习方向指向东北,代码的学习方向指向西南,新闻的学习方向指向正东,这三个方向叠加在一起,很可能互相抵消,最终走出来的合力方向既不远又不确定。但如果百科文章、代码和新闻的学习方向都大致朝着同一个方向,合力就会非常强大,每一步的学习效果都会事半功倍。

AC-ODM的奖励信号衡量的正是这种"方向一致性"。对于每一类数据,它会计算这类数据的学习方向与所有其他类数据学习方向之和的点积(可以理解为两个向量"志同道合"的程度)。如果一类数据的学习方向与其他数据的整体方向高度一致,说明这类数据正在"助攻"其他数据的学习,奖励就高;反之,如果一类数据的学习方向与其他数据相悖,说明它在"拖后腿",奖励就低。

经纪人的目标就是最大化这种"团队协作度",通过调整各类数据的权重,让每次训练时的合力尽可能强大。研究团队从数学上严格证明了:这种奖励机制实际上是在最大化参数更新幅度的平方(用论文中的术语说,就是最大化Gram矩阵谱的交叉项能量),相当于在每一步都让AI走尽可能大的有效学习步伐。

为了防止奖励信号剧烈波动导致经纪人不稳定,研究团队还为奖励值设计了一个"指数移动平均"的平滑机制,同时用每类数据已被采样的频率来做重要性修正,避免经纪人陷入"只不停地选最常见类型数据"的懒惰陷阱。

**四、两种工作模式:适配不同训练场景**

AC-ODM针对现实中两种截然不同的训练场景,设计了两种工作模式,就像一款多功能工具箱,既有精密仪器也有万能扳手。

第一种叫做"非代理模式",也称端到端模式。在这种模式下,经纪人和大模型从零开始同步训练。大模型每吃一批数据,经纪人也同步更新自己的决策策略。这种模式不需要任何预先准备,适合从头开始训练、数据集随时可能新增或变化的场景。它的计算开销极小,几乎不比普通训练多花时间。

第二种叫做"代理模式",也称策略迁移模式。这种模式的思路更加巧妙:先用一个参数量小得多的"代理模型"(比如一个4亿参数的小模型)来训练经纪人,让经纪人在小模型上充分探索和学习,掌握数据配比的规律;然后把训练好的经纪人的策略"冻结"(不再更新),直接移植到真正要训练的大模型上使用。大模型从第一步开始就能享受到成熟经纪人的"专业建议",完全跳过了经纪人自我探索的笨拙早期阶段。

这种设计的经济账非常划算:在小模型上训练经纪人的成本远远低于在大模型上"试错"的代价。以实验中的配置为例,用4亿参数的小模型训练好经纪人之后,10亿参数的目标大模型只需要原本所需训练步数的28.82%,就能达到对比基准方法的最终效果。即便把小模型的训练成本算进去,整体效率提升依然非常显著。

**五、实验结果:数字背后的故事**

研究团队在两个主流数据集上进行了大量实验,一个是"The Pile"(825GB,包含22种不同来源的文字,从YouTube字幕到学术论文、GitHub代码库),另一个是"SlimPajama"(6720亿词,包含7个领域)。目标模型主要是10亿参数规模的Pythia架构,同时还在LLaMA风格的模型上做了验证。

在验证集困惑度(衡量模型对文字的"理解难度",数值越低越好)方面,代理模式的AC-ODM表现最为突出。在The Pile数据集上,AC-ODM-410M(用4亿参数代理模型训练的策略)实现了比对比基准方法ODM快66%的收敛速度——换句话说,ODM需要跑完全程才能达到的最好成绩,AC-ODM在跑完三分之一时就已经超过了。与静态方法CHAMELEON相比,AC-ODM验证困惑度低了20.7%;与另一个动态方法PiKE相比,AC-ODM也有明显优势。在SlimPajama数据集上,AC-ODM-410M同样展现出类似的规律,比均匀分配策略快73%达到对比基准的最佳困惑度。

在22个具体文字域的测试困惑度表现上,AC-ODM-410M在22个域中的17个取得了最低困惑度,全面优于PiKE和CHAMELEON。尤其值得关注的是,AC-ODM在小规模和中规模的专业域(比如DM数学)上的提升最为显著,但在大规模通用域(比如Pile-CC网页文本)上也保持了竞争力,说明它既不偏科也不放弃主科。

在面向真实世界任务的下游评测方面,AC-ODM-410M的优势更为突出。在MMLU(一个覆盖STEM、社会科学、人文和其他领域的综合知识测试)的零样本(不给任何提示直接回答)评测中,AC-ODM-410M得分0.29980,而对比方法ODM只有0.23514,提升幅度达27.5%。五样本(给五道例题再回答)评测中,AC-ODM-410M得分0.35215,ODM只有0.28416,提升幅度23.9%。在HumanEval(编程能力测试,看模型能否写出正确的代码)的pass@1指标上,AC-ODM-410M得分0.72644,ODM只有0.32510,提升幅度高达2.23倍。

这里有个很有意思的细节:AC-ODM在代码生成上取得的巨大进步,并不是简单地"把GitHub代码数据的权重调高了"换来的。通过查看训练过程中各个域的权重变化轨迹,研究团队发现,AC-ODM实际上调高了StackExchange(技术问答社区)和若干高质量通用域的权重,而GitHub代码库本身的权重反而有所下降。这说明AC-ODM的提升来自于更好的全局优化和可迁移的推理能力,而不是走捷径专门堆码量。

在计算效率方面,非代理模式的AC-ODM每步平均耗时2.48秒,对比ODM的2.47秒,额外开销不足0.4%,内存占用只增加约2%,可以说几乎可以忽略不计。而PiKE每步耗时2.53秒,额外开销约2.4%,是AC-ODM的六倍。从端到端的角度看,非代理AC-ODM比ODM减少了31.95%的训练步数,实现了1.46倍的整体加速,优于PiKE的1.30倍加速。

研究团队还在LLaMA风格的0.9B模型上验证了AC-ODM的通用性。结果显示,AC-ODM在这种与Pythia完全不同的架构上同样有效,代理模式比原始数据权重方案快65%达到目标困惑度,比非代理AC-ODM快53%。相对提升幅度比在Pythia上略小,原因是LLaMA风格的模型本身设计更先进,留给数据混合策略发挥的"余地"更少,但效果的方向始终一致。

**六、数据域的"个性分析":哪类数据在涨价,哪类在跌价**

研究团队详细分析了训练过程中各个数据域权重的动态变化,呈现了一幅颇为直观的图景。

整体规律是:在训练前约1.5万步,域权重经历了剧烈的动态调整;之后逐渐趋于稳定,但始终保持轻微的波动,对大模型的状态变化保持响应。相比之下,ODM算法在完成约五分之一训练后权重就几乎不再变化,缺乏后期的灵活性。

从具体域的走势来看,那些文字质量高、知识覆盖广的通用性域,无论初始比例大小,权重都趋于上升。比如HackerNews(技术社区讨论)、Gutenberg PG-19(公版图书)、BookCorpus2(书籍语料)、StackExchange(技术问答)和USPTO Backgrounds(专利说明书背景部分)都获得了持续的权重提升。与此相反,那些噪音较多或高度专业化的域则经历了明显的权重下降,比如Enron Emails(商务邮件)、DM Mathematics(数学题集)、Wikipedia(英文维基百科)、Github(代码库)和FreeLaw(法律判决文书)、PubMed Central(医学论文)都在这一列。

这与人类的学习直觉非常吻合:在构建通用语言能力的早期阶段,高质量的叙事性和讨论性文本最有助于建立广泛的语言基础,而高度格式化或极度专业的文本(数学公式、代码、法律文书、医学论文)在这个阶段的"营养价值"相对有限。

**七、细节实验:每个设计选择都有其道理**

研究团队通过一系列消融实验(逐一去掉某个设计要素,观察效果变化)验证了AC-ODM各个组成部分的必要性。

状态信息的六个组成部分中,去掉任何一个都会导致性能下降。其中,去掉"每个域当前的损失值"和"去掉所选层的权重L2范数"带来的损失最大,困惑度分别上升了6.38%和6.48%。这说明大模型当前在各个域上的"不会程度"以及大模型整体的"体量状态",是经纪人做出准确决策最不可或缺的信息。相比之下,去掉"样本计数"和"训练步数"的影响较小,但仍然不可忽视。

计算奖励信号时,用哪些层的梯度来代表整个模型,也经过了仔细筛选。实验结果显示,使用第12、14、16层的前馈网络块(一共包含约5033万个参数)效果最好,优于使用14、15、16层(相邻晚期层)、6、8、10层(中间层)或1、2、3层(早期层)。整体差异不算特别大,说明AC-ODM对具体层的选择有一定鲁棒性,但晚期和中期层的表征质量总体上更适合作为奖励估计的代理。

代理模型的大小对最终效果也有显著影响。用7000万参数的小模型训练的策略效果最差,说明代理模型太小就没有足够的"见识"来学会有效的数据配比经验。用1.6亿参数的代理模型效果已经很接近4.1亿参数的代理模型,尤其在训练早期。4.1亿参数的代理模型在全程保持略微更好的表现。研究团队预计,对于比10亿参数更大的目标模型,代理模型大小带来的差异会更加明显,留待未来研究进一步探索。

关于策略模型(经纪人的演员和评论家网络)自身的大小,实验表明,策略模型达到目标大模型参数量的0.25%-0.5%时效果最好,继续增大并不带来额外提升,而太小(低于0.15%)则会明显欠拟合。这意味着AC-ODM在实践中只需要一个微小的附加模型,就能实现显著的效率提升。

**八、域粒度的影响:越细分越有效**

研究团队还专门研究了数据域的划分粒度对AC-ODM效果的影响。他们把The Pile的22个域合并为11个和5个,在相同条件下训练,观察困惑度变化。

结果非常明确:域划分越粗糙,效果越差,而且这种下降在训练早期和中期尤为明显。22个域时,训练到20,832步时困惑度为13.43;11个域时为13.85;5个域时为14.09。这个规律还解释了为什么AC-ODM在The Pile上(22个域)的提升明显大于在SlimPajama上(7个域)的提升。

背后的原因很直观:当两个本来代表不同知识来源的域被合并到同一个"桶"里时,它们内部的正向梯度关系和负向梯度关系就会在桶内相互抵消,导致奖励信号变得模糊,经纪人无法准确识别哪类数据真正在"助攻"当前学习。就像把厨房里所有的调味料都混在一个瓶子里,厨师就无法精准调味了。因此,AC-ODM在实践中最好配合保留了足够区分度的域分类体系使用。

**九、规模扩展:向更大模型进发**

研究团队还初步验证了AC-ODM在更大规模模型上的有效性。用10亿参数的Pythia作为代理模型,训练好策略后迁移给120亿参数的Pythia-12B目标模型,结果显示AC-ODM在整个训练过程中持续优于ODM,而且优势幅度相当大——在20,832步时,ODM的困惑度是7.32,而AC-ODM已经降到了4.24。这提示更强的代理可以学到对更大目标模型同样适用的策略,代理模式的价值会随着目标模型规模的扩大而愈发凸显。

在更大的LLaMA风格模型(30亿和70亿参数)上,非代理AC-ODM同样展现出随模型规模增大而困惑度持续下降的良好趋势,分别在20,832步时达到10.59和8.79,表明AC-ODM的有效性不依赖于某个特定的参数量级。

**说到底,这项研究告诉我们什么**

归根结底,AC-ODM解决的是一个听起来朴素但实则深刻的工程问题:在用海量数据训练AI时,数据的"吃法"和"菜单"本身,比单纯增加数据量或计算量更值得投入精力。通过把这个"配餐"决策交给一个专门学习此道的强化学习代理,并给代理一个有坚实数学基础的奖励信号——鼓励各类数据的学习方向互相"顺风"而不是"顶风"——AI的训练效率和最终能力都得到了显著提升。

对于普通人来说,这项研究的意义在于:未来我们使用的各种AI产品,有可能在同样的时间和电力消耗下,拥有更强的知识广度和推理能力。而对于从事AI开发的团队,这套方法提供了一个计算成本几乎可以忽略不计的优化手段,能够在不增加硬件投入的前提下,将训练效率提升一到两倍。

当然,AC-ODM也有自身的局限。它的前提是数据能够被有意义地划分成若干域,如果数据集本身高度混杂、无法清晰分域,奖励信号的质量就会受影响。代理模式依赖于策略在不同规模模型之间的可迁移性,目前的验证主要集中在同一架构家族内,跨架构迁移还有待更多研究。此外,AC-ODM优化的是现有数据的混合比例,而不是数据本身的质量,它应当与数据清洗和筛选工作配合使用,而非替代后者。

感兴趣的读者如果想深入了解这项工作的数学推导、完整实验设置和更多消融分析,可以通过编号arXiv:2505.23878查阅完整论文。

---

Q&A

Q1:AC-ODM和普通的静态数据混合方法有什么本质区别?

A:静态数据混合方法在训练开始前就确定好各类数据的固定比例,整个训练过程不再改变。AC-ODM则是实时监测大模型的训练状态,通过一个强化学习代理在每一步动态调整各类数据的采样比例,让数据配比跟上模型的成长节奏。关键在于AC-ODM的奖励信号——它衡量的是不同数据类型的学习方向是否互相"助攻",从而每步都能最大化有效学习步幅,这是静态方法根本做不到的。

Q2:AC-ODM的代理模式为什么能用小模型训练的策略来指导大模型?

A:核心依据是不同规模模型在面对同一批数据时,各类数据之间的梯度关系(学习方向的相互关联)具有跨规模的相似性。小模型和大模型虽然参数量差异巨大,但面对"百科知识与代码哪个更互补"这类问题时,得出的规律是相近的。实验结果支持了这一假设:用4亿参数小模型训练的策略迁移到10亿参数大模型后,效果显著优于大模型自己从零摸索。

Q3:AC-ODM额外增加的计算开销有多大,普通实验室能用吗?

A:非常小。在10亿参数模型的训练中,AC-ODM每步仅增加约0.4%的时间开销(2.48秒对比ODM的2.47秒),内存只多占约2%。经纪人网络的参数量仅为目标大模型的约0.25%到0.5%,是一个只有1700万参数的小型全连接网络。奖励计算只用到大模型中三个特定层的参数,约5000万个,而不是全部10亿参数。因此,任何能训练10亿参数大模型的计算环境,都能直接运行AC-ODM,无需额外硬件投入。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-