
这项由香港大学、腾讯混元大模型团队以及香港中文大学联合开展的研究,发表于2025年的国际学习表示会议(ICLR 2025),论文预印本编号为arXiv:2606.14971,发布于2026年6月。研究提出了一种名为FASTMIX的全新数据混合优化框架,彻底改变了大型语言模型训练数据配比的方式。
做过烘焙的人都知道,同样的食材,配比稍有不同,蛋糕的口感就会天差地别。做出一个完美的蛋糕,面粉、糖、黄油、鸡蛋的比例至关重要——多一点甜,少一点油,结果可能判若云泥。训练一个强大的AI大模型,其实面临着完全相同的困境:数据的配方决定了模型的成色。来自不同领域的数据——新闻、代码、科学文献、对话记录——各自有多少,直接影响着最终训练出来的AI有多聪明、多全面。
问题在于,没有人知道那个"完美配方"究竟是什么。而找到这个配方的代价,一直以来都贵得令人咋舌。
一、为什么配方这么难找
以现有的主流方法为例,有一种叫做RegMix的方案,它的思路是穷举尝试:先训练512个小型"试验版"AI,每个用不同的配比方案,然后观察哪种配比的小AI表现最好,再把这个比例推广到大模型上。这就好比你要找最完美的蛋糕配方,于是烤了512炉不同比例的蛋糕,逐一品尝比较。听起来很合理,但代价是耗费720个GPU小时——这是一个相当沉重的计算账单,对于大多数团队而言几乎是不可承受的。
另一种改进方案叫CLIMB,它聪明一些,采用迭代缩小搜索范围的策略,把需要训练的小模型数量压缩到64个,耗时约72个GPU小时。相比RegMix已经快了很多,但距离"实用"还差得远。还有DoReMi这样的动态调整方案,它不预先搜索,而是在训练过程中实时调整配比,速度虽快,但稳定性和最终效果往往不如前两者。
正是面对这一困境,FASTMIX诞生了。它的核心承诺是:只需训练一个代理模型,耗时1.3个GPU小时,就能找到比那512个模型集体投票还要好的数据配方。
二、配方搜索的数学变形术
要理解FASTMIX为什么能做到这一点,需要先理解它做了一件什么样的"变形魔术"。
传统的数据配比优化,本质上是个"先后嵌套"的问题:外层你想找最好的配比,内层你要用这个配比把模型训练好,然后看结果好不好,再回头调配比。这就像做蛋糕时,每次调完配方都要把蛋糕从头烤到尾,才能知道改动好不好。这个过程之所以无法用数学梯度直接优化,是因为"配比"这个操作本质上是一个采样决策——从哪个数据池里抽数据——这种随机抽取的行为没有光滑的数学曲面可以攀爬,所以无法用常规的梯度下降法直接求解。
FASTMIX的关键洞察在于一个精妙的等价变换。研究团队证明,"按照不同比例从不同数据源随机抽取数据训练"和"从所有数据源均等地抽取数据,但对不同来源的数据给予不同权重的损失值",这两件事在数学期望上是完全等价的。
用烘焙来打比方:原来的方式是调整每种原料的"用量",而新方式是每种原料都加同样多,但给它们不同的"重要性权重"——面粉的失误要扣10分,而糖的失误只扣1分。这两种方案对最终调出的"最优配方信号"是一样的,但后者的好处是,那个"权重"是一个连续的数字,可以对它求导数,可以用梯度下降法来优化。这样一来,找最优配比就变成了一个普通的优化问题,可以和模型参数一起、同时用梯度下降来求解,整个搜索过程被嵌入到了单次模型训练里。
三、配方与厨艺同步精进
把配比问题变成可微分的形式之后,FASTMIX采用了一种"内外双循环交替优化"的策略来具体求解。
内循环负责"练厨艺":给定当前的数据配比权重,用这个配比训练模型若干步,让模型参数朝着更好的方向更新。外循环负责"调配方":用已经更新过的模型在验证集上评估效果,根据反馈来更新数据配比权重——哪个数据来源的训练信号和验证集上的改进方向一致,就给它更高的权重;哪个来源的信号和验证改进方向相反,就降低它的权重。
研究团队还推导出了外循环梯度更新的一个简洁闭合公式。当外循环只走一步时,数据配比对验证损失的梯度,等于"验证集上的梯度"和"该数据源训练梯度"的点积,再乘以一个负的学习率。点积的正负揭示了一切:如果某个数据源的训练方向和验证集期望的改进方向一致(点积为正),那么这个梯度就是负的,下降一步就会增大该来源的权重;反之则减小权重。本质上,算法在自动识别并奖励那些"真正对目标有帮助"的数据来源。
这个公式的另一大优势在于计算代价极低,不需要进行反向传播穿越多个时间步,避免了内存爆炸的问题,也不需要有限差分等噪声很大的近似方法。
四、防止把配方"过度优化"
单纯优化验证集表现会带来一个经典风险:模型(以及配比)可能会"背题",即对验证集上的特殊模式过度拟合,导致在真实世界的其他任务上表现下降。FASTMIX针对这个问题提出了两项互补的改进。
第一项是熵正则化。熵是衡量"分散程度"的一个指标,一个数据配比如果把所有权重都集中在一个来源上,它的熵就很低;如果各来源权重均匀分布,熵就很高。FASTMIX在优化目标里加入了一个惩罚项,惩罚过于集中的权重分布,引导算法倾向于保留多样化的数据来源。这就像厨师提醒自己:即便某种调料非常好用,也不能完全靠它,饮食均衡才是长久之道。
第二项是把训练损失也纳入优化目标。验证集反映的是"样本外泛化能力",训练损失反映的是"对整体数据的拟合程度",两者结合使用,能够减少对有限验证数据的过度依赖,引导搜索找到在更广泛任务上都能表现稳健的配比方案。
最终的搜索目标函数包含三个部分:验证损失、乘以一个权重系数的训练损失(实验中最优系数约为0.1),以及乘以一个很小系数(约十的负五次方)的熵正则化项。这个联合目标在多个实验场景中都展现出了显著更强的泛化能力。
五、预训练场景:14个基准测试全面领先
研究团队首先在大模型预训练场景下验证了FASTMIX的效果。实验沿用了学界广泛采用的"Pile"数据集,这是一个覆盖17个不同文本领域的大型数据集,包括网页文章、科学论文、代码、法律文本等。研究团队先用小型代理模型(约100万参数)做配比搜索,找到配方后,再用这个配方训练一个10亿参数的正式模型,在包括社会常识推理、语言理解、阅读理解、逻辑推理等14个下游基准测试上评估效果。
结果相当直接:FASTMIX的平均得分为48.2,位列第一,在14个测试中的9个上拿到了单项第一。CLIMB排名第二,平均分47.5;RegMix排名第三,平均分47.2。更引人注目的是时间对比:FASTMIX只用了1.3个GPU小时,CLIMB需要71.9个GPU小时,RegMix需要720.5个GPU小时。换算一下,FASTMIX比CLIMB快了约55倍,比RegMix快了约550倍。而且它不仅更快,效果还更好,这打破了人们通常认为"快就意味着要牺牲质量"的直觉。
六、后训练场景:数学配方意外精通写代码
预训练阶段的成功只是一半。研究团队进一步在"后训练"(即监督微调,SFT)场景下测试了FASTMIX,这个场景更贴近实际应用,难度也更大。
具体设置是:以千问2.5数学专用7B模型为基础,从8个不同领域收集监督微调数据,包括数学推理数据集(OpenR1-Math-220k)、编程相关数据(OpenThoughts-114K的代码子集)、对话数据(ShareGPT)以及理工科综合问答数据(Platypus)等。搜索时使用1.5B参数的小版本千问模型作为代理,以两个数学基准测试(小学奥数水平的GSM8K和高考英语数学gaokao2023en)的加权得分作为优化目标。然后,把找到的配比方案迁移到7B的大模型上评估。
评估的范围则刻意延伸到了优化目标之外:除了数学测试(MATH数据集和2024年美国数学邀请赛AIME-24),还测试了编程能力(LiveCodeBench-v2)和理工科研究生水平问答(GPQA-Diamond)。
FASTMIX的平均得分65.4,领先第二名CLIMB整整5.5分(CLIMB为59.9分)。更值得关注的是,FASTMIX在数学之外的编程和理工科问答任务上同样拿到了最高分。这说明它找到的配方不是针对特定考试的"应试配方",而是一种能够提升模型综合能力的"全营养配方"。与此同时,FASTMIX只用了2.2个GPU小时,而RegMix和CLIMB各自需要115到117个GPU小时,效率差距约52倍。
后训练场景还暴露出了现有资源密集型方法的一个实际困境:在工业环境中,1B参数的代理模型已经不再"小",支持数百次这样规模的训练运行不现实,而FASTMIX只需一次,天然绕开了这个瓶颈。
七、工程实践中那些"没人告诉你"的坑
研究团队专门用一节内容分享了他们在实际工业项目中踩过的坑,这些经验往往不会出现在学术论文的主体部分,却对真正落地应用极其重要。
关于非连续优化目标:FASTMIX的核心依赖于目标函数可以求导数。但现实中,验证集上的评估指标往往是"答对了几道题"这样离散的计数,没有导数可言。研究团队的解决方案是用模型的训练损失(一个连续的数值)作为代理指标,实践证明效果很好。他们也尝试过用有限差分等方法来估算离散目标的"近似导数",但结论是:在工业数据上,这类方法几乎无法收敛,噪声极大,不推荐使用。
关于外循环步数:理论上可以让外循环走多步再更新配比权重,但这样就无法直接用那个简洁的闭合公式,必须借助反向传播穿越多个时间步(类似于循环神经网络训练中的BPTT),内存消耗会急剧上升,在大模型场景下不现实。研究团队的建议是始终将外循环步数固定为1,这不仅计算高效,实验表明也能给出最稳定的优化效果。
关于正则化的局限性:熵正则化在干净的学术数据集上效果明显,但在复杂的工业数据集上效果有限。更鲁棒的方案是直接对各个数据来源的采样比例设置硬性上下界约束,例如规定任何单一来源的上采样倍数不超过原始大小的三倍,这种约束比软性的熵惩罚更可靠。
关于代理模型的规模:使用参数量小于5亿的超小模型做代理时,要格外谨慎。研究团队发现,过小的模型本身训练不稳定,给出的配比推荐方案噪声很大,这与算法本身无关,是模型规模带来的固有问题,即便换成RegMix也一样。此外,小模型和大模型的结构差异会带来对不同数据来源的偏好差异,导致迁移效果打折。
关于搜索目标数据的长度匹配:这是一个容易被忽视的技术细节。预训练数据的序列通常很长,而监督微调数据的序列通常很短。当用短序列数据计算的梯度来引导预训练配比时,两者的梯度方向会严重偏离,导致算法失效。解决方案简单有效:把多条短序列拼接在一起,使其长度接近预训练序列的长度,梯度的可比性就能恢复正常。
归根结底,FASTMIX做的事情是把一个原本需要花几百小时、训练几百个模型的昂贵配方搜索过程,压缩成了一件和正常训练同步进行的副产品——你在训练模型的同时,配方也在自动优化。这不仅仅是效率上的提升,更是让数据配比优化这件事从"只有巨型实验室才能负担得起"变成了"普通团队也能做"。
当然,任何方法都不是万能的。FASTMIX的外循环每次只走一步,这让它在嘈杂的数据环境下有些脆弱,略显急于求成。研究团队也观察到一个有趣的现象:不同数据来源的重要性会随着训练时间的推移而动态变化,某些来源在训练早期至关重要,而另一些则要等到模型足够成熟才开始发挥作用——这个发现暗示着数据配比本身或许不应该是一个静态的答案,而是一个动态的课程,这也是未来研究的一个方向。
对于关心AI大模型发展的读者而言,FASTMIX代表的是一种更民主化的可能:降低找到好配方的成本,让更多团队能够进行高质量的模型训练实验。有兴趣深入了解技术细节的读者可以通过预印本编号arXiv:2606.14971查阅完整论文,或访问论文附带的开源代码仓库github.com/hrtan/fastmix获取实现代码。
Q&A
Q1:FASTMIX和RegMix、CLIMB相比,为什么能快这么多?
A:根本原因在于FASTMIX不需要训练多个代理模型。RegMix要训练512个小模型来覆盖不同的配比方案,CLIMB优化后也需要64个。FASTMIX通过数学等价变换,把配比搜索变成了一个和模型训练同步进行的优化过程,只需要一个代理模型,把配比权重直接当作可求导的参数来更新,所以从几百小时压缩到了一两个小时。
Q2:FASTMIX找到的数学训练配方为什么能提升编程能力?
A:这说明FASTMIX找到的不是专门针对数学测试的"应试配方",而是一个能提升模型综合推理能力的均衡配方。其中的熵正则化机制发挥了作用,它鼓励配方保持数据多样性,而不是把所有权重集中在数学数据上。多样化的数据来源训练出的模型,其底层推理能力也能迁移到编程和理工科问答等相关任务上。
Q3:FASTMIX在工业场景中有哪些已知的局限性?
A:研究团队诚实地列出了几点:小于5亿参数的代理模型训练不稳定,给出的配比建议噪声很大;当验证目标是离散指标(如答题准确率)时,需要用训练损失来代替,否则算法无法正常工作;预训练场景下,验证数据的序列长度要和训练数据对齐,否则梯度方向会偏离导致失效;工业数据上的熵正则化效果有限,建议改用硬性的采样比例上下界约束。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。