
这项由加州大学圣地亚哥分校、澳大利亚皇家墨尔本理工大学和彭博人工智能实验室联合开展的研究,发表于2026年,论文预印本编号为arXiv:2606.16246v2,发布于2026年6月19日。有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。
**一、高考前发现教材快用完了**
有没有想过这样一个处境:你正在备考一场极其重要的考试,但书店里的教材已经基本卖完,你手头只剩一本教材,而考试还有好几年。怎么办?反复读这一本书吗?可是读着读着你会发现,书上的内容你开始死记硬背,而不是真正理解——最终考出来的成绩反而越来越差。
这正是当今AI大语言模型面临的困境。过去十年,AI的进步靠的是三样东西同步增长:更大的模型、更多的算力、更多的训练数据。但现在,人类在互联网上产生的高质量文字数据正在快速逼近天花板——研究人员预测,再过几年这些数据就会基本耗尽。与此同时,算力却还在以惊人的速度增长。这就造成了一个尴尬的局面:AI有足够多的"时间和精力"去学习,却没有足够多的"新教材"。
于是,让AI反复在同一批数据上训练,成了不得不走的路。问题是,传统的自回归语言模型(就是现在ChatGPT这类AI背后的主流技术,它的核心任务是预测下一个词)在这种"反复读同一本书"的场景下表现极差。它会很快从"理解"滑向"死背"——用专业术语说,就是过拟合。
这篇论文的核心贡献,就是系统性地研究了一种应对方法:给AI的训练数据加"变体",让它每次读同一本书时,看到的都是稍微不同的版本,从而避免死记硬背,保持真正的理解和泛化能力。研究团队把这种方法称为"训练时数据增强",并从三个完全不同的角度设计了增强方案,逐一测试它们的效果,最终找到了能让模型在同样数据上多训练几十倍还持续进步的组合方式。
**二、死背和理解的差距:一个让人警醒的基准测试**
在展开各种解决方案之前,研究团队先做了一件很重要的事:确认问题到底有多严重。
他们训练了一个1.5亿参数的标准语言模型(基于主流的Llama架构,参数量虽然比现在的大模型小很多,但足以说明规律性问题),使用的训练数据是7500万个词语规模的高质量网页文本。这个数据量大约只有"计算最优"标准的四十分之一——所谓计算最优,是指模型参数量和训练数据量的最优匹配比例,业内普遍认为1.5亿参数的模型至少需要约30亿词语规模的数据才能训练充分。研究团队故意选了这个极端数据不足的场景,就是为了放大数据受限时的问题。
结果令人警醒。标准的自回归训练方式下,模型在第16轮训练时达到了验证损失的最低点(验证损失可以理解为"在没见过的文章上猜词的错误率",越低越好)。但从第17轮开始,错误率就一路攀升,再也没有回头。训练持续了100轮,而有效的学习只发生在最初的16轮——也就是说,超过80%的训练时间是在帮倒忙,模型越练越差。
这个结果印证并拓展了学界此前的一些发现。麻省理工学院等机构的研究曾指出,在同一批数据上反复训练,大约4轮之后收益就会急剧下降。但这项研究观察到的情况更为极端:不只是收益递减,而是主动变差,就像一个学生把教材背得滚瓜烂熟之后,在真实考试中反而因为过度依赖记忆而答题越来越糟。
这个发现定下了整个研究的基调:在数据受限的场景下,问题不是如何让模型"多学一点",而是如何让它"不要越学越退步"。
**三、给教材加"变体":三种不同方向的改造**
研究团队设计的解决方案,核心思路可以用一句话概括:每次给模型看同一段文字时,稍微改变一下它的形式,让模型每一次都面对一个新鲜的挑战,而不是重复解答同一道题。
这个思路其实借鉴了另一类AI模型——扩散语言模型(Diffusion Language Model)的优点。扩散模型的训练方式是:把同一段文字加上不同程度的"噪音",让模型学会从各种破损版本中还原出原文。这样每次训练,模型看到的都是不同的噪音程度,相当于从不同角度认识同一段内容,因此不容易死记硬背。但扩散模型有个很大的缺点:它和现有的自回归框架完全不兼容,现在所有的AI训练基础设施都是为自回归模型设计的,改用扩散模型意味着推翻重来,代价极大。
研究团队的选择是:不换模型,只在输入数据上做文章。他们设计了三类完全不同方向的数据变换方法,每一类都从不同角度让同一段文字呈现出不同的学习挑战。更关键的是,所有这些改变只在训练时生效——到了真正使用模型的时候,依然是标准的"从左到右预测下一个词",不影响任何已有的推理流程。
第一类方法叫做"词语级噪音"。具体做法是,每次把一段文字喂给模型之前,随机挑选其中一部分词语,把它们替换掉。替换有两种方式:一种是把词语换成一个特殊的"遮盖符号",就像把书上的某些词用黑色墨水涂掉;另一种是把词语换成一个随机的、词义完全不相关的其他词,就像把书上的某些词改成了错别字或者胡乱替换的词。关键在于,模型的学习目标始终是预测原本正确的词——它必须根据上下文推断出那个被涂掉或被换掉的词到底应该是什么。
第二类方法叫做"序列排列"。这类方法不改变词语本身,而是改变词语出现的顺序。具体包含两种变体:一种是把整段文字从后往前颠倒,让模型从右向左预测每个词;另一种是把一段文字拆成前、中、后三段,然后打乱顺序重新拼接,让模型在看到前后文之后预测中间那段内容(这种方法叫做"填空预测",英文简称FIM)。
第三类方法叫做"预测目标偏移"。标准的语言模型训练总是让模型预测"下一个词",也就是紧跟在当前位置后面的那个词。而这类方法允许模型偶尔去预测"下下个词"、"下下下个词"等更远处的词,相当于让模型学会更长远的规划,而不总是只盯着眼前一步。具体怎么选择预测哪个位置的词,研究团队尝试了两种策略:完全随机均匀地选、或者按照"近的词概率大、远的词概率小"的指数衰减方式选。
**四、逐一较量:哪种方法真的有效**
设计好三类方法之后,研究团队开始系统地做实验,逐一检验每种方法的实际效果,以及不同参数设置下的表现差异。
在词语级噪音这一类里,随机替换明显比遮盖更有效。以15%的改动率为例:15%随机替换的最低验证损失达到了3.841,而15%遮盖只能达到3.910,两者差距不小。为什么随机替换更好?研究团队给出的解释很直觉:当一个词被涂黑时,模型一眼就能看出"这里有个词被藏起来了",推理难度相对有限;但当一个词被换成另一个看起来合理但实际错误的词时,模型必须从整体语义出发,判断这个词"虽然看起来没问题,但其实放在这里不对"——这个难度更高,对理解能力的训练更深入。5%的替换率效果偏弱,30%的替换率效果比15%略差,说明15%是个比较理想的平衡点。
在序列排列这一类里,从右向左预测(R2L)效果相当不错,而填空预测(FIM)则完全没有效果。具体来说,50%概率采用从右向左排列(另外50%保持正常方向)时,最低验证损失达到3.910,比基准的4.015有明显改善;25%概率时效果相对弱一些,达到3.942。但填空预测的最低验证损失只有3.947,和基准几乎持平,而且之后损失上升的速度甚至比基准还快,到了第40轮就已经超过基准水平了。
这个结果揭示了一个重要规律:有效的数据变换,必须和模型最终被使用的方式保持足够的相似性。从右向左预测虽然颠倒了方向,但本质上还是"根据上下文预测下一个词",和正向预测的逻辑结构完全一样;而填空预测把文字的前中后三段打乱重排,产生了一种和正常文字完全不同的怪异格式,模型在这种格式下学到的东西很难迁移回标准的从左到右阅读场景。
在预测目标偏移这一类里,关键在于如何分配预测近处词和远处词的概率。均匀随机地在1到5个位置偏移中选择,效果和基准几乎一样(最低损失4.016),没有任何改善;但如果按指数衰减方式分配概率——大多数时候还是预测下一个词,偶尔才预测更远的词——效果就非常突出,最低验证损失达到3.870,而且训练到第60轮才到达最低点,说明它能让有效学习持续更长时间。更简单的版本,在1到2个位置偏移中均匀随机选择,效果居中,最低损失3.890,但在第24轮就到达最低点,更节省训练时间。
**五、组合使用:有的相辅相成,有的相互拆台**
单独使用每种方法都能带来改善,那把它们组合起来会不会更好?答案是:取决于怎么组合。研究团队系统测试了所有两两组合和部分三方组合,发现了非常有趣的规律。
从右向左预测和指数衰减偏移预测的组合,效果极佳。两者搭配后的最低验证损失达到3.841,和单独使用15%随机替换的最好成绩并列第一。为什么这两者能很好地配合?因为从右向左预测保留了所有的词语内容,只是改变了顺序,这并不破坏每个位置的局部语境信息;而偏移预测恰恰需要依赖这种局部语境来推断更远处的词——两种方法互不干扰,而且各自从不同角度施加训练压力,相互补充。
词语噪音和偏移预测的组合,效果很差。15%随机替换加上指数衰减偏移预测,最低验证损失只有3.995,几乎和基准的4.015一样,所有改善全部消失。道理也很直接:偏移预测需要模型从当前位置的上下文中准确推断出几步之后的词,这要求上下文是完整可靠的;而随机替换恰好把上下文中的一些词换成了错误的词,模型在噪音破坏的上下文中根本无法可靠地推断远处的词,任务难度超出了合理范围,反而变成了无效的噪音训练。
词语噪音和从右向左预测的组合,效果居中。5%随机替换加R2L,最低损失3.877,比单独R2L的3.910还略有改善;15%随机替换加R2L,最低损失3.887,效果稍差;而15%遮盖加R2L,最低损失3.963,比单独R2L还要差——说明遮盖这种方式在和序列排列组合时,高比例使用会产生足够强的干扰,抵消掉排列方向多样化带来的收益。
最强的三方组合,是低比例随机替换加R2L加指数衰减偏移预测。研究团队先测试了15%随机替换加R2L加偏移预测,发现最低损失是3.879,略差于R2L加偏移预测的3.841,说明即使是温和的噪音也在某种程度上干扰了三者的配合,而且这个组合在训练过程中出现了明显的不稳定,损失曲线频繁出现剧烈跳动。于是研究团队把随机替换的比例从15%降到5%,结果大不相同:5%随机替换加R2L加偏移预测的最低验证损失达到了3.805,不仅超越了所有单独方法的最好成绩(此前最好是3.841),也超越了所有二方组合,成为整个实验中的最优方案。训练稳定性也大幅改善。
这个结果背后的逻辑是:在很低的噪音比例下,随机替换不会明显破坏上下文的连贯性,偏移预测依然能获得可靠的语境支撑,三种方法真正做到了从不同角度给模型施加多元化的学习压力,各自正交互补。
**六、学习率衰减后,排名还成立吗**
以上所有实验都使用了一种叫做"稳定阶段"的比较方式——模型在固定学习率下持续训练,直接用这个阶段的最低损失进行比较,没有经过最后的学习率逐步降低(也就是"衰减阶段")。这是一种节省计算资源的做法,相当于不等学生把所有知识融会贯通,只看他在紧张备考状态下的阶段性水平。研究团队担心这种比较方式可能不够准确——如果不同方法在经过最终学习率衰减后排名会改变,那稳定阶段的结论就没有参考价值。
为了验证这一点,他们对所有8个选定的配置(基准、三种最佳单方法、三种二方组合、最佳三方组合)都进行了完整的衰减阶段训练,从各自在稳定阶段达到最低损失的那个检查点出发,应用学习率从峰值逐渐降至零的衰减策略。
结果令人放心。大多数配置在经过衰减后损失进一步降低,但幅度都很小——8个配置中有6个降低了0.017或更少,说明稳定阶段的最低损失已经接近真正的收敛水平。最重要的是,方法排名基本保持不变:最佳三方组合(5%随机替换加R2L加偏移预测)在衰减后以3.792的最低损失稳居第一,而基准始终垫底。一个有趣的变化是,15%随机替换加偏移预测这个在稳定阶段看起来很差的组合(损失3.995),经过衰减后大幅下降到3.909——说明学习率衰减对那些训练过程中存在目标冲突的配置帮助特别大,它给了模型一段"沉淀"的时间来解决内部冲突,最终收敛到更好的状态。
**七、更低的损失,现实中是否真的更聪明**
验证损失降低了,在实际任务上是否也变得更好?研究团队用5个不同类型的常识问答和推理任务对所有模型进行了零样本测试(即不给模型任何示例,直接让它回答问题)。这5个任务分别考察常识推理、物理常识、科学知识、代词指代理解和因果推理能力,覆盖面比较全面。
所有经过数据增强训练的模型,平均准确率都高于未经增强的基准模型(基准平均41.0%)。改善幅度从0.2个百分点到2.3个百分点不等。在这个1.5亿参数规模的模型上,这个量级的提升已经是相当一致的信号。
不过,验证损失的排名和任务准确率的排名并不完全吻合。最低验证损失的模型(3.792)在准确率上排第二(42.9%);准确率最高的反而是单独使用指数衰减偏移预测的模型(43.3%),而它的验证损失排第三(3.870)。研究团队解释说,在1.5亿参数这个规模下,每个具体任务的得分波动性很大,0.05左右的损失差距只对应1至2个百分点的准确率差距,这种精度不足以在细粒度上区分方法优劣。因此,整个研究始终把验证损失作为主要评判标准,任务准确率只作为辅助参考。
**八、说到底,这项研究意味着什么**
说到底,这项研究回答的是一个非常实际的问题:当AI能用的新数据越来越少,但算力还在不断增加,该怎么办?
传统的答案是"找更多数据",但数据墙就在那里,找不来。另一个前沿方向是换成扩散语言模型,它天然适合反复训练,但整个行业几十年积累的工具链、工程经验、推理优化全都要推倒重来,成本极高。
这项研究提供了一条更平滑的路:不换模型,只改训练方式。通过在训练数据上施加多样化的变换——温和地替换一些词、偶尔把文字从后往前读、有时候预测不是紧邻的下一个词而是稍远一点的词——让同一批数据每次呈现出不同的学习挑战,模型就能从"第16轮就停止进步、继续训练只会变差"变成"第68轮才到达最低点,而且整个过程都在持续进步"。最优组合把验证损失从基准的4.015降到了3.805,降幅达0.210,而且这种改善能转化为实际任务上的准确率提升。
当然,这项研究也有它的边界。所有实验都在1.5亿参数的小模型上进行,比现在主流的大模型小了几百倍。在更大规模上这些规律是否仍然成立,是否需要不同的参数设置,这些都有待未来验证。研究团队也坦承,超参数的搜索空间非常大,这次探索的只是其中一部分。
对于普通人来说,这项研究意味着未来你使用的AI助手,在数据资源日益紧张的情况下,仍然有可能通过更聪明的训练方式持续变得更好,而不是陷入停滞。背后的道理其实不复杂:一个好学生不是把同一本书背一万遍,而是每次从不同角度审视同一段内容,触类旁通,融会贯通。这项研究做的,正是帮AI学会这种学习方式。
---
Q&A
Q1:自回归语言模型在数据受限时为什么会越训练越差?
A:自回归语言模型的核心任务是预测下一个词。当训练数据量远少于模型参数量时,反复看同样的数据会让模型从"理解规律"变成"死背答案",就像学生把试卷背得滚瓜烂熟却不理解题意。在新的文章上测试时,错误率反而越来越高,这就是过拟合现象。这项研究的实验显示,标准训练方式下模型在第16轮就达到最佳状态,之后持续退步。
Q2:为什么随机替换词语比用遮盖符号效果更好?
A:遮盖符号会在文章里留下一个明显的"此处有内容被删除"的标记,模型很容易识别出"这里有个坑",推理压力相对有限。而随机替换会把一个词换成另一个看起来合理但实际错误的词,模型必须从整段语义出发判断这个词"虽然长得正常,但放在这里不对",这对真正的语言理解能力要求更高。更难的挑战反而带来了更好的泛化能力。
Q3:这三种数据增强方法为什么不能随意组合?
A:不同方法对数据的改变方式会互相影响。预测偏移需要可靠的上下文来推断更远处的词;而高比例的词语替换会破坏上下文的连贯性,让这个推断任务变得几乎不可能完成,两种方法相互拆台。相比之下,从右向左排列只改变词序而不改变内容,不影响局部语境的可靠性,因此可以和预测偏移很好地配合。这项研究发现,只有在5%这种极低的噪音比例下,三种方法才能真正做到互补而不干扰。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。