微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 德州农工大学研究团队找到了一条"捷径":让AI语言模型用极少的训练量完成华丽转身

德州农工大学研究团队找到了一条"捷径":让AI语言模型用极少的训练量完成华丽转身

2026-06-15 10:34
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-15 10:34 科技行者

这项由德克萨斯农工大学计算机科学与工程系、德克萨斯大学休斯顿健康科学中心生物信息学与系统医学系,以及德克萨斯农工大学电气与计算机工程系联合完成的研究,于2026年6月4日以预印本形式发布,论文编号为arXiv:2606.06712。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。

一、这件事为什么值得关心

大语言模型如今几乎无处不在——从帮你写邮件、解数学题,到写代码、回答刁钻的知识问答,背后大多是一类叫做"自回归语言模型"(可以简称ARLM)的技术在驱动。这类模型有个共同的工作方式,就像一个一字一句往下写的作家,每次只决定下一个词是什么,然后才看下一个词,再决定再下一个,如此循环,直到完成整段文字。这种方式非常成熟,性能也很强,但有一个根本性的局限:每次只能"动一个棋子",速度上天然有瓶颈。

与之相对的,还有一类叫做"扩散语言模型"(简称DLM)的新兴技术。如果说自回归模型是那位逐字手写的作家,扩散语言模型则更像一位在草稿纸上反复涂改的画家——一开始整张纸都是乱码和空白,然后模型一步步把模糊的内容雕刻清晰,最终呈现出一段完整的文字。这种方式最大的优势在于,它可以同时处理多个位置的词,而不是每次只盯着一个位置,因此在理论上可以大大加快生成速度。

然而,扩散语言模型有一个让研究者头疼已久的难题:训练它需要消耗天文数字般的数据和计算资源。训练一个像样的扩散语言模型往往需要数万亿个词的语料,这对绝大多数研究团队来说几乎是不可承受之重。近年来,学界逐渐摸索出一条"改造"路线——既然自回归模型已经用大量数据训练好了,何不把它改造成扩散模型?这样就能跳过从零开始的漫长学习过程。这条路的确可行,改造所需的数据量从万亿级别降到了百亿级别,但仍然相当可观。

德克萨斯农工大学的这支团队发现,改造过程中还有两个深层问题被人忽视了。正是因为看到了这两个问题,他们提出了一套新方法,把训练所需的数据量再次大幅压缩,最少只需原来的七千分之一。这个数字乍听起来像是在吹牛,但实验数据表明,用如此之少的训练资源,模型在许多复杂任务上的表现竟然不输甚至超过那些耗费巨量资源训练出来的对手。

二、两个被忽视的裂缝

要理解这项研究的核心,得先搞清楚那两个"深层问题"究竟是什么。

第一个问题可以称为"知识流失"。把自回归模型改造成扩散模型,需要把模型内部的一个关键结构——"因果注意力机制"——替换成另一种叫"双向注意力机制"的结构。用一个比喻来解释:因果注意力就像一个人读书只能从左到右,看到某个词时只允许参考它前面的内容,不能"偷看"后面;而双向注意力则是那种可以把书翻来覆去随意查阅的读者。这个结构上的改变,加上训练目标的切换,会让模型在改造过程中"忘掉"一部分在原来训练中积累的知识,就像一个熟练的厨师被送去学烘焙,虽然从零学起的速度会快一些,但过去积累的刀工和火候感还是难免生疏。

第二个问题则是"训练与实际使用的脱节"。扩散语言模型在训练时,通常是这样操作的:拿一段正常文字,随机把其中一些词盖住,然后让模型猜被盖住的词是什么。这就好像给学生做填空题,而且每次挖空的位置是随机抽取的。但真正用这个模型生成文字时,情况完全不同——模型是从一张全是问号的空白纸开始,按照自己的信心和判断,逐步把最有把握的词填上,再基于已填的词继续推进,直到整段文字成形。这种"实际生成时经历的状态"和"训练时见过的随机挖空状态"之间存在明显的落差,就像一个学生只做过随机抽查型填空题,却要去参加一场从头写整篇文章的考试,两者的经验积累并不完全匹配。

这两个裂缝单独看似乎不是大问题,但累积起来会让改造效率大打折扣,也解释了为什么即便从成熟的自回归模型出发改造,仍然需要消耗大量训练资源。

三、"在职培训"方案的核心逻辑

面对这两个问题,研究团队提出的解决方案,可以用"在职培训"这个比喻来理解。

设想有一家老字号餐厅,厨师团队多年来专门做粤菜,手艺精湛,但餐厅老板想把菜系转型为川菜。传统的转型方式是:让老厨师去外面的川菜学校系统学习,花大量时间从基础学起,有时候为了适应新技法,反而把原来的看家本领也生疏了。

研究团队提出的方案则不同:不去外面的学校,而是在老厨师的日常出菜过程中直接进行转型训练。具体怎么操作?每天营业时,让厨师按照新的川菜方式去烹饪和出菜(这是"扩散模型风格"的工作方式),与此同时,旁边始终站着这位厨师原本的自己——一个冻结在旧状态的"粤菜版本",随时提供示范,告诉新版厨师在每一个烹饪节点上应该怎么调味、下料(这是"自回归模型教师"的角色)。新厨师在实际出菜中摸索,旧厨师在每一步提供指导,两者在真实的工作场景中共同完成转型。

这个设计一举解决了前面提到的两个问题。针对"知识流失"的问题,由于旧厨师始终在场提供实时指导,新厨师不需要从零学起,原有的知识被持续传承而非抛弃。针对"训练与实际使用脱节"的问题,因为新厨师是在真实出菜过程中接受训练,而不是在模拟练习中做填空题,他在训练中经历的每一个状态都和实际工作中的状态高度一致。

在这篇论文中,"新厨师"就是被改造中的扩散语言模型学生,"旧厨师"就是原始的冻结自回归模型教师,"真实出菜过程"就是扩散模型在推理时实际经历的生成轨迹,而整套方案被命名为"在策略扩散语言模型",英文缩写为OPDLM(On-Policy Diffusion Language Model)。

四、这套方案的具体运作

理解了大方向,可以进一步看看这套方案在实际中是怎么一步步运转的。

每一轮训练开始时,学生模型——也就是正在被改造的扩散模型——会被要求独立完成一次完整的生成过程:从一张全是空白的"稿纸"出发,按照自己当前的判断,逐步把词语填充进去,直到生成出一段完整的文字。这个完整的生成过程被记录下来,形成一条"轨迹",包含了从全空白到全填满的每一个中间状态。

轨迹记录好之后,从中随机抽取一个中间状态——也就是某个"填了一部分、还有一部分是空白"的时刻。然后,教师模型——也就是原始的自回归语言模型——被请来对那些仍然空白的位置"发表意见":对于每一个空白位置,教师模型根据该位置之前已经填好的词语,给出它认为各个候选词语的概率分布,相当于说"我觉得这个位置填'苹果'的概率是60%,填'香蕉'的概率是30%,其他词是10%"。

学生模型在这个时刻也同时给出自己的判断。训练的目标就是让学生的判断尽可能贴近教师的判断,用专业术语说就是最小化两个分布之间的KL散度,通俗理解就是"让学生的想法向老师靠拢"。

这个设计有一个精妙之处:教师模型在给意见时,面对的是完整的、没有任何空白的文字前缀,因为它是根据学生生成的那段完整终态文字来推断每个位置应该填什么词的。这样一来,即便学生此刻正对着一张半空白的稿纸,教师也能提供清晰、有依据的指导,而不是对着乱码发表意见。这个技巧优雅地解决了"教师是自回归模型、学生是扩散模型,两者面对的输入形式根本不同"这个难题。

此外,研究团队还引入了一个"循序渐进"的训练节奏安排。刚开始训练时,学生模型的能力很弱,如果一上来就让它生成很长的文字,这些长文质量会很差,教师模型根据这些乱七八糟的文字提供的指导也会变得没有意义,就像让一个刚学厨的新手直接做一桌十人宴席,结果惨不忍睹反而打击信心。因此,训练初期只让学生生成很短的内容,确保质量,让教师的指导有实质意义;随着训练推进,学生能力提升,再逐步延长生成长度,让它接触越来越复杂的场景。这种"从简单到复杂"的安排在教育学中被称为课程学习,在这里被自然地应用到了模型训练过程中。

五、用极少资源达到什么样的效果

这套方案究竟能带来多大的效率提升,数据说话最有力。

研究团队用约六万个问题构成的训练语料(涵盖数学、代码、科学和对话四类)来训练OPDLM,其中8B参数规模的版本(即约80亿参数的较大模型)总共消耗的训练词数约为0.066亿——不到一亿个词。相比之下,同类竞争方案中消耗最少的也需要10亿词,多的则高达1500亿词。这意味着OPDLM消耗的训练数据是同类方案的十五分之一到七千分之一。

在计算量方面,OPDLM-8B消耗约4.2乘以10的18次方次浮点运算(FLOPs),而其他方案的消耗在42乘以10的18次方到72000乘以10的18次方次不等,差距同样悬殊。

更关键的是,尽管训练资源少得多,OPDLM在多个重要评测中的表现并不输给那些资源消耗大得多的方案。在数学推理方面,OPDLM-8B在"美国数学邀请赛2024"这个以难度著称的数学竞赛测试集上达到了14.7%的准确率,在"美国数学邀请赛2025"上达到12.4%,均高于或持平于消耗资源多得多的竞争模型。在通用知识评测MMLU上,OPDLM-8B得到70.9分;在更难的MMLU-Pro上得到53.7分;在研究生水平的科学题库GPQA-Diamond上达到36.1分。在代码生成方面,HumanEval测试中得到59.8分,LiveCodeBench-v6上得到9.7分。这些数字并非处处第一,但考虑到背后悬殊的训练资源差距,这样的表现已经相当令人印象深刻。

六、到底是"在职训练"哪个环节起了作用

研究团队并不满足于整体展示效果,他们还专门设计了一组对比实验,仔细拆解OPDLM各个设计环节各自的贡献。

实验中共设置了三种方案进行比较。第一种是"离策略蒸馏"(Off-Policy),做法是:用教师模型生成一批完整的回答,然后对这些回答随机挖空,让学生模型对照教师的概率分布进行填空练习。这是一种比较传统的知识蒸馏方式,学生练习的内容来自教师而非自身。

第二种是研究团队定义的中间变体,称为OPDLMoff:学生模型自己生成完整回答,用学生自己的生成内容来计算教师的指导分布,但挖空的方式仍然是随机的,而非从学生的实际生成轨迹中采样。这种设计保留了"在自己生成的内容上练习"这一要素,但去掉了"按照实际推理轨迹中的状态练习"这一要素。

第三种就是完整的OPDLM:学生生成的完整轨迹被保留,训练时的中间状态直接来自这条轨迹,而非另行随机挖空。

实验结果揭示了一个清晰的结论:从离策略蒸馏切换到OPDLMoff,即让学生在自己的生成内容上练习(而非教师的生成内容),带来了最显著的性能提升,在4B和8B两个规模上都有稳定改善。而从OPDLMoff再切换到完整OPDLM,额外的提升相对有限,说明"在自己生成的内容上训练"这个核心设计是最重要的,而"训练状态精确来自推理轨迹"则起到一定的补充优化作用,两者在某种程度上是互为补充的训练增广关系。

换句话说,这套方案的最大功效来自于让学生在自己的真实"作业"上接受指导,而不是一直在教师示范的"样卷"上练习。

七、加速推理:一次踩多个油门

扩散语言模型的一大理论优势在于可以"一步踩多个油门"——即在每一轮推理步骤中同时确定多个词,而非逐个确定。OPDLM继承并强化了这一能力,研究团队对此进行了系统测试。

有两个旋钮可以控制这种并行推理的程度。第一个是"解码置信度阈值":模型在每一步推理时,会对每个候选位置的词给出一个置信度评分。只有置信度超过阈值的词才会被当场确定,其余的留到下一步再处理。阈值设得高(比如1.0),就意味着每步只有极度确信的词会被确定,接近于一次只填一个词;阈值设得低(比如0.8),则允许更多不那么确信的词一起被填入,从而每步能同时处理更多位置。

测试结果显示,在块大小为4的设置下,将阈值从1.0降至0.8,每步处理的词数从1个增加到超过2个,代价是MATH-500数学测试集上的准确率从约73%下降到约67%。这是一种效率与精度之间的权衡,用户可以根据自身需求选择不同的平衡点。

第二个旋钮是"块大小":OPDLM在训练时采用"分块扩散"的方式,把文字分成若干个块,每次专注处理一个块内的内容。块越大,每一步能并行处理的词就越多,推理速度越快,但准确率会有所下降。在固定阈值0.9的条件下,将块大小从4扩大到16,每步处理词数从约2个增加到约3.5个,但MATH-500准确率也从约73%降到约50%。研究团队还在GPQA-Diamond和MBPP等其他测试集上验证了同样的规律,结论具有普遍性。

训练过程中的监测数据还显示,模型很快就能学会充分利用块大小带来的并行优势,并在训练早期就迅速稳定在较高的并行处理水平,此后保持平稳。

八、零样本涌现:没教的本事居然也在

研究过程中,团队还发现了一些出乎意料的现象,揭示了OPDLM在知识保留方面的惊人能力。

整个训练过程中,OPDLM使用的训练数据全部是英语内容,没有任何专门的多语言训练材料,也没有专门针对"思维链推理"(即让模型先把思考过程写出来再给出答案)的训练。然而测试结果却发现,OPDLM在多语言任务上依然保持了相当不错的表现——在MMMLU多语言测评中,4B版本得到51.6分,8B版本得到56.0分,与专门做了多语言训练的SDAR模型相比差距不大,甚至在某些子任务上还略有优势。

更有趣的是"思维链"能力的保留。当测试时在提示语中要求模型把推理过程写在"思考标签"里再给出答案时,OPDLM能够在8B版本上将AIME-24的准确率从14.7%提升到18.6%,AIME-25则从12.4%提升到19.4%,MATH-500从71.2%提升到75.6%。这说明模型完全没有"忘记"原始自回归模型所积累的多语言能力和推理能力,即便改造过程中没有专门训练这些能力,它们也以某种方式被完整地继承下来了。

这正是OPDLM依靠教师模型持续提供指导的一个深远回报:原模型积累的那些广泛知识,不会在改造中悄悄流失,而是通过蒸馏机制被原汁原味地传递到新版本中。

九、为特定任务量身定制

研究团队还探索了另一种玩法:不把OPDLM打造成一个万能的通用模型,而是直接面向特定任务进行专门化训练,打造领域专家。

他们以数学推理为例,只用了数学训练集中最难的那批题目(约8000道三到五星难度的题目),训练出了OPDLM-MATH系列。与之对比的是一个叫TraDo的方案,该方案从已经训练好的扩散语言模型出发,通过强化学习(让模型在解题中不断尝试、依据答案对错获得奖励)来进一步提升数学能力,这是目前领域专门化的主流路线。

结果令人眼前一亮。在非思维链模式下,OPDLM-MATH-4B在MATH-500上达到75.8分,略高于TraDo-4B-Instruct的75.6分,而AIME-24上达到10%,低于TraDo的8.3%——两者在一般难度数学上相当,但在极难赛事题上OPDLM-MATH稍胜。

当开启"思维链"(让模型在回答前先把推理过程写出来)模式后,差距拉得更大。OPDLM-MATH-8B-Thinking在MATH-500上达到92.4分,在AIME-24上达到50%,全面超越同规模的TraDo-8B-Thinking(87.4分和35.5分)。要知道,OPDLM-MATH的整个训练过程完全不需要强化学习,也不需要任何验证器或奖励信号,只需要在数学题的提示语上跑一遍在策略蒸馏即可,无论是方法的复杂程度还是对额外工程基础设施的需求,都远低于TraDo方案。

十、不同规模下的表现

为了验证OPDLM不是只对某个特定规模的模型有效,研究团队在0.6B、1.7B、4B和8B四个规模上都进行了测试。

0.6B版本(约6亿参数,属于相对小型的模型)只消耗了约4800万个训练词(即0.048亿),在MMLU上达到42分,在MATH-500上达到28分,在数学和推理任务上超过了同规模的对照模型Simple-dLLM,虽然在代码生成上仍有差距。1.7B版本用约7200万词完成训练,在MMLU上达到53.8分,MATH-500上达到53分,超过了消耗14倍数据的Fast-dLLM-v2-1.5B版本在大多数数学推理指标上的表现。

一个有趣的细节是教师模型规模的影响。对于4B和8B的学生模型,用同等大小的教师(即自我蒸馏)效果最好,换成更大的32B教师反而在MATH-500和AIME-24上得分更低。但对于0.6B的学生模型,自我蒸馏效果不足,换成4B的教师能带来改善,尤其在MATH-500上从28分提升到36.2分。研究团队推测,0.6B的模型自身能力有限,它生成的内容质量不足以让同规模的自己提供有价值的指导;而对于4B以上的学生,自身生成的内容质量足够高,同规模教师提供的指导已经足够精准,更大的教师反而会带来某种"错位感"。

说到底,OPDLM这套方案揭示了一件很有意思的事情:在把一个成熟的AI语言模型改造成另一种工作方式时,真正重要的不是消耗多少训练数据,而是训练的方式对不对。让模型在自己的实际"工作场景"中练习,同时保留原有的知识来源作为指导,这两件事协同起来,可以产生远超预期的效率。

用三个数字来描述这项研究的核心成就:0.066亿,这是OPDLM-8B消耗的训练词数;15到7000,这是它比同类方案消耗更少数据的倍数;50%,这是8B思维链数学专家版本在美国数学邀请赛2024测试集上的准确率,而传统路线中最好的同规模竞争方案只达到35.5%。

这项研究并非宣告扩散语言模型已经全面超越自回归模型,在代码生成等任务上,OPDLM与消耗大量资源训练的竞争方案相比仍有差距,研究团队自己也坦承训练数据的质量和多样性是未来改进的关键方向。此外,现有实验主要基于Qwen3模型家族,跨模型家族的适用性还有待验证。对于后续想要探索的研究者,团队已将代码、数据和模型权重全部开放,可以通过GitHub仓库divelab/OPDLM以及HuggingFace上的divelab/opdlm系列找到完整资源,原论文可通过arXiv编号2606.06712查阅。

Q&A

Q1:OPDLM和普通的自回归语言模型在生成文字时有什么实际区别?

A:普通自回归语言模型每次只能生成一个词,再基于这个词生成下一个,速度受限。OPDLM属于扩散语言模型,可以同时处理多个词的位置,理论上每步能一次性确定多个词,尤其在较低置信度阈值或较大块大小的配置下,每步可以生成2到3.5个词,推理效率更高,但会有一定的准确率权衡。

Q2:OPDLM训练数据只有几千万个词,为什么效果能和用几百亿词训练的模型相比?

A:核心在于训练方式的改变。OPDLM让学生模型在自己实际生成的内容上练习,而不是在随机准备的数据上练习,这消除了训练场景和实际使用场景之间的落差。同时,原始自回归教师模型持续提供知识指导,让改造过程不会丢失原有能力。这两点结合起来,大幅提升了每条训练数据的利用效率,从而用远少于常规的数据量达到相近的效果。

Q3:OPDLM在哪些任务上表现最突出,哪些任务上还有明显不足?

A:OPDLM在数学推理和逻辑推理类任务上表现最为突出,尤其是在高难度的AIME竞赛数学题和GPQA研究生水平科学题上,相对优势明显。多语言和扩展思维链能力也得到了意外保留。相比之下,代码生成任务(如HumanEval和MBPP)是较明显的短板,与消耗大量数据训练的方案相比有差距,研究团队认为这主要是训练语料在代码领域覆盖不足所致。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-