
这项由上海交通大学人工智能学院与小红书公司、中国科学技术大学、香港中文大学联合开展的研究,发表于2026年第43届国际机器学习大会(ICML 2026),论文编号为arXiv:2605.24956,发表时间为2026年5月24日。有兴趣深入了解的读者可通过该编号查询完整论文。
一、AI的大脑是怎么学习说话的?
要理解这项研究,得先从AI是怎么"学语言"这件事聊起。
现在最流行的大型语言模型,比如各种聊天AI,它们学习语言的方式有一个统一的"教学大纲",叫做"下一个词预测"。简单来说,就是给AI看一段话,然后让它猜下一个词是什么。比如"今天天气真的很……",AI要猜"好"。把这种猜词游戏在数千亿个句子上反复玩,AI就慢慢学会了说话、理解语言,甚至推理问题。
这种方法被证明非常有效,是当今几乎所有主流AI语言模型的基础训练方式。然而,这个看起来简单优雅的方法背后,其实隐藏着一个被长期忽视的隐患——这正是这支研究团队想要解决的问题。
二、"学会猜词"并不等于"真正理解"
以一个厨师培训学校做个类比来帮助理解这个隐患。假设这所学校评判学生优秀与否的唯一标准,是让学生根据菜名猜出"这道菜最后一步该用什么调料"。学生只要能猜对"盐"或"醋"就算过关,至于他脑子里对食材的理解是否深刻、对烹饪原理是否掌握,学校完全不管。
这样培训出来的厨师,可能确实很擅长猜最后一步放什么调料,但他对食物本身的理解,可能是残缺的、肤浅的。
AI的"下一个词预测"培训面临类似的问题。当AI被反复训练猜下一个词时,它内部形成的"理解状态"——研究人员称之为"隐藏表示"——只需要足以猜对下一个词就行了,至于这个理解状态本身是否丰富、是否能区分不同语境下的细微差异,训练过程完全不关心。
研究团队用两个可以测量的指标来追踪这个问题。第一个叫"有效秩",可以理解为AI内部理解状态的"丰富程度"或"维度数量"。第二个叫"平均余弦相似度",可以理解为不同词语在AI脑子里的"长相相似程度"——如果所有词在AI眼里都长得差不多,说明AI已经无法区分它们了。
实验观测结果非常直观:随着训练的推进,标准训练方式下的AI,其内部理解状态的"丰富程度"急剧下降,而不同词语看起来越来越相似。换句话说,AI内部的理解空间在慢慢"塌陷"成一个狭窄的小角落,所有的词和概念都被挤在一起,彼此之间几乎没有区别。
这就好像是一个人的大脑,原本可以用五彩斑斓的颜色来区分事物,训练后却只剩下了几种灰色,什么都分不清楚了。这种现象有一个专业名词,叫"表示退化",在AI领域早已被记录在案,但如何在大规模预训练中有效解决它,一直是个难题。
三、问题的根源:监督信号太"稀疏"了
要理解为什么会出现这个问题,需要想象一下AI的学习机制。
每次AI猜词,它最终输出的是一个对词典里所有词汇的打分,然后和"正确答案"对比,形成一个误差信号,这个信号再往回传,告诉AI哪里猜错了、该怎么调整。问题在于,这个误差信号,绝大部分力量都集中在"正确那个词"的方向上——告诉AI:"往那个词的方向多靠一点。"
这就产生了一个"盲区":在整个巨大的内部理解空间里,绝大多数方向都没有明确的指引,训练信号对这些方向完全没有约束。于是,AI的内部理解状态在这些没有约束的方向上随意漂移,慢慢地,就漂移成了那个"狭窄、退化"的状态。
用数学语言来说,这叫做"优化空间中存在大量零曲率方向"——类比于一个人走路,只有正前方有路灯指引,其余所有方向都是黑暗,于是这个人虽然能走向正确的终点,却会在黑暗中莫名其妙地绕出奇怪的轨迹。
研究团队将这个问题的本质总结得非常精确:标准的下一个词预测,只定义了"预测什么",却完全没有规定"预测过程中,内部的理解状态应该长什么样子"。正因如此,隐藏表示的几何形状完全是一个自由放任的黑盒。
四、新方法:给AI的内部状态加一道"方向题"
研究团队提出的解决方案叫做"下一个隐式词预测",英文缩写为NITP。理解这个方法,可以回到刚才的厨师培训学校的比喻。
新的培训方案在原有"猜调料"考试的基础上,增加了一道额外的考题:在你猜出最后一步要放盐之前,请先描述出你脑海中对这道菜完整风味的预期是什么。这道额外考题的评判标准,是看你的描述和另一个更有经验的厨师(其实是你自己,但只是刚学完基础课的那个版本)对这道菜的理解有多接近。
翻译成AI的语言:在标准的"猜下一个词"任务之外,NITP额外要求AI用自己深层网络的理解状态,去预测下一个词在自己浅层网络中的语义表示——这个浅层的语义表示,就叫做"隐式词"。
这里有几个关键设计值得细说。
关于"隐式词"的来源:为什么选择用模型自己浅层网络的表示作为预测目标,而不是用词典里固定的词向量?研究人员给出了三个理由。固定词向量有一个著名的问题叫"一词多义"——"银行"这个词,在金融语境和河岸语境下含义完全不同,但固定词向量给它的表示是一样的。浅层网络的表示则是根据上下文动态生成的,能够区分这种语境差异。此外,多项已有研究表明,语言模型浅层网络对语义信息的保留最为丰富,反而是深层网络为了完成预测任务,把语义信息压缩掉了很多。同时,浅层网络在训练过程中比深层网络收敛更快、更稳定,用它的输出作为预测目标,相当于用一个更稳定的"锚点"来引导不稳定的深层表示。最后,因为浅层网络本来就在模型的正常运算流程中,提取它的输出几乎不需要额外计算。
关于"时间错位"的设计:这个细节非常关键,也是研究中的一个重要消融实验发现。NITP要求深层网络在处理当前位置(第t个词)时,预测下一个位置(第t+1个词)在浅层的语义表示,而不是预测当前位置自己的浅层表示。实验证明,如果去掉这个时间错位,只让深层网络和自己的浅层网络对齐当前位置,效果非常糟糕——尽管对齐损失很低,下游任务表现却大幅下降。这说明,NITP的核心价值不在于单纯的"层间对齐",而在于提供了一个带有预测性质的语义目标:我需要理解好当前的信息,才能预测出下一个词的语义本质。
关于"停止梯度":在提取浅层表示作为预测目标时,研究团队切断了从该目标反向传播的梯度通道。用生活语言来说,就是"目标是固定的,你要向它靠近,而不是让它来迁就你"。实验也证明,去掉这个设计,训练会变得不稳定,效果大幅下滑。
关于损失函数的选择:研究团队比较了多种衡量"预测的隐式词和真实目标有多接近"的方法。均方误差(MSE)会导致训练直接崩溃,因为它对深层和浅层表示之间的尺度差异非常敏感,会产生剧烈的梯度冲击。平滑L1损失勉强稳定,但效果一般。KL散度不适合处理连续的向量表示。最终,余弦相似度脱颖而出——它只关心两个向量的方向是否一致,完全不在乎向量的大小,这恰好绕开了深层和浅层表示之间的尺度差异问题,在所有实验中从未出现训练崩溃,且效果最优。
关于预测目标层的选择:实验发现,选择约占总层数20%深度处的浅层作为目标层,效果最好。对于17层的3B MoE模型,选第4层;对于24层的9B MoE模型,选第5层。太浅(直接用词向量)效果差,因为缺乏上下文信息;太深则因为语义已经被压缩,反而提供不了有效的补充监督。
五、用数学说清楚:NITP为什么能解决"盲区"问题
研究团队不满足于经验性的验证,他们还从数学上证明了NITP为何有效。
回到"走路"的比喻:标准训练的优化景观,只有正前方有路灯(对应正确词的方向),其余都是黑暗(对应所谓的"零曲率方向"或"语义零空间")。AI的内部状态在这些黑暗方向上毫无约束地漂移,最终堆积成退化的形态。
NITP相当于在这个优化景观里,为所有垂直于当前方向的方向都安装了路灯——用数学术语说,就是在这些原本零曲率的方向上引入了正曲率,消除了"平坦谷地"。
研究团队通过计算NITP损失函数关于内部状态的"海森矩阵"(一种描述函数弯曲程度的数学工具),证明了两个性质。第一,NITP对向量的大小方向(径向)没有约束,这意味着它不会干扰标准训练对预测概率的调控,两者和平共处。第二,对于任何垂直于当前状态向量的方向(角向),NITP都引入了严格为正的曲率,即在所有语义盲区方向上,都施加了明确的引导力。
更重要的是,这个数学保证的成立,依赖于NITP的损失能收敛到一个较小的值(即预测的和目标的确实很接近)。实验中,NITP的损失最终稳定在0.04(9B MoE模型),完全满足这个条件。这也从侧面验证了选择浅层语义锚点的合理性——如果目标是随机的、不可预测的,损失根本无法收敛,数学保证也就无从谈起。
六、实验结果:小改动、大提升
研究团队在从0.5B到9B参数不等的密集型和混合专家型(MoE)模型上,都从头训练并测试了NITP,覆盖了13个涵盖知识理解和推理能力的基准测试。
在9B的MoE模型上,NITP带来的提升尤为显著。MMLU-Pro(一个专门测试深层推理而非死记硬背的高难度知识测试)从15.29%跃升至21.00%,绝对提升高达5.71个百分点。C3(中文阅读理解)从56.65%提升至63.01%,提升6.36个百分点。CommonsenseQA(常识推理)从45.70%提升至49.96%,提升4.26个百分点。平均跨所有13个测试的分数,提升了2.67个百分点。
在密集型模型上,效果同样稳定。0.5B模型平均提升1.02个百分点,2B模型提升1.79个百分点,3B模型提升1.35个百分点。
研究团队还将模型进一步扩展到45B的MoE模型,训练了2400亿个词元,NITP依然有效,平均分从52.36提升至54.02。这证明了方法的规模化能力。
计算代价方面,NITP对9B MoE模型的额外训练计算量约为总量的2.3%,实际训练时间多了约17分钟(原本16小时1分钟,加了NITP后变成16小时18分钟)。推理阶段则完全没有额外开销,因为训练结束后,NITP的预测头就被丢弃了,部署的模型和原版完全相同。
研究团队还专门测试了NITP学到的内部表示质量,而不仅仅是最终的输出表现。他们把3B MoE模型的最后一层隐藏状态直接用作句子的向量表示(不做任何微调),在MTEB(大规模文本嵌入基准)的25个英文任务上进行评测。NITP在其中23个任务上优于标准训练,总体平均分从39.24提升至41.56(+2.33个百分点)。更关键的是,两个模型在语言模型的原始困惑度(衡量语言预测能力的指标)上几乎完全相同,这说明NITP在提升内部表示质量的同时,并没有牺牲语言建模能力本身。
七、训练过程中的有趣现象
研究团队还仔细观察了NITP损失在整个训练过程中的变化曲线,发现了一个有趣的三段式演变。
训练最初的几十步,NITP损失急速下降到一个很低的值。这是因为刚开始时,模型各层的表示都是随机初始化的,相互之间几乎没有差异,预测起来轻而易举,所以损失很快就低了。
接着,在大约40步到2000步的预热阶段,损失出现了一个"小驼峰"——先升高,再下降。这个现象可以这样理解:随着训练推进,浅层网络率先稳定下来,开始产生有意义的、有差异性的语义表示(类比于一个助手逐渐变得有经验),这时候深层网络要预测这些"变得丰富了"的目标,难度突然变大了,所以损失暂时升高。
随后进入漫长的稳定下降阶段,深层网络逐渐追上浅层网络设定的语义水平,损失稳定收敛到一个很小的值(9B模型最终在0.04左右)。
这个过程说明,NITP并不是一个静止不变的正则化器,而是一个随着模型能力共同成长的动态预测任务,这种"协同进化"正是它有效的深层原因之一。
八、消融实验:每个设计决策都有依据
研究团队对NITP中的每一个设计选择都进行了系统性的对比实验,排除了"碰巧好用"的可能性。
时间错位的必要性:去掉时间错位,让深层网络预测当前位置而非下一个位置的浅层表示,效果不仅没有提升,反而显著低于基准线。这直接排除了"NITP只是一种普通层间对齐技术"的解释——关键在于预测未来语义,而不是和当前语义对齐。
是否只是普通正则化:研究团队用一个"普通余弦正则化"基准做对比,该基准鼓励同一序列中不同词的表示互相远离(防止表示退化),但不提供任何预测目标。结果是,这种普通正则化对下游表现毫无帮助,而NITP始终显著提升表现。这证明了NITP的价值来自"预测性语义监督",而非"防止表示趋同"本身。
损失权重λ的敏感性:研究团队测试了λ从0.6到1.4的一系列取值,发现在0.8到1.0附近性能达到峰值,而且在这个范围内对具体取值并不敏感。这说明该超参数相对稳健,无需精细调节。在不同规模的模型上,最优λ有微小差异(45B模型略小,为0.6),总体趋势是模型越大,辅助损失权重可以略低。
NITP何时开始:从训练一开始就施加NITP监督,比在训练进行到1000步、2000步或3000步后再引入效果更好。越早施加NITP,越能在语义体系尚未固化之前就塑造良好的表示几何结构,起到更大的引导作用。
是否需要预测头:直接让深层隐藏状态与浅层目标对齐(不经过任何变换),效果下降明显。加入一个轻量级的SwiGLU两层MLP预测头,提供足够的灵活性来弥合深浅层表示之间的分布差异,对效果至关重要。
说到底,这项研究干了一件看起来很小、却颇具洞察的事情:它找到了标准语言模型训练中一直存在但长期被忽视的"监督盲区",并以一种极其简洁的方式将其填补——让模型在猜下一个词的同时,还要在内心深处预测下一个词的语义本质。这个改动只需要模型自己的浅层,不需要任何外部数据或外部模型,训练成本几乎可以忽略不计,推理时更是零额外开销。
这项研究揭示了一个值得深思的问题:仅仅通过语言建模损失来衡量模型好坏,可能是不够全面的。两个有着相同困惑度的模型,内部的语义空间可能差异巨大,而这种差异会在下游任务中被放大。这提醒我们,对语言模型"学到了什么"的理解,或许还远未完整。
归根结底,NITP给了我们一个经验:有时候,在庞大的系统里做一个精准的小手术,比重新设计整套系统更有效。读者若有兴趣深入了解全部细节,可通过arXiv:2605.24956查阅完整论文。
Q&A
Q1:NITP和标准的大语言模型训练方式有什么本质区别?
A:标准训练(NTP)只通过猜词对不对来给AI反馈,而NITP在此基础上额外要求AI的深层理解状态必须能预测出下一个词在浅层网络中的语义表示。NTP只管输出对不对,NITP还管内部理解状态"长得对不对",这让AI学到更丰富、更有区分度的语义表示,在知识理解和推理任务上表现更好。
Q2:NITP训练出来的模型用起来会变慢或者需要更多算力吗?
A:推理时完全没有额外开销。NITP的预测头只在训练阶段使用,训练完成后就会被丢弃,部署的模型结构与标准模型完全相同。训练阶段的额外计算量约为总量的2%左右,实际测试中9B模型多用了约17分钟,对于动辄训练几百小时的大模型来说几乎可以忽略不计。
Q3:NITP为什么要用模型自己的浅层表示作为预测目标,而不用现成的词向量?
A:固定词向量无法区分同一个词在不同语境下的不同含义,而浅层网络的表示是根据上下文动态生成的,能捕捉更丰富的语义信息。同时,浅层网络在训练中收敛较快,能提供稳定的"语义锚点"。使用外部编码器虽然也能提供上下文化的表示,但会带来显著的计算开销和领域偏移问题,而自身浅层则是"近水楼台先得月",完全免费且高度匹配。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。