微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 训练、学习与推理:AI大脑内部到底发生了什么

训练、学习与推理:AI大脑内部到底发生了什么

2026-09-22 15:00
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-22 15:00 • 科技行者

你有没有想过一个问题:当一个AI模型在训练的时候,某次参数更新到底对它做了什么?

大多数人对这个问题的理解,可能停留在"损失函数下降了,模型变聪明了"这种模糊的说法上。但如果你真的去问一个做深度学习的人,训练这个具体步骤到底怎样改变了模型识别某个词、某张图的能力,很可能得到的回答也是含糊的。梯度下降、反向传播,这些词大家都会说,但"这一步更新,让模型对某个具体问题从答错变成答对了,背后经历了什么",这个问题的答案一直很模糊。

武汉纺织大学的王眠在一篇新论文里,把这个问题拆开揉碎,做了一次相当彻底的实证研究。他没有从损失、梯度这些标准机器学习概念出发去建立理论,而是先搭了一套记录系统,把训练过程中"到底发生了什么"完整地记录下来,然后再去看这些记录能告诉我们什么。这篇论文的野心不小,它想同时回答三个问题:训练是什么,学习是什么,推理又是什么,而且这三者是不是可以用一套统一的框架来描述。

先说说这套记录系统是怎么回事。

一份"生成事实",记录每一次变化的来龙去脉

数据库领域有个概念叫"血缘追踪",能告诉你一张报表里的某个数字是从哪几条原始记录算出来的。前端开发领域有Source Map,能把压缩混淆后的代码位置对应回你写的原始代码。分布式系统有OpenTelemetry,用来追踪一次请求在各个微服务之间是怎么流转的。PyTorch的Autograd机制,会记录你做过的每一步运算,这样才能在反向传播时正确计算梯度。

这些工具看起来毫不相关,但王眠注意到它们其实在做同一件事:追问一个结果是怎么形成的。只是每个领域各自发明了一套记录方法,彼此互不相通。

于是论文提出了一个统一的原子单位,叫生成事实。

生成事实(Generation Fact):用一个五元组 f = (u, τ, ω, z; ρ) 记录一次具体的"生成",其中u是真正参与进来的源信息,τ是实际发生的变换,ω是这次变换发生的具体场景,z是产生的结果(或者明确记录"没有产生结果"),ρ是u在这次关系里扮演的角色。

这套记录法听起来抽象,但你可以把它想象成给每一次"事情发生"配一张详细的出生证明。普通的日志系统可能只记录"参数变了",但生成事实要求你说清楚:是哪个具体的输入数据参与了这次计算,用了什么样的变换规则,在哪个具体的执行环节里,产生了什么结果,这个输入在整个过程里到底算什么角色。

如果不这样细致地记录会怎样?你会得到一堆孤立的日志片段,损失值下降了,参数变了,但你没法回答"这次更新为什么让某个具体的问题从答错变成答对",因为你压根没留下能追溯到那个具体因果链条的证据。这就好比一场刑事案件只留下了案发现场的照片,却没有记录证人证词和物证流转过程,你能看到结果,但重建不出过程。

多个生成事实按照"上一步的结果参与到下一步"的方式串联起来,就形成了生成事实图(Generation-Fact Graph,简称GFG)。

生成事实图(GFG):把大量生成事实按照它们之间的因果连接方式组织起来的一张图结构,图里既包含原子事实本身,也包含具体发生的场景,以及事实与事实之间被验证过的关系。这张图是给AI直接遍历和查询用的,不是给人看的报表。

论文还证明了一件挺有意思的事:前面提到的数据库血缘、Source Map、OpenTelemetry、W3C PROV、PyTorch Autograd,这些各个领域各自发明的追溯机制,全部都可以看作是从这个更完整的生成事实结构里做了一次"信息缩水"的投影。换句话说,这些工具不是互相独立的发明,它们本质上都是同一件事的不同简化版本,只是各自领域根据自己的需要砍掉了一些信息。

有了这套记录机制之后,论文进一步提出了一套递归的科学研究流程:先提出科学问题,去查询已有的GFG;分析、干预、重放或验证产生新结果后,这些新结果本身又会被记录成新的生成事实,进入下一轮GFG。整个过程像滚雪球一样不断积累证据,GFG0→GFG1→GFG2……后面论文里报告的所有实验,基本都是在这套流程里跑出来的。

有了记录系统,接下来的问题是:拿它来研究什么?

训练:一场带着记忆的系统演化,而不是瞬间的魔法

论文选择了nanoGPT作为实验对象,用十三次真实的完整训练过程,一步步做了八组实验,逐渐拼出训练和学习的机制。

第一组实验(TL-E01)先问了一个基础问题:损失值、准确率、训练步数这些我们平常盯着看的指标,够不够用来判断一个模型的能力状态?

答案是不够。研究者发现,即便两个训练状态在损失、准确率、单个目标的margin这些常见指标上看起来很相似,它们后续的走向也可能完全不同。而且能力形成之后并不会一劳永逸,它可能维持,可能下降,也可能之后又恢复回来。这直接推翻了"模型能力是由某个单一进度条决定的"这种朴素想法,训练必须被理解成一个有状态、有记忆的过程,而这个状态包含的信息,比我们平常画的学习曲线丰富得多。

第二组实验(TL-E02)做了个巧妙的干预:暂停参数或优化器的演化。结果这种暂停会把能力形成的时间点往后推迟1800步、800步、1100步不等。但如果只是改变梯度裁剪的阈值,并不会带来同样的延迟。这说明能力的形成依赖的是参数和优化器这套系统本身持续的演化,而不只是梯度大小这类单一数值。

这里出现了一个很重要的概念,叫Adam。

Adam:一种常用的深度学习优化算法,它不光看当前这一步的梯度,还会维护每个参数的历史动量和方差估计,用这些历史信息来调整每一步更新的步长和方向。也就是说Adam本身是有记忆的,它记住了过去更新的"惯性"。

第三组实验(TL-E03)验证了一件更反直觉的事:同一个训练更新,作用在不同的接收状态上,产生的效果是不一样的。研究者构造了完全匹配的因果分支,从相同的更新前状态和数据批次出发,一条分支执行完整更新,一条跳过更新,还专门做了"接收状态互换"实验,把从A状态算出来的更新拿去应用到B状态上。

结果发现,同一个更新在不同状态下产生了不同的功能响应,用论文里的记号写就是 J_A·Δθ ≠ J_B·Δθ。反过来,看起来相似的状态在面对同一个更新时也可能反应不同。

这就像同一杯咖啡因,喝在一个熬了三个通宵的人身上和喝在刚睡醒的人身上,效果完全不一样。剂量是固定的,但身体的接收状态决定了这剂量到底会产生什么反应。如果只盯着"这次更新的幅度有多大"而不管当前的参数和优化器状态是什么样的,你永远没法预测这次更新到底会让模型变好还是变差,因为效果从来不是更新本身单独决定的,它是更新和接收状态共同作用的结果。

第四组实验(TL-E04)接着问:那我们能不能用一个简单的线性或二次近似公式,来描述一次完整更新的效果?

研究者把同一个真实更新,按照0、0.125、0.25、0.5、0.75、1这几个幅度依次施加到相同的更新前状态上,观察完整的响应曲线。结果发现除了接近线性的情况,还反复出现四种非线性模式:饱和、加速、回折、符号反转。也就是说随着更新幅度增加,目标的响应有时候会先涨后跌甚至跌过头变成负的,这种复杂形状是固定的线性或二次公式没法覆盖的。这组实验的意义在于,它把"有限幅度下的非线性功能响应"确立成了一个值得单独研究的对象,而不是可以简单外推的东西。

第五组实验(TL-E05)在七类候选信息里做筛选,想找出到底是什么在决定这种非线性响应的具体形态。经过运行隔离匹配、消融和跨运行评估,研究者锁定了三个稳定的核心因素:目标当前的边界状态、针对该目标的更新几何、以及参数-Adam这套接收状态。有意思的是,一旦这三类信息到位,历史变量和过去的响应曲线就不再提供额外的独立信息增量了。这不是说历史没有作用,而是历史的影响已经被浓缩进了当前的参数-Adam状态里,就像一个人过去几年的生活习惯,其实已经体现在他今天的身体状态里了,你不需要再单独去查他的日记。

学习:能力不是靠一个组件撑起来的

如果说前五组实验搞清楚了训练更新怎么产生响应,接下来的三组实验(TL-E06到TL-E08)就是要搞清楚这种响应是怎么变成持久的能力的。

TL-E06这组实验用了一个叫CSRG的工具,在每个训练节点上分别关闭单个组件和成对组件,观察对每个具体目标的预测结果有什么影响。

结果发现,不同的目标和不同的训练阶段,展现出完全不同的组件依赖模式:有的组件是某个能力必需的,有的可以被另一个组件顶替,有的两个组件配合时有协同效应,有的即便坏掉一个也不影响整体表现。同一种能力,不能被简单归结为"由某个固定组件负责"。这组实验确立了一个概念,叫分布式功能支持。

分布式功能支持(Distributed Functional Support):一个能力是由多个保持自身身份的组件共同支撑的,这些组件之间责任怎么分配、能不能互相替代、有没有冗余,会随着训练状态的变化而变化,不是一成不变的分工。

TL-E07进一步量化了训练更新怎么重新分配这种支持。研究者比较了同一个接收状态在没有更新(α=0)和完整更新(α=1)之后的支持分布,在72个更新区段里统计出1656次目标组支持转移,其中主要支持组件发生变化的有228次。更新的总幅度和支持重新分配幅度之间的相关性达到0.881,支持重新分配幅度和能力实际变化幅度之间的相关性是0.765。能力发生变化时,平均重新分配幅度是0.2080,而能力没变的时候只有0.0340。

但有个反直觉的细节:单个组件的更新幅度大小,并不能可靠地预测这个组件之后会获得更多责任还是失去责任。支持变化的方向是当前支持配置和完整更新共同决定的,不是哪个组件"动得多"就一定"责任变大"。这告诉我们学习不能简单定义成参数变了多少,学习是分布式功能支持被训练响应持续重新组织的过程。

TL-E08最后把内部变化和外部可观察的能力表现连了起来。研究者对每个具体目标,在更新前后对齐它的身份、正确类别、竞争类别、logit值和margin,判断它是否跨过了正确与错误之间的那条读出边界。

关键发现是:训练更新可能改变了参数、Adam状态、功能响应和支持结构,但只要这个具体目标没有跨过它对应的边界,外部观察到的结果就完全不会变。只有当边界被跨越时,才会出现四种可观察结果之一:保持正确、由正确变错误、保持错误、由错误变正确。

这就好比一个杯子里的水位在缓慢上升,只要没漫过杯口,外面的人看不出任何变化,一旦漫过去,才会突然"发现"水溢出来了。内部的变化是连续的,但外部观察到的"能力突变"其实是内部连续变化跨过某个阈值的瞬间表现。

把这八组实验串起来,论文得出了训练学习理论的核心链条:实际训练动作,经过当前接收状态和目标特定更新几何的共同调制,产生有限幅度的非线性功能响应,这种响应导致分布式功能支持的持续重组,当某个特定目标的内部状态跨过它对应的读出边界时,就表现为能力的形成、维持、衰退或恢复。

预测未来:不看结果,只看更新本身能不能猜中结果

理论提出来之后,最硬核的检验方式就是拿它去做预测,而且是那种"你还没看到答案就必须先猜"的预测。

论文构造了一个二阶目标边界预测器,它的特点是:在真实参数更新已经形成,但目标的post-update输出还没被计算出来之前,就要给出预测。公式大致是把更新前的margin,加上更新方向导致的一阶响应,再加上二阶修正项,来预测更新后的margin会是正是负。

这套公式的独特之处在于它完全基于论文前面确立的三个核心坐标(目标当前边界状态、更新几何、接收状态),没有作弊性地偷看任何post-update才能拿到的信息。

在完全独立的确认数据集上,这套预测器答对了5088个案例里的4652个,目标边界准确率达到91.43%,平衡准确率92.17%,四类转移(保持正确、正确转错误、保持错误、错误转正确)的宏平均召回率是91.49%。具体拆开看,正确转错误的召回率高达98.91%,保持错误的召回率95.90%,保持正确的召回率87.18%,错误转正确稍低一些,83.95%。

在全部十二次可用的完整训练运行中,这套公式一共答对了15264个目标更新结果里的14069个,准确率92.17%,宏平均召回率91.30%。

这个结果之所以重要,是因为它证明了论文提出的三个核心坐标确实是"够用"的,你不需要更多信息就能相当准确地预判训练的下一步效果,这从侧面验证了前面那套机制不是事后编出来的故事,而是真的抓住了训练过程的关键变量。

推理:一次固定不变的"投影",而不是又一次学习

搞清楚训练和学习之后,论文转向了第三个问题:模型训练好之后,推理的时候到底在用什么?

这里论文提出了一个核心论断:推理是训练学习动态的冻结投影。

意思是说,推理阶段模型的参数完全不再变化,但当前的查询会去调用和组合训练阶段已经形成的分布式功能支持,而且是以非加性的方式组合它们。

为了验证这一点,研究者在十三个nanoGPT训练历史中挑出52个检查点,覆盖能力形成、下降和恢复的各个阶段,做了四类对比实验。

第一类是精确训练版本对比和组件门控:确认推理时读取的参数版本和训练记录里保存的版本严格一致,关闭某个组件会改变完整的logits输出。这证明推理确实用到了训练形成的具体组件。

第二类是逐目标的组件门控响应:在每一个已形成能力的检查点上,23个目标组产生了23种不同的响应模式。这说明不同的目标会调用不同的分布式支持组合,推理不是对所有查询都用同一套固定分配。

第三类是单组件和双组件门控对比:在每个检查点上测试了138组组件对与目标的组合,结果全部都偏离了简单相加的预期。这证明推理时多个支持组件是联合起作用的,不是各自独立叠加。

第四类是形成前回滚和恢复:把某个组件替换回它在能力形成之前的旧版本,其余部分保持不变,结果52次回滚全部导致准确率下降,恢复原版本后logits精确复原。这证明推理结果因果依赖于训练过程中形成的具体组件版本。

四类证据合在一起,勾勒出一条清晰的因果链:训练形成的组件版本,经过当前查询的针对性调用,形成目标特定的分布式支持,再经过联合组合,产生最终推理结果。

这个发现也顺带解释了一个业界很熟悉但一直缺少机制解释的现象:为什么训练规模越大,模型的推理能力往往越强。因为推理只能投影学习已经形成的功能组织,训练规模增加带来更多学习形成的过程,可用的功能支持就更丰富,推理自然能组合出更强的结果。

这也解释了为什么Attention机制这么好用。Attention的公式是 softmax(QK^T/√d)V,查询和键构造出针对当前场合的投影,值则携带被这个投影调用的分布式内容。Attention之所以有效,正是因为它天然满足了这套理论要求的组织条件:同一套学习到的参数,可以针对不同的查询形成不同的活跃支持组合,而不需要持久地修改学到的参数本身。

Attention(注意力机制):Transformer架构里的核心组件,通过查询(Query)、键(Key)、值(Value)三者的运算,让模型能针对当前的输入内容,动态地从已学习的信息里挑选和组合相关部分,而不是对所有输入用完全相同的固定处理方式。

强化学习也被这套框架重新审视了一遍。强化学习本质上是把推理产生的行动和环境反馈之间的循环接了起来,推理把已经形成的功能支持投影成行动,行动的后果又可以作为新的训练信号返回来。论文的受控实验发现,如果持续给某个特定能力施加集中的正反馈,会出现严格按剂量排序的效应:目标能力的支持在增强,但其他未被强化的能力的margin在同步下降,反馈足够集中的话最终会导致这些能力真的失效。好在重新平衡后续的反馈,可以在保留强化能力的同时,让其他能力基本恢复。这提醒我们强化学习不是单纯的"越强化越好",它是一把双刃剑,持续的不平衡反馈可能悄悄侵蚀那些没被关注的能力,就像长期只练一侧肌肉的人,另一侧会因为缺乏使用而萎缩。

跨系统的验证:不只是nanoGPT的巧合

一个理论如果只在一个具体系统上成立,很容易让人怀疑这是不是某种偶然的巧合。论文专门做了跨系统验证,把同样的训练学习和推理协议搬到了两个结构完全不同的系统上:基于CIFAR数据的ResNet分类器,和基于CIFAR数据的扩散模型。

在这两个系统各三个独立随机种子的实验里,TL-G01和TL-G02重现了接收状态调制的训练响应和持久的支持重组,扩散模型部分独立核验了504条响应记录。INF-G01进一步在全部六个正式种子里都验证了精确状态保持、查询条件下的支持调用、非加性组合以及对训练形成组件版本的依赖。

这些结果排除了"这套理论只是nanoGPT特有的巧合"这种可能性,支持了这套动态确实具有跨系统的普适性。

写在后面

读这篇论文最触动我的地方,其实不是那些具体的准确率数字,而是研究方法本身的一种执拗。

作者没有先假设"注意力头很重要"或者"某个神经元代表某个概念",然后去验证这个假设,而是先建了一套什么都记录的系统,再从记录里一步步逼近答案。这种做法笨,但诚实。很多机器学习的可解释性研究其实是反过来的:先有一个直觉上"应该"成立的解释,再去找支持这个解释的证据,容易陷入确认偏误。

另一个让我意外的细节是TL-E07里那个数字:支持重新分配幅度和更新幅度的相关性是0.881,但和能力变化的相关性是0.765,两者不是1.0。这意味着支持重组和能力变化之间还有一段"缝隙"没被完全解释,这道缝隙恰好和后面TL-E08发现的"边界跨越"机制对上了:内部支持在持续变化,但只有跨过边界那一刻,外部才会看见变化。这两组实验的数字互相印证,让人觉得这套理论不是拼凑出来的,是真的在描述同一个现象的不同侧面。

还有一点值得单独说说。论文用了整整一节讲AI辅助科研的伦理边界,说清楚了哪些决策是人做的,哪些执行是AI系统协助完成的。在一个大家还在争论"AI能不能做科研"的时代,这种坦诚的分工说明,本身也是一种值得关注的态度。

这套理论目前只覆盖了监督式的目标预测场景,那些更复杂的、多步推理才能形成的能力,比如思维链推理,是不是也遵循同样的"接收状态+更新几何"框架,论文没有涉及。这大概是留给后续研究的一个开放问题。

Q&A

Q1:生成事实图GFG是用来做什么的?

A:GFG是一种记录计算和数据变化完整来龙去脉的结构,它把每一次具体的变换、发生场景、产生结果都记录成原子事实并互相关联,让AI系统能够直接查询和追溯任何一个结果是怎么一步步形成的。

Q2:为什么说推理是训练学习动态的冻结投影?

A:因为推理阶段模型参数不再变化,但当前的查询会调用并非加性地组合训练阶段已经形成的分布式功能支持,实验通过组件门控和回滚测试证明推理结果因果依赖于训练形成的具体参数版本,而不是重新学习。

Q3:这篇论文的二阶目标边界预测器准确率有多高?

A:在完全独立的确认数据集上,预测器达到91.43%的目标边界准确率和91.49%的宏平均召回率,在全部十二次训练运行的更大样本上准确率为92.17%,证明训练响应确实由目标边界状态、更新几何和接收状态这三个核心坐标决定。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-