
这项由南加州大学与芝加哥大学联合开展的研究,于2026年6月发表于机器学习领域的预印本平台arXiv,论文编号为arXiv:2606.03928。研究提出了一种名为VASE(Value-aware Stochastic KV Cache Eviction,价值感知随机键值缓存淘汰)的方法,专门针对当前最前沿的推理型大语言模型在长思考过程中面临的内存瓶颈问题。
当你让一个聪明的AI帮你解一道复杂的数学题时,它并不是一步就给出答案的。它会先在脑子里默默地推导,一步一步地想,把中间过程全部记录下来,最后才告诉你结果。这种"先想再答"的方式让AI变得更准确,但也带来了一个麻烦:它记录的中间内容越来越多,占用的内存也越来越大,到最后甚至会把整个系统拖垮。
研究团队发现了两个此前几乎被忽视的关键规律,并据此设计出一套既省内存又不影响准确率的解决方案,在六项不同推理任务上的表现甚至超过了当时最顶尖的同类方法。
一、AI的"工作记忆"为什么会爆满
要理解这个研究解决的问题,可以把推理型AI的工作过程想象成一个侦探在办案。侦探在解案过程中会把所有的线索、推断、笔记全部写在一块巨大的白板上,这样他回头翻看时就能找到之前想到的每一条推断。AI也是如此——每生成一个新词,它就需要把所有之前生成的内容"记"在一种叫做"KV缓存"(Key-Value Cache)的存储结构里,每次回答问题时都要翻阅这块"白板"。
问题在于,这块白板的大小是有限的,而推理型AI思考的链条又极其漫长。研究团队发现,即使是一道简单的算术题,模型也可能洋洋洒洒地写下超过900个词才给出答案。对于难度更高的竞赛数学题,模型平均要生成将近18000个词。这块白板很快就会被写满,内存和计算资源都会承受巨大压力。
现有的解决思路分为两大类。第一类叫做"选择性注意",相当于白板上的内容全都保留着,但侦探每次只精选其中一部分来参考,不用全部看一遍——这样可以节省时间,但白板本身还是越来越大,内存问题没有从根本上解决。第二类叫做"淘汰机制",意思是当白板写满时,把侦探认为"不重要"的笔记擦掉,给新内容腾出地方——这样白板永远不会超出预设大小,内存占用是固定的,但问题是一旦擦错了关键线索,案子就破不了了。
研究团队聚焦的正是第二类方法,也就是淘汰机制。他们的核心问题是:为什么现有的淘汰机制总是擦错线索,导致AI推理能力大打折扣?
二、侦探最不该丢的两类线索
研究团队提取了AI在推理过程中产生的所有"记忆条目",仔细分析它们的特征,从中找到了让擦除操作出错的根本原因。
KV缓存里存储的内容可以拆分成两个部分:一部分叫做"键"(Key),相当于侦探白板上每条笔记的"标题索引";另一部分叫做"值"(Value),相当于笔记的"正文内容"。现有的淘汰方法基本上只看标题索引,也就是只依据"这条笔记被翻查过多少次"来决定要不要擦掉它。但研究团队发现,正文内容本身的重要性完全被忽视了。
团队统计了大量"值"向量(即那些正文内容)的数值范围,发现它们的分布极度不均匀:绝大多数值的数值范围很窄,像一批普通的笔记,内容平平;但有极少数的值,数值范围异常地大,像几页密密麻麻、充满关键推断的笔记。这种分布就像一群身高差不多的普通人里突然混进了几个两米五的巨人,极为醒目。
为了验证这些"大范围值"(large-magnitude value states)是否真的至关重要,研究团队做了一个特意破坏实验:故意把这些"巨人笔记"率先从缓存中擦掉,看看AI的表现会怎样。结果令人震惊——AI在一个叫做GSM8K的数学问答测试集上的准确率从88%直线崩溃至14.3%,连随机删除笔记的效果(53.2%)都远不如。
更直观的是AI生成的内容:在这些关键条目被删除之后,模型开始陷入无限循环,反复重新审视题目,不断自我怀疑,像一个侦探把所有关键推断笔记都弄丢了,只剩下索引却找不到对应内容,于是开始反复问自己"这道题到底要求什么?等等,我再想想……等等,我刚才说的对吗?",却永远无法得出结论。
这个现象揭示了一个深层机制:AI注意力的输出是所有"值"的加权求和,数值范围越大的值,对输出结果的影响就越大,因为无论权重怎么分配,它们的绝对贡献量都会显著高于那些"普通笔记"。一旦这些高影响力的条目被删除,AI的推理进展就会卡住,陷入一种自我强化的循环困境。
三、随机性为什么反而帮了大忙
除了保护关键笔记之外,研究团队还发现了第二个被忽视的问题:现有的淘汰方法太"固执"了。
现有方法在决定保留哪些笔记时,总是按照固定的规则选择得分最高的那些,把其余的一律丢弃。这种方式就像侦探每次只保留自己最近最频繁翻阅的那几页笔记,久而久之,留下来的内容越来越同质化——全是侦探反复强调的那几条推断,而那些虽然不常被翻阅、但在某个关键时刻可能至关重要的线索,就这样被永久丢失了。
研究团队引入了"随机采样"的思路:保留笔记时不再总是按分数排名严格选取前几名,而是根据每条笔记的重要性分数作为权重进行随机抽签。这就像侦探在挑选保留笔记时,给每条笔记贴上不同大小的标签,重要的标签大、抽中概率高,但并非百分之百;不太重要的标签小,但也有一定机会被保留。
这种方式带来的好处是,保留下来的笔记更加多样化,覆盖的信息面更广。在长达数万词的推理过程中,任何一条"看起来不那么重要"的笔记,在之后的某个推导节点都可能突然变得关键。随机性相当于给缓存装上了"多样性缓冲器",防止AI的记忆越来越片面。
实验数据非常直观:对于一种叫做SnapKV的基础淘汰方法,仅仅把它的"严格选最高分"改成"按分数权重随机抽签",准确率就从64.3%提升到了70.9%,而什么都没改动,只是引入了随机性。对于另一种叫做CurDKV的方法,通过在每次淘汰时重新随机生成评分矩阵,准确率从78.6%跃升至87.6%,提升幅度高达9个百分点。
四、VASE是怎么把两个发现合在一起的
有了这两个发现,研究团队设计了VASE方案,把"保护大范围值"和"引入随机性"结合成一套完整的操作流程。
VASE的整体框架采用了一种叫做"周期性淘汰"的工作方式。白板(缓存)有一个固定容量上限,旁边还留着一个小区域作为"缓冲区",专门放最近刚写下的笔记。每当缓冲区写满,就触发一次淘汰操作:从整个白板上选出要清除的内容,然后清空缓冲区,重新开始。
具体来说,团队提出了两种VASE变体。第一种叫做VASE-AttnV,它在整个缓存预算里专门划出一块固定区域——类似于白板上永远不允许擦除的"重要档案区"——专门保存那些"值的范围最大"的笔记。这块区域大小约占总预算的四分之一。剩余的空间则用随机加权抽签的方式决定保留哪些普通笔记,抽签的权重来自于每条笔记被最近几次推理步骤查阅的频率。这样一来,高价值笔记稳稳当当地待在档案区,其余位置则通过随机性保证覆盖面足够广。
第二种叫做VASE-DKV,它的出发点是另一种基础方法CurDKV。CurDKV已经考虑到了"值"的信息,它通过一种叫做随机投影的数学技巧来评估每条笔记的重要性——大致上,范围更大的值会在投影后得到更高的分数,因此CurDKV天然就有一定的"值感知"能力。但它的问题是每次淘汰时都用同一个投影矩阵评分,某些笔记一旦第一次被判定为低分,就会在所有后续轮次中永远得低分,最终被淘汰出局。VASE-DKV的改进非常简洁:每次触发淘汰时,重新随机生成一个新的投影矩阵。这样每条笔记每次都面临独立的"重新评判",不会因为某次偶然的低分而被永久放弃。
五、实验结果:新方法到底强在哪里
研究团队在六项推理任务上进行了全面测试,包括顶级竞赛数学题(AIME25、AIME26、HMMT25)、研究生水平的科学问答(GPQA-Diamond)、数学题库(MATH)以及代码生成(LiveCodeBench-v6),分别在Qwen3-4B和Qwen3-14B两个规模的模型上运行,测试时将缓存压缩到原来的四分之一大小。
VASE-AttnV在4B模型上的平均准确率达到59.09%,在14B模型上达到65.81%。与之相比,之前最强的淘汰方法R-KV在4B和14B模型上分别只有54.69%和60.90%,差距分别达到4.4和4.9个百分点。VASE-DKV的表现同样突出,在4B模型上比CurDKV提高了7.7个百分点,在14B模型上提高了9.2个百分点。
更值得关注的是,VASE方法达到的平均准确率甚至超越了一种叫做SeerAttention-R的"选择性注意"方法——后者的内存占用会随着推理时间的增长而线性增加,VASE则始终维持固定的内存上限。换句话说,VASE用更省内存的方案,取得了比"不省内存"方案还要好的效果。
在极度压缩的情况下(将缓存压缩到原来约七分之一或八分之一),VASE相对于基线方法的优势最为明显;随着缓存预算增大,各方法的差距逐渐缩小,最终都趋近于完整模型的准确率。这说明VASE在资源最匮乏的场景下发挥作用最为显著,正是最需要帮助的地方,帮助最大。
代码生成任务上有一个有趣的反转:SeerAttention-R在LiveCodeBench上只有45.3%,远低于R-KV的62.6%和VASE-AttnV的63.5%。研究团队分析认为,SeerAttention-R的注意力预测门控需要经过专门训练,面对代码生成这种与训练数据分布差异较大的场景,泛化能力弱;而无需训练的淘汰方法则不存在这个问题。
六、这个发现还能用在哪里
研究团队的发现并不局限于"淘汰哪些缓存条目"这一个问题,它实际上揭示了"值的范围"(Range)这个数值特征的深层意义,而这个意义同样适用于另一种完全不同的压缩技术——量化(Quantization)。
量化是什么?简单来说,就是把一个精度很高的数字(比如小数点后很多位)压缩成一个精度更低的整数来存储,以此节省内存。就像把一张高清照片压缩成低分辨率版本——大多数情况下还认得出来,但如果原图里有很精细的细节,压缩后就会丢失。
研究团队发现,"值的范围"越大,量化时损失的信息就越多。原因是量化的步长(也就是数字分级的精细程度)直接由范围决定:范围小,步长小,量化精细,误差小;范围大,步长大,量化粗糙,误差大。团队用实际数据验证了这个关系,发现在不同的压缩精度和分组方式下,"值的范围"与量化误差的相关系数都在0.83到0.92之间,高度正相关。
这意味着,凡是"值范围大"的缓存条目,无论是在淘汰问题中还是在量化问题中,都应该被优先保护、优先分配更高的精度资源。研究团队提出了一个展望:未来可以设计一种混合精度方案,把大范围值存放在高精度缓存区,其余条目压缩到低精度,从而在同样的内存预算下进一步提升保真度。
七、实际运行的速度和内存表现
方法再好,如果实际跑起来速度很慢或者占内存很多,也没有实用价值。研究团队专门在一块A100 80GB显卡上对Qwen3-14B进行了实际吞吐量和内存占用的测试,以确保理论上的优势能落地成真实的工程收益。
测试结果显示,在生成1.6万词并使用2048条目缓存预算的条件下,VASE-DKV的生成速度达到每秒411个词,而完整模型(不压缩缓存)只有133个词每秒,速度提升了3.1倍。在生成3.2万词时,完整模型因内存不足直接崩溃(OOM),而所有淘汰方法都能正常运行。
内存方面,以使用4096条目缓存预算为例,完整模型占用68.7GB显存,R-KV占用42.4GB,VASE-AttnV占用39.6GB,VASE-DKV只需38.9GB。如果刨去模型权重本身占用的约30GB不变内存,VASE-DKV的KV缓存实际压缩比与理论预期的4倍非常接近,说明方法的内存控制非常精确。
此外,VASE-DKV比VASE-AttnV更快、更省内存,原因在于VASE-DKV在淘汰时不需要计算注意力分数,而VASE-AttnV需要;VASE-AttnV又比R-KV更快,因为R-KV每次淘汰时需要额外计算所有笔记之间的相似度来衡量"冗余度",这一步计算量不小。
归根结底,这项研究做的事情,就是找到了两把被忽视已久的钥匙——"保护高价值记忆"和"用随机性带来多样性"——然后把它们插入了推理AI的记忆管理系统,让AI在思考极长链条时,既不会因为记不住关键内容而陷入死循环,也不会因为记的内容太片面而偏离推理轨道。在压缩到四分之一内存的条件下,这套方案的平均推理准确率不仅超过了其他所有淘汰方法,甚至与那些完整保留全部记忆(但内存持续增长)的方法打了个平手。
这对普通用户意味着什么?当你在手机或个人电脑上运行一个推理型AI助手时,有限的内存一直是制约模型能力的瓶颈。这项研究提供的方案,有望让同等硬件条件下的AI能处理更长、更复杂的问题,而不会因内存不足而截断思考或降低质量。有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.03928查阅完整论文。
Q&A
Q1:KV缓存淘汰方法和KV缓存选择方法有什么区别?
A:KV缓存选择方法把所有历史记忆都保留在内存中,每次推理时只挑部分来用,内存占用会随生成长度持续增长;KV缓存淘汰方法则是把"不重要"的记忆条目永久删除,将内存控制在一个固定上限内,适合长时间连续推理,但删错了就会造成不可挽回的信息损失。
Q2:VASE方法里说的"值的范围"(Range)到底是怎么算的?
A:对于缓存中存储的每一条记忆向量,"值的范围"就是这个向量里数值最大的那个维度减去数值最小的那个维度得到的差值。范围越大,说明这条记忆对最终输出的影响越大,也越容易在量化压缩时产生较大误差,因此VASE会优先将这类条目保护起来,不允许被淘汰。
Q3:VASE方法为什么在代码生成任务上比SeerAttention-R表现更好?
A:SeerAttention-R依赖一个经过专门训练的"注意力门控"模块来预测哪些缓存条目值得关注,这个模块对训练数据分布以外的任务泛化能力有限;而VASE是完全无需训练的方法,纯粹基于当前数据的统计特征做决策,因此在代码生成这类与数学推理分布差异较大的任务上,反而展现出更强的适应性。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。