
这项由腾讯混元、西湖大学、悉尼大学和香港科技大学联合开展的研究,以预印本形式于2026年6月9日发布,编号为arXiv:2606.11075v1,感兴趣的读者可以通过该编号查询完整论文。
**一、故事从一个"训练太费钱"的烦恼说起**
现在市面上那些能根据文字描述生成精美图片的AI,比如能画出"落日下奔跑的金毛犬"或"赛博朋克风格的北京胡同"的模型,已经相当厉害了。但有一个让研究人员头疼的问题一直存在:这些AI虽然能画图,却不太懂得"人类审美"。它们画出来的东西可能技术上没问题,但就是不那么讨人喜欢。
为了解决这个问题,研究人员想到了一个思路:让AI在生成图片的过程中,实时接收一个"好看程度评分"(专业上叫做奖励信号),然后根据这个分数调整自己的参数,变得越来越符合人类审美。这种方法叫做"直接奖励反向传播",其核心优势在于它非常节省样本——不需要生成海量图片对比好坏,只需要沿着已有的生成轨迹直接计算梯度、调整参数就行。
然而,这条路走起来有两块大石头挡道。
第一块石头是"记忆力"问题。AI生成一张图片,其实是一步一步去噪的过程,就像把一堆随机噪点慢慢雕刻成一幅画,通常需要20到50步。要让AI从最终结果反向学习,就需要把每一步的"中间状态"都保存在显存里,以便事后计算梯度。但对于现在动辄数十亿参数的大模型来说,这根本装不下——就好像你要同时记住一场1000道菜的宴席里每道菜的每个烹饪细节,大脑早就爆了。
第二块石头是"梯度爆炸"问题。从最终图片往回追溯到早期的生成步骤,梯度(也就是"应该如何调整参数"的信号)需要乘以一个又一个"雅可比矩阵"(可以理解为每一步操作对下一步的影响系数)。这些矩阵连乘下来,就像利率叠加一样,可能让信号急剧膨胀或衰减到无法使用,导致训练不稳定。
面对这两块石头,之前的方法各自找到了绕行小路,但都有局限。有人只保留最后几步做梯度计算,有人用稀疏采样跳过大部分步骤,有人干脆在中间截断梯度不让它往前传。最新的方法LeapAlign则引入了一种"跳跃连接"的思路:不走完整的生成轨迹,而是构建两段简短的"代理路径"来替代整个轨迹。这个思路很聪明,但问题在于,这两段代理路径如果跨度太大,就会和真实生成轨迹偏差很大,导致梯度信号失真。
研究团队在深入分析这些方法后意识到,其实所有的"直接奖励反向传播"方法,本质上都是在做同一件事:在真实生成轨迹之外,构造一条轻量的"代理轨迹"来传递梯度。既然如此,何不把这条代理轨迹的设计本身当作研究对象,系统地探索它的最优形式?这正是FlowBP这个统一框架诞生的出发点。
**二、把"代理轨迹"的设计拆成四个旋钮**
可以把AI生成图片的过程理解为一条流水线:从纯噪声(原材料)出发,经过N道工序(去噪步骤),最终得到成品图片。研究团队的核心洞察是:与其保留这条完整流水线的全部记录来计算梯度,不如先让流水线正常跑完(不留记录,节省内存),把每道工序的输入和速度(专业术语叫"速度场")都缓存下来,然后用这些缓存数据拼一条轻量的"代理流水线"专门用于梯度计算。
这条代理流水线的设计,被研究团队拆解为四个独立的旋钮。
第一个旋钮叫做"奖励模型的输入",也就是评分员看的是哪张图。是看最终成品(真实生成的图片),还是看一个粗糙的预测版本(从某个中间步骤直接推算出的"预期成品")?这个区别很关键——就像你评价一道菜,是尝真实出锅的成品,还是根据食材推测出的味道?显然前者更准确,但后者更容易获取。
第二个旋钮叫做"激活集",即哪些工序步骤被选中来参与梯度计算。被选中的步骤需要重新用模型正向计算一次(这会消耗内存),没被选中的步骤直接用缓存数据。激活集的大小直接决定了内存消耗和梯度信息的丰富程度。
第三个旋钮叫做"积分权重",即各个激活步骤的贡献如何加权合并。最简单的方式是用欧拉法(每一步的时间间隔作为权重),更精细的方式是用拉格朗日插值法(根据速度场的弯曲程度自动调整权重),后者就像用一把能根据曲线自动弯曲的尺子来量距离,比直尺更精确。
第四个旋钮叫做"桥接耦合",即是否在代理轨迹中设置一个"中继站",让前半段和后半段的梯度能够相互影响,以及影响程度有多强(用一个0到1之间的参数α控制)。没有中继站时,梯度只在激活步骤内部计算,互不干扰;有中继站时,后半段的梯度可以通过中继站影响前半段的参数更新,提供更丰富的跨步骤信息。
这四个旋钮的不同组合,就构成了一个完整的设计空间。研究团队发现,之前所有的直接梯度方法,其实都是这个设计空间里的某个特定点。ReFL(Xu等人,2023年)相当于激活集只有一个步骤、没有中继站、评分员看的是预测图。DRaFT-LV(Clark等人,2024年)和ReFL类似,但专门选最后一步,并通过多次随机采样来降低梯度方差。DRTune(Wu等人,2024年)扩大了激活集到稀疏的多个步骤,但同样没有中继站,评分员还是看预测图。LeapAlign(Liang等人,2026年)是唯一一个让评分员看真实成品图、并且有中继站的方法,但每段只用一个速度点来近似,跨度太大时偏差明显。
**三、三种新配方:各有侧重的代理轨迹方案**
在这个统一框架下,研究团队提出了三种新的方法,分别在不同维度上探索设计空间中此前未被开发的区域。
FlowBP-Sparse(稀疏欧拉重建法)是最干净利落的一种。它的做法是:把整条流水线的缓存数据重新播放一遍,从头到尾用欧拉步长(就是每步的时间间隔)作为权重,但只随机挑选K个步骤重新用模型计算速度(其余步骤直接用缓存速度)。由于缓存速度和重算速度的数值相同,两者在计算时恰好抵消,最终拼出来的代理轨迹终点和真实生成的图片完全一致。这意味着评分员看的是真正的成品图,而且完全不需要桥接连接器(中继站),梯度计算彻底解耦,内存只和K的大小成正比,没有跨步骤的梯度连乘,从根本上消除了梯度爆炸。
FlowBP-Bridge(桥接欧拉法)是在FlowBP-Sparse的基础上加了一个中继站。它把整条轨迹在某个中间点j处分成前后两段,前段和后段各自用欧拉重建,保证两段的端点都和真实轨迹完全吻合(不存在偏差)。中继站处的梯度耦合强度由参数α控制。当α等于零时,它退化为FlowBP-Sparse;当α大于零时,后半段的梯度可以通过中继站传递到前半段,提供额外的跨段信息。关键区别在于,这个中继站是用欧拉重建精确定位的,而不是LeapAlign那种单速度近似,所以偏差极小。
FlowBP-Lagrange(拉格朗日高阶插值法)走的是另一条路:不抛弃LeapAlign的两段连接器结构,而是把LeapAlign每段只用一个速度点的粗糙近似,升级为多点拉格朗日插值。可以这样理解:LeapAlign用一根直线连接轨迹的两端(一阶近似),而FlowBP-Lagrange用一条高次曲线穿过多个速度点来拟合真实轨迹(高阶近似),自然更精确。更多的支撑点意味着连接器误差更小,从而减少了中继站和终点处的偏差。为了防止高阶修正项把梯度放大得太离谱,研究团队还引入了一个"梯度支撑缩放因子"(参数gs),对非锚点的激活步骤的梯度贡献进行适度衰减。
这三种方法形成了一个互补的谱系。FlowBP-Lagrange更接近LeapAlign,通过提高数值精度来减少连接器偏差,激活步骤数不超过一个预算上限M。FlowBP-Sparse和FlowBP-Bridge则走结构上的根治路线,用欧拉重建从根本上消除终点偏差,区别在于后者多了一个可调强度的跨段梯度路径。
**四、实验:在三个不同"厨房"里检验新配方**
为了验证这三种方法的实际效果,研究团队选择了三个规模和架构各不相同的文生图流匹配模型作为测试平台:SD3.5-M(约数十亿参数)、FLUX.1-dev(约120亿参数)和FLUX.2-Klein-base(约90亿参数)。对照组包括四种基线方法:ReFL、DRaFT-LV、DRTune和LeapAlign,均按照各自原始论文的设置实现。
训练时,所有方法都用HPSv2.1作为可微分奖励模型(可以理解为一个会给图片打"人类偏好分"的评分程序),对HPDv2数据集的提示词进行训练。评估时,团队在400个保留测试提示词上用五个指标打分:HPSv2.1(训练时用的同款评分,属于"自家考卷")、PickScore、ImageReward(这三个都是衡量人类偏好对齐程度的)、UR-Align(图文匹配度)和UR-IQ(图片综合质量)。由于HPSv2.1是训练奖励,后四个可以视为"外部考官"的成绩。
训练配置保持统一:在线生成512×512分辨率图片,采样25步,用AdamW优化器,学习率1×10??,批量大小64,SD3.5-M训练250次迭代,两个FLUX模型训练300次迭代。评估时用50步采样。
结果相当清晰。在SD3.5-M上,FlowBP-Lagrange在HPSv2.1、PickScore、ImageReward和UR-Align四项上领先,FlowBP-Sparse在UR-IQ上最佳。在FLUX.1-dev上,FlowBP-Lagrange拿下HPSv2.1和UR-Align,FlowBP-Bridge则在PickScore、ImageReward和UR-IQ上领先。在FLUX.2-Klein-base上,FlowBP-Bridge和FlowBP-Sparse分别在HPSv2.1与PickScore、ImageReward、UR-IQ上拔得头筹,只有UR-Align一项LeapAlign略胜一筹。
这个"各有所长、轮流领跑"的格局本身就很有意思:三种方法捕捉到了奖励景观的不同侧面,而非简单地哪一个全面碾压。
研究团队还在FLUX.1-dev上用GenEval基准测试了构图生成能力(比如"画一张有两只猫和一条狗的图"这类需要精确控制数量、颜色、空间关系的任务)。FlowBP-Lagrange把整体得分从63.25提升到了69.88,在颜色、双对象和属性绑定三个子任务上最佳;FlowBP-Bridge总分第二,在空间位置任务上表现最好。这说明偏好对齐的提升并没有以牺牲构图准确性为代价。
**五、拆解"为什么有效":四个旋钮的独立验证**
研究团队用FLUX.1-dev做了一系列消融实验,逐一验证四个设计旋钮各自的贡献。
关于"奖励模型的输入"这个旋钮,研究团队做了一个干净的对照实验:把ReFL和DRTune原本看"预测图"的设置,改成FlowBP-Sparse的欧拉重建方式让评分员看真实成品图,其他所有设置保持不变。结果是五项指标全部提升,说明仅仅把评分员的视角从"预测图"换成"真实图",就能带来实质性的改进,这是改进的第一步。
关于FlowBP-Lagrange的"积分权重"旋钮,研究团队对比了不同阶数(2到5阶)的拉格朗日插值效果。更高的阶数带来更高的训练奖励,且轨迹终点的预测误差(连接器残差d?)也明显更低,而同等支撑点数量的均匀权重(不用积分计算,直接平均)则明显更差。这证明了权重的精确计算(积分拉格朗日基函数)而非简单的支撑点数量才是关键。梯度支撑缩放因子gs也有一个最优区间:太小相当于退回LeapAlign,太大会使高阶修正项过强导致训练不稳。
研究团队还在图7中展示了一个关键的失效模式分析:在LeapAlign的训练过程中,有些时间段连接器终点偏差d?会突然飙升,而这些峰值恰好和训练奖励下跌的时间重合。原因很直观——当终点偏差太大时,评分员其实是在评价一张和真实生成图相差甚远的"错误图片",梯度信号因此失真,训练崩溃。FlowBP-Lagrange通过更精确的高阶连接器,把d?保持在一个更低、更稳定的水平,从而规避了这个失效模式。
关于FlowBP-Bridge的"桥接耦合"旋钮,实验发现适中的α值(比如0.1到0.3)效果最好,太接近0退化为FlowBP-Sparse,太接近1则把跨段雅可比项放大到不稳定的程度。激活步骤数K同样有一个甜点区间:太少信息不足,太多内存压力增大且收益边际递减。
关于FlowBP-Sparse的"激活集"旋钮,实验表明K从1逐步增加到4到5时,训练奖励稳步上升;K继续增大后,提升趋于饱和,选择紧凑但非平凡的K值是合适的默认设置。
**六、这套框架如何读懂所有前辈方法**
FlowBP框架最优雅的一点在于它的统一性:它不只是提出了新方法,还为整个领域提供了一张地图。研究团队用"奖励路径保真度C"和"嵌套耦合保真度Fnest"两个指标,把所有方法标注在一个二维坐标系上。
奖励路径保真度C衡量的是激活步骤的覆盖程度与终点估计准确性的综合表现。嵌套耦合保真度Fnest则衡量代理轨迹保留了多少跨步骤梯度耦合,以及这条耦合路径有多准确(分母是最长梯度链深度,分子是连接器准确度)。
在这张地图上,ReFL、DRaFT-LV和DRTune都聚集在低C(只看预测图)、低Fnest(无跨步耦合)的角落,是"单步优化、预测图评分"的一族。LeapAlign跃入了高C(看真实图)、有Fnest(有跨段耦合)的区域,但受限于单速度连接器的精度。FlowBP-Sparse落在高C、零Fnest的位置(重建了终点但完全解耦)。FlowBP-Bridge落在高C、中等Fnest(重建了终点并引入受控耦合)。FlowBP-Lagrange则在高C(提升了连接器精度从而接近真实终点)、高Fnest(保留了耦合且连接器更准)的区域,最接近理想的全量反向传播方法。
这张地图的意义在于,它清晰揭示了整个设计空间中哪些区域此前从未被探索,并为未来的研究者指明了方向。
**七、工程实现中的一些重要细节**
训练中有几个工程细节值得关注,因为它们对方法的稳定性有实质影响。
在选取跳跃索引(即前段起点k和中继站j的位置)时,均匀随机采样可能导致两个端点太近或k太靠近噪声端,增加梯度方差。研究团队采用了狄利克雷采样(Dirichlet采样,参数为2.5、6.0、2.0),把有效反向索引范围分成三段,分别控制k的位置、k到j的间距以及j的位置,使采样更均匀,训练信号更稳定。对于SD3.5-M和FLUX.2-Klein-base,还额外把k的反向索引上限设为10,避免在轨迹早期(噪声端附近)放置激活步骤导致训练不稳。
对于连接器类方法,还引入了一种基于连接器残差的损失重加权:d_j和d?越小(即代理轨迹与真实轨迹越接近),对应样本的损失权重越大;d_j和d?越大(偏差越大),损失权重越小。这让训练在代理轨迹质量更高时受到更多信号,在质量较差时适当降低影响,进一步提高了稳定性。
在梯度缩放方面,由于激活集只包含全部步骤的一个子集,每个激活步骤实际承担了比完整重建时更多的"配额"。研究团队引入了一个梯度重缩放因子g(基于激活步骤权重之和与全段权重之和的比值),通过止步梯度恒等式对激活速度的梯度进行适度放大,补偿激活集稀疏带来的信号衰减。
FLUX.2-Klein-base还有额外的特殊处理:用Qwen3大语言模型预计算文本嵌入(最大序列长度512),并拼接第9、18、27层的隐藏状态作为文本条件输入,因为FLUX.2-Klein-base的文本编码器结构与其他模型有所不同。
说到底,这项研究做的事情并不复杂:它把一个"大家都在做但谁都没有系统研究"的问题——如何设计直接奖励反向传播的代理轨迹——摆上了台面,拆成四个清晰的旋钮,画出了整个设计空间的地图,然后在地图上发现了三块此前没人踏足的土地,并验证了这三块土地确实比现有的营地更适合居住。
这对于文生图领域的研究者来说意味着一套可操作的指南:奖励模型应当评价真实生成的图片而非预测图;积分权重应当精确计算而非随意平均;激活集应当紧凑但覆盖有意义的步骤;桥接耦合有用但必须有所控制,不能放任梯度链无限延伸。这四条原则不依赖于具体的模型架构,理论上适用于任何基于欧拉步求解的流匹配或扩散模型。
至于这项研究对普通用户的影响,可能短期内感受不到——毕竟模型对齐是基础研究层面的工作。但从长远看,正是这类方法的积累,让未来的文生图模型能够以更低的计算成本、更快的训练速度,学会更符合人类审美的图像生成方式。下次你看到AI生成的图片越来越好看,背后或许就有这类梯度设计工作在默默发挥作用。如果想进一步了解技术细节,可以通过arXiv编号2606.11075查阅完整论文。
---
Q&A
Q1:FlowBP框架和LeapAlign的核心区别是什么?
A:LeapAlign用单一速度点近似每段轨迹,当跨度较长时偏差较大,可能导致训练不稳。FlowBP框架把代理轨迹的设计拆解为四个独立旋钮,提出了三种新方法:FlowBP-Sparse通过欧拉重建从结构上消除终点偏差、完全解耦梯度;FlowBP-Bridge在此基础上加入可调强度的跨段耦合;FlowBP-Lagrange则通过高阶拉格朗日插值从数值上提升LeapAlign连接器的精度。
Q2:FlowBP方法是如何解决显存不足问题的?
A:FlowBP系列方法先做一次无梯度的完整轨迹推理并缓存状态,然后只对少量选定步骤(激活集)重新进行带梯度的前向计算。内存消耗与激活集大小K成正比,而非与全部采样步数N成正比,从而大幅降低了显存需求。
Q3:FlowBP-Lagrange中的拉格朗日权重比均匀权重好在哪里?
A:均匀权重相当于假设速度场在整段轨迹内恒定,而拉格朗日权重通过积分多项式基函数,自动根据支撑点分布计算出更能反映真实轨迹弯曲程度的加权系数。实验显示,相同支撑点数量下,拉格朗日权重的连接器终点误差显著低于均匀权重,对应的训练奖励也更高且更稳定。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。