微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 香港中文大学、华南理工大学与南洋理工大学联手:让AI自己批改作业,强化学习效果提升8.5%

香港中文大学、华南理工大学与南洋理工大学联手:让AI自己批改作业,强化学习效果提升8.5%

2026-07-29 16:41
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-29 16:41 科技行者

这项由香港中文大学、华南理工大学和南洋理工大学联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.14614,有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

当一个学生独自做完一道数学题,他很可能不知道自己哪里算错了。但如果老师把标准答案放在他面前,让他对照着重新审视自己的解题过程,错误就会立刻变得清晰可见。这个朴素的学习场景,正是这篇论文背后的核心灵感——而研究团队将这个灵感用在了训练AI的方法上,取得了相当可观的效果。

研究团队提出的方法叫做"对比策略优化"(Contrastive Policy Optimization,简称CPO)。它的目标是解决当前主流AI强化学习训练中一个长期被忽视的痛点:训练信号太粗糙,AI不知道自己哪句话说对了、哪句话说错了,只知道整个回答的最终得分。CPO通过让AI把自己的回答和参考答案做对比,在每一个具体的词语层面判断对错,从而让训练信号变得精细而可靠。在数学推理任务上,这个方法让AI的平均表现分别比基线方法提升了7.7%和8.5%,同时在完全没有训练过的其他知识领域里,表现也没有下降,甚至还有提升。

---

一、训练AI就像批改作文——但现在的方法只打了个总分

要理解这篇研究解决了什么问题,先要了解当前AI是怎么学会推理的。

现在让大型语言模型学会解数学题或者写代码,最流行的方式叫做"强化学习"(Reinforcement Learning with Verifiable Rewards,简称RLVR)。这种方式的核心逻辑很直接:让AI生成一堆答案,然后告诉它哪些对、哪些错,对的答案被强化,错的被压制,AI在这个反馈循环中逐渐变得更聪明。

其中一个特别流行的具体算法叫GRPO(Group Relative Policy Optimization),由DeepSeek团队在2024年提出,也是目前很多顶级推理模型背后的技术基础。GRPO的做法是:对同一道题生成一批答案,然后根据每个答案的正确与否来打分,再用这个分数来指导模型怎么调整。

但这里有一个根本性的问题。GRPO给每个答案的每一个词都打同样的分数——如果整个答案是对的,那么答案里的每一个词都被认为是对的;如果整个答案是错的,那么每个词都被认为是错的。这就像一篇作文老师只在最后写了"80分",却没有具体指出哪段写得好、哪句话有问题。学生拿到这个反馈,只知道整体差不多,却根本不知道该从哪里改起。

更麻烦的是,还有一种叫"零优势"的情况。当AI对某道题的所有回答要么全对要么全错时,所有答案的得分一样,相互一比较,差值为零,模型根本学不到任何东西。这批数据就被白白浪费了。

为了给每个词打出不同的分数,研究者们想到用"熵"(entropy)这个概念来区分重要的词和不重要的词。熵是信息论里衡量不确定性的指标——一个词的熵越高,意味着模型在这个位置越犹豫、越不确定。直觉上,越难做决定的地方,往往越关键。于是有研究者给高熵的词打更高的分,希望让模型更认真对待那些它拿不定主意的地方。

然而,这个思路有一个致命的缺陷:熵只能衡量"不确定",却无法判断"不确定是因为有创意的探索,还是因为彻底搞错了方向"。一个学生在解题时犯难,可能是因为他在认真思考两种正确思路哪个更优雅,也可能是因为他已经走入了一个错误的死胡同,根本不知道怎么继续。这两种情况的熵可能一样高,但它们对学习的价值却截然相反。有些研究奖励高熵词,另一些研究却惩罚高熵词,方向完全相反,这本身就说明熵作为信号存在根本性的模糊性。

研究团队意识到,真正需要的不是一个衡量"不确定程度"的信号,而是一个直接衡量"对不对"的信号。而这正是CPO的出发点。

---

二、对照答案看自己的作业:一个简单想法的精妙实现

研究团队的核心洞察来自一个非常日常的观察:一个学生自己检查作业时,很难发现自己的错误;但当他手里拿着标准答案,再回头看自己的每一步推导时,错误就几乎是显而易见的。

类似的现象在大语言模型上也存在。当模型只看自己生成的内容时,它对每个词的生成概率反映的是它"自己认为怎样最合理"。但如果你在提示词里加上正确答案,让模型重新对同一段文字打分,概率分布就会发生变化:那些与正确答案一致的词,概率会升高;那些走向错误方向的词,概率会降低。

这个概率的变化,就是CPO所说的"对比性分歧"(contrastive disagreement)。具体来说,对于回答中的每一个词,CPO会计算两个数字:一是模型在正常状态下生成这个词的概率(叫做"先验概率"),二是模型在看到正确答案之后对这个词的评分概率(叫做"后验概率")。把这两个概率取对数相减,就得到了一个代表"对比性分歧"的数值。

如果这个数值是正的,说明知道了正确答案之后,模型觉得这个词更合理了——这个词可能是朝向正确方向的。如果这个数值是负的,说明知道了正确答案之后,模型觉得这个词反而不太对劲——这个词很可能是导向错误的。

研究团队在理论上严格证明了这个"对比性分歧"与"这个词实际上能否导向正确答案的概率"之间存在单调递增的关系。换句话说,分歧越负,这个词越可能是错的;分歧越正,这个词越可能是对的。这个结论不依赖于整个回答最终是对还是错——即使对于一个最终答案错误的回答,CPO也能在其内部找出哪些词是转折点,哪些词把推理带偏了。

为了在实践中获取后验概率,研究团队设计了一个巧妙的提示词。他们把问题和正确答案都告诉模型,然后让模型"用第一人称、实时解题的语气,重新生成一遍推理过程",同时严格要求模型不能说"根据参考答案……"这类泄露已知答案的话。这个设计的目的是让模型的生成更接近真实的推理状态,而不是简单地把答案复述一遍,从而让后验概率真正反映出"知道答案之后的推理倾向",而不仅仅是"照抄答案"。

---

三、实验验证:理论上说得通,现实中也管用

提出理论之后,研究团队用实验来验证"对比性分歧真的能判断一个词是对是错"这个核心主张。

他们用的方法很直观:选取Qwen2.5-7B这个数学模型,让它在MATH-500数学题库上生成回答。对于每一个回答,他们计算出每个词的对比性分歧值,然后找出第一个分歧特别大(无论是特别正还是特别负)的词。接下来,他们从这个词的位置开始,重新让模型继续往后生成,重复16次,看看平均有多少次能得到正确答案。如果对比性分歧真的能判断对错,那么从一个分歧特别负的词开始续写,正确率应该低;从一个分歧特别正的词开始续写,正确率应该高。

实验结果清晰地支持了这个预测。当研究者选取分歧值非常负(对应exp(δ)=0.1)的词作为起始点时,正确率从基准的57%大幅下滑到约48%——这说明那些词确实是"走错方向"的关键节点。而选取分歧值为正的词作为起始点时,正确率基本保持在基准水平附近。

这种不对称性其实是合理的:找到"正确"的词并不一定能让模型做得更好,因为模型本来的能力就在那里;但找到"错误"的词,能明确揭示推理在哪里出了问题。这个不对称性本身,也进一步印证了对比性分歧作为"错误检测器"的可靠性。

---

四、把对比信号融入训练:CPO的具体机制

有了可靠的对比性分歧作为信号,下一步就是把它整合进强化学习的训练流程里。

在标准的GRPO训练中,每个词获得的训练信号(叫做"优势值")来自整个回答的得分。CPO在这个基础上加入了词级别的对比性分歧,让每个词的优势值既考虑整体回答的对错,又考虑这个词本身在正确方向上的贡献。

这里有一个需要小心处理的问题:词级别信号和句级别信号可能发生冲突。比如,一个整体正确的回答(句级别得分为正),其中某个词的对比性分歧可能是很负的(词级别信号为负)。如果直接相加,这个词的优势值可能变成负数,等于告诉模型"这个出现在正确回答里的词是不好的",这显然会造成混乱。

研究团队的解决方案是引入一个"截断"操作:允许词级别信号调整优势值的大小,但不允许它改变优势值的方向。也就是说,如果整体回答是正确的,那这个词的优势值可以因为词级别信号而变小,但绝对不能变成负数;如果整体回答是错误的,词级别信号可以让优势值变小(减小对错误的惩罚),但不能让它变成正数。这个设计保证了整体正确方向不会被词级别的局部噪声所颠覆。

对于"零优势"问题,CPO的处理方式尤为优雅。当所有答案要么全对要么全错时,GRPO什么也学不到,这批数据就废了。但CPO不会放弃这批数据——它直接用词级别的对比性分歧作为这些词的优势值。虽然没有整体得分的指引,但词级别的信号仍然能告诉模型"在这道题里,哪些词更对、哪些词更错",让模型从原本白白浪费的数据中也能学到东西。

---

五、实验结果:从数学题到常识推理,全面超越对手

研究团队在两个基础模型上测试了CPO:一个是专门针对数学领域优化的Qwen2.5-Math-7B,另一个是通用型的Qwen3-Base-4B。训练数据是7500道数学题,评估涵盖了多个难度层次的数学竞赛题库,以及完全不相关的领域外测试,包括研究生水平的科学题(GPQA)、多学科综合理解(MMLU-Pro)和常识逻辑推理(KnowLogic)。

在数学专项模型Qwen2.5-Math-7B上,CPO的平均分达到70.2,而基础的GRPO只有62.5,提升了7.7个百分点。在难度最高的AIME2025竞赛题上,GRPO得分是30,CPO达到43.3,几乎提升了50%。在通用模型Qwen3-Base-4B上,CPO平均分达到77.0,GRPO只有68.5,提升了8.5个百分点。

更值得关注的是领域外表现。大多数强化学习方法在数学上训练之后,其他领域的能力会明显下降——这是因为模型过度适应了数学题的解题模式。但CPO不但没有下降,反而在GPQA上比没有经过强化学习的原始Qwen3-Base-4B高出1.5%,在MMLU-Pro上高出2.8%。研究团队的解释是:CPO的对比性信号来自模型自身,避免了引入外部偏好,而词级别的精准奖惩也让模型不会过度强化某些特定的表达模式。

研究团队还把CPO与一系列基于熵的方法做了对比,包括只训练高熵词的Entropy-Tokens、用熵调整优势值的Entropy-Adv、用负熵作为奖励的EM-RL-token、专门处理零优势问题的RL-ZVP,以及结合信息瓶颈理论的IB-reg。在几乎所有测试项目上,CPO都超过了这些方法,有些差距相当悬殊。

---

六、对比性分歧不只是个训练技巧,它还统一了一个更大的框架

研究团队发现,CPO的对比性分歧在数学形式上和另一种流行的技术"在线策略蒸馏"(On-Policy Distillation,OPD)有深刻的内在联系。

OPD的做法是:用一个更强的大模型(比如Qwen2.5-Math-72B)来指导小模型。具体来说,小模型先生成答案,然后用大模型对这些答案进行评分,计算小模型和大模型之间的KL散度(一种衡量两个概率分布差异的指标),再用这个散度来调整小模型的训练。研究团队证明,这个KL散度在数学形式上就是对比性分歧的一个特例——只不过这里"后验分布"不是参考答案引导下的自身,而是一个外部的强大教师模型。

这个发现把CPO和OPD统一在了同一个理论框架下:核心思路都是用一个"更了解正确答案的分布"来和当前模型的分布做对比,差异就是学习信号。区别只在于"更了解正确答案的分布"从哪里来——可以来自外部更强的模型,可以来自参考答案条件下的自身,也可以来自其他任何形式的正确性信息。

研究团队还专门做了实验比较不同后验分布的效果:直接用Qwen2.5-Math-72B作为后验分布,仅用参考答案条件下的自身作为后验分布,以及把两者结合。结果发现,参考答案引导的自身表现出色,甚至在领域内数学任务上超过了直接使用72B大模型。而把72B大模型和参考答案结合使用,则能取得最佳效果。这说明参考答案提供的是直接的、实例级别的正确性信号,而大模型提供的是泛化能力和通用推理模式,两者是互补的。

---

七、消融实验:拆开CPO的每一个零件,验证它们各自的贡献

研究团队还系统地测试了CPO每个设计选择的重要性,以确认它们都是不可或缺的。

首先是正确回答和错误回答各自的作用。当只对错误的回答应用CPO时,数学能力基本保留,但领域外表现下降(MMLU-Pro下降4.2%)。当只对正确的回答应用CPO时,情况相反:数学提升有限,但领域外能力更好。这说明错误回答主要帮助模型找到自己的弱点并加以改进(偏向"利用"已知知识),而正确回答帮助模型探索多样化的解题路径(偏向"探索"新可能)。两者结合才能既在专项任务上进步,又不失去通用能力。

其次是提示词设计的影响。研究团队测试了三种不同格式:默认的单轮第一人称提示词、把问题和参考答案分两轮呈现的格式、以及用固定例题替换参考答案的少样本格式。结果显示默认格式最好。当参考答案是当前具体问题的答案时,对比信号最为准确可靠;用不相关例题替换,效果明显变差。

在优势计算机制上,研究团队测试了去掉截断操作的版本,结果在最难的AIME题目上表现明显下降,印证了保持信号方向一致性对于复杂推理任务的重要性。他们还测试了把词级别分歧在整个回答内部求平均、变成句级别信号的版本(类似GSPO的做法),结果领域外表现大幅下降,说明词级别的精细信号不能被粗化为句级别。

---

八、深入分析:CPO为什么让AI保持了更好的探索能力

研究团队还仔细分析了CPO与GRPO在训练过程中的动态差异,找到了CPO更优秀的深层原因。

训练过程中,GRPO的熵(即模型输出的不确定性)会迅速趋近于零,这意味着模型越来越"固执",每次对同一道题都给出几乎相同的回答,多样性极低。相比之下,CPO的熵在训练过程中维持在一个相对较高的平台上,说明模型保留了探索不同解题路径的能力。

这种差异在Pass@K指标上体现得最为明显。Pass@K衡量的是:对同一道题生成K个回答,只要有一个对就算通过。当K从1增加到16时,GRPO的提升很有限,有时甚至在领域外任务上随K增大而下降——说明GRPO训练出来的模型,多生成几次也是差不多的回答,没有多少多样性价值。而CPO随着K的增大持续提升,说明它不只是让每次单独的回答更好,还保留了尝试不同方法的能力,在多次尝试中更有可能命中正确答案。

研究团队还把正确回答和错误回答对训练的贡献用α+和α–两个参数来控制,α+大意味着更看重正确回答的对比信号,α–大意味着更看重错误回答的对比信号。实验发现,α+越大,训练过程中熵越高,模型越倾向于探索;α–越大,熵越低,模型越倾向于利用已知的好路径。1:1的比例在AIME2025和MMLU-Pro两个测试集上都达到了最佳Pass@K,既不过度探索也不过度利用。

另一个有趣的分析是CPO关注的词和熵关注的词有什么不同。研究团队发现,两者有76%的词重叠——这说明高熵的词确实有不少也是高对比分歧的词,不确定性和可能犯错之间确实有一定关联。但CPO独有的那些词,往往是编程关键词(python、output)、数学符号(tau、equiv)这类执行层面的关键词;而熵独有的词,则多是"Please"、"Consider"、"Human"这类语言风格词汇。这个对比说明CPO更关注任务执行是否正确,而熵更关注语言表达的多样性,前者显然与任务成功率更直接相关。

---

说到底,CPO做的事其实和一个好老师批改作业的方式一脉相通。好老师不会只在卷子最后写个分数,而是会在每一步推导旁边注明"这里对了""这里错了""从这一步开始走偏了"。这种精细的反馈,才是真正有价值的学习信号。

CPO把这种批改方式搬到了AI训练里,而且用了一个非常聪明的实现:不需要外部老师,不需要人工标注,只需要把正确答案告诉模型,让模型用"看到答案之后的眼光"重新审视自己的推理过程,两种视角的差异就是信号。这个想法朴素、可扩展,计算开销也只比原方法多了约20%,在实际应用中具备很高的可行性。

当然,这个方法目前还有一个明显的局限:它需要有正确答案可用。数学题、编程题这类有确定答案的任务非常适合,但开放性问题、主观性写作等没有标准答案的场景,还需要进一步探索。研究团队也提到了几个可能的方向,比如用模型自身的评判意见、或者推理过程中的中间步骤注释来替代参考答案。这些方向如果打通,CPO的适用范围将会大大拓宽。

如果对这项研究的所有技术细节感兴趣,可以在arXiv平台上通过编号2607.14614查阅完整论文,里面包含了完整的理论推导、实验设置和所有提示词的格式。

---

Q&A

Q1:对比策略优化(CPO)和普通GRPO强化学习相比,核心区别是什么?

A:普通GRPO只给整个回答打一个总分,回答里的每个词得到同样的训练信号。CPO在此基础上,让模型在看到正确答案之后重新对同一段文字打分,用前后两次打分的差值来判断每个具体的词是偏向正确还是偏向错误,从而给每个词打出不同的精细分数。

Q2:CPO训练AI时需要用到正确答案,这算不算作弊?

A:CPO用正确答案的方式和"作弊"有本质区别。它不是让模型去模仿或复制正确答案,而是用正确答案来计算一个词级别的对比信号,这个信号在训练时引导模型,但模型在实际做题时完全没有正确答案可用。这更像是老师给学生看答案解析来帮助他理解错误,而不是让学生在考试时抄答案。

Q3:CPO为什么在没有训练过的领域(比如科学题、常识题)也不会变差?

A:大多数强化学习方法在某个专项任务上训练后,会让模型过度适应该领域的表达模式,损害通用能力。CPO通过词级别的精准信号,只调整与任务正确性直接相关的词,不会大规模改变模型的通用语言模式。同时,正确回答中的对比信号鼓励模型探索多样化路径,防止了模式固化,因此通用能力得以保留甚至提升。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-