微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI能给自己布置一个模糊的成长目标吗?答案可能没那么乐观

AI能给自己布置一个模糊的成长目标吗?答案可能没那么乐观

2026-09-14 16:09
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-14 16:09 • 科技行者

想象一下这样一个场景。

你有一个学生,你没告诉他要考哪场试,没给他划重点,也没告诉他及格线是多少分,你只对他说了一句话:"去把物理学好。"

这个学生接下来要做什么?他得自己判断哪些知识点是薄弱的,自己去找教材和习题,自己设计学习计划,自己想办法检验学得怎么样,最后还要在完全不知道考试内容的情况下,去面对一场真正的考试。

这听起来是不是很难?但这恰恰是人类学习中最常见、最重要的模式之一。你想变成一个更好的物理学家,想在科研上更进一步,这些目标从一开始就是模糊的,没人替你把它拆解成"第37页第5题"。

现在把这个学生换成一个大语言模型(LLM),也就是我们常说的AI大模型。

大语言模型:一种通过海量文本训练出来的人工智能系统,能理解和生成自然语言,比如ChatGPT、Claude这类产品背后的技术。

字节跳动Seed团队联合新加坡科技设计大学等机构,最近做了一件挺有意思的事:他们想看看,如果只给AI一个模糊的目标,比如"提升数学推理能力",不告诉它具体考什么、怎么评分,它能不能自己想办法把自己训练得更好。

这就是这篇论文的主角,一个叫做Aspire的评测基准。

现在的AI"自我进化",其实是在做填空题

在搞清楚Aspire做了什么之前,得先明白一件事:现在业界说的AI"自我进化",到底是什么水平。

过去几年,学术界出现了不少让AI自己优化自己的研究,比如PostTrainBench、LaMDAgent、SEAL这些工作。它们的共同点是,人类已经把任务想清楚了。

比如说,人类会告诉AI:"你现在的任务是提升在AIME数学竞赛题上的表现,这是评分脚本,这是预算,去优化吧。"

AIME:美国数学邀请赛,一种高难度数学竞赛题库,常被用作检验AI数学推理能力的标准测试集。

在这种设定下,AI要做的事情,说白了就是"怎么把这道填空题做对"。任务是谁定的?人类。评分标准是谁定的?人类。AI只负责在一个已经画好边界的沙盘里搜索最优解法,选数据、调参数、换训练方法。

这就好比给学生发了一整套复习资料和历年真题,学生只需要研究"怎么刷题效率最高",而不需要操心"我到底该学什么"。

如果不这样限定任务边界会怎样?现实中会发生的情况是:当现有的评测基准跑满分了,或者不再能反映新出现的能力短板时,还是得靠人类去发现新的弱点,把它翻译成任务,再去设计新的评测和奖励机制。这个环节,一直牢牢攥在人类手里,AI从没真正接触过。

论文作者们抓住了这个空白,抛出一个问题:如果只给一个模糊目标,不给任务规范,也不给可拆解的奖励信号,AI能不能自己判断该学什么、该怎么学、该怎么验证学得好不好?

Aspire到底测的是什么

Aspire这个名字本身就很直白,就是"渴望、志向"的意思。它测试的核心能力,论文里称之为"目标具体化"。

目标具体化:把一个宽泛的能力方向,比如"变得更擅长写作",转化成可训练的具体任务、学习信号和验证标准的过程。

这里要澄清一个容易被误解的地方:"模糊"不等于"说不清楚"。论文特别强调,一个模糊目标不是写得含糊不清的指令,而是一个还没有被拆解成固定任务和评分标准的宽泛能力方向。就像"变成更好的物理学家"这句话本身表达得很清楚,只是它还没有被翻译成"做对第37页第5题"这种可执行单元。

Aspire给AI提供的,仅仅是一句自然语言描述的能力目标,比如"提升复杂数学推理和论证能力"。下游用来评分的具体测试题,AI完全看不到。

AI需要自己决定:用什么数据、怎么更新模型、要不要做中间验证、什么时候算训练完成。整个过程,AI既要决定"学什么",也要决定"怎么学"。

这套系统支持两个层面的进化。一个是模型权重层面的进化,也就是真刀真枪地对模型参数做训练更新;另一个是智能体外壳(harness)的进化,也就是不改动模型本身,而是改运行这个模型的那套提示词、工具策略、工作流程和自我评估机制。

智能体外壳(harness):包裹在模型外面的运行系统,包括提示词设计、工具调用策略、记忆管理和自我验证逻辑,决定了模型在实际任务中如何被使用。

为了让这个测试真正有效,研究团队构建了一个隐藏的评测题库,一共520道题,由领域专家从零开始撰写,覆盖六个方向:科学与学术推理、人文社科知识、健康医学推理、数学推理、逻辑可靠性与指令遵循、学术科研写作。

这些题目AI从头到尾看不到,评测过程中AI最多只能拿到一个笼统的汇总分数,具体哪道题错了、正确答案是什么、评分依据是什么,一概不会告诉它。

这个设计的用意其实很朴素:如果AI能偷偷看到考题,那它"自己判断该学什么"这件事就没法验证了,它完全可以直接对着答案背。就好比你想测试一个学生真实的物理水平,那监考老师绝对不会提前把试卷泄露给他,哪怕只是让他瞄一眼题型也不行,因为一旦泄题,你测出来的就不是他的真实能力,而是他的记忆力。

第一个问题:换成模糊目标,会发生什么变化

研究团队设计了三个递进的研究问题,第一个问题最直接:把一个原本任务定义明确的场景,换成模糊目标描述,AI的行为和结果会有什么不同?

他们用了PostTrainBench这个已有的评测体系做对照实验。原本这个体系会直接告诉AI"你要优化在某个具体基准上的表现",研究团队把这个具体任务名换成了一句宽泛的能力描述,其他条件尽量保持不变,然后让Claude Opus 4.8和GPT-5.6两个模型分别在两种设定下跑一遍。

结果挺扎眼的。Claude Opus 4.8在模糊目标设定下,最终加权平均分是27.07,而官方在明确任务设定下能拿到32.90分,差了将近6分。GPT-5.6的情况类似,模糊目标下是29.58分,明确任务下是36.23分,差距超过6.6分。

但有意思的是,并不是所有子任务都是模糊目标设定更差。Claude Opus 4.8在模糊目标下反而在HumanEval代码生成和BFCL函数调用任务上得分更高,GPT-5.6在模糊目标下GSM8K数学题得分也更高。这说明目标模糊化带来的不是简单的全面退步,而是一种更复杂的重新分配。

再往深处看,行为轨迹上的变化就更能说明问题了。在做了配对比较的Claude Opus 4.8实验中,模糊目标场景下,模型花在"决策思考"上的时间平均多出2109秒,GPU处于空闲等待状态的时间多出0.61小时,与此同时真正花在训练和评估上的活跃时间反而少了1.27小时。

翻译一下就是:面对模糊目标,AI把更多精力用在了"想该干什么"上,而不是"实际动手干"。它去查看任务定义材料的频率是原来的2.98倍,检查评估脚本的频率是原来的2.39倍。

这就好比一个人接到一个明确的装修清单,他可以立刻拿起工具开始干活;而如果只被告知"把这个家弄得更舒适一些",他得先花大量时间琢磨"舒适"到底意味着什么,是要换沙发,还是要重新布局采光,还是要隔音。如果不花这个时间去想清楚,直接动手干,很可能装修完了业主还是不满意,因为方向本身就没搞对。这就是为什么模糊目标场景下"决策时间"会显著增加,这不是效率低,而是任务性质本身发生了变化。

作者们还做了个对照,用官方发布的强系统轨迹(官方Claude Opus 4.8 Max和官方GPT-5.6)来看它们的搜索节奏。官方GPT-5.6平均每次训练启动会配上2.63次评估,反馈密度是模糊目标Claude Opus 4.8的4.6倍,这意味着它有更多机会去验证、否决、分支尝试新方案。而官方Claude Opus 4.8 Max走的是另一条路,评估频率和模糊目标场景下的Claude Opus 4.8差不多,但它记录下来的思考文本量是官方GPT-5.6的5倍还多。

这说明,就算是在明确任务下,不同模型的"强"法也不一样,有的靠密集验证,有的靠深度琢磨。这也提醒我们,判断一个模型自我进化能力强不强,不能只看它最后交出的分数,还得看它是怎么走到那一步的。

第二个问题:AI真能凭空练出一个更强的自己吗

第一个问题回答的是"模糊目标改变了什么",第二个问题更进一步:"改变之后,AI到底能不能真正把自己训练得更强?"

这次的设定更接近真实场景:从一个已经经过指令微调的模型出发,也就是一个已经具备基本对话和任务执行能力的模型,让它自己决定训练什么、怎么训练,看它能不能在保留原有能力的前提下,真正获得目标能力的提升。

指令微调:让预训练模型学会理解并按照人类指令完成任务的一个训练步骤,做完这一步的模型才具备日常我们熟悉的"听话"能力。

研究团队用了两种反馈协议来测试。第一种叫"终局评估协议",AI在过程中完全拿不到任何中间反馈分数,只有在提交最终检查点之后才会被打一次分。第二种叫"自适应反馈协议",AI可以在过程中反复查询汇总分数,用这些分数指导后续的训练决策,但依然看不到具体题目。

终局评估协议一共跑了24次实验,覆盖Qwen3.5-4B和Qwen3.5-9B两个模型尺寸,每个模型在六个目标上各跑两次,取平均分。

结果相当令人意外。24次跑完,取模型-目标为报告单位的话,Qwen3.5-4B在6个目标上全部低于起点分数,Qwen3.5-9B在6个目标里只有1个高于起点分数,而且那唯一的正向案例,两次跑分都是从45.33涨到48.00,涨幅2.67分。这是12组模型-目标组合里唯一的正向结果。

放到单次运行层面看,24次运行里只有3次最终检查点分数超过了起始分数,其余21次全部触发了回滚机制,也就是训练完全没起作用,系统自动退回到起点模型。

更值得警惕的是一个具体的失败案例。有5个提交的检查点,都是用一种叫"数字标签MMLU监督微调"的数据训练出来的,这份训练数据里的21000个目标全部是单个数字标签,训练完之后,模型在279道评测题上给出的回答也全部变成了单个数字。这5个检查点的得分分别是0、0、0、6.141、0,几乎全军覆没。

这就好比一个学生原本能写完整的作文,结果被逼着做了几千道"选A还是选B"的选择题训练,训练完之后再让他写作文,他也只会往纸上写一个字母。这不是他不会写作文了,而是训练数据本身的格式,把他原本的能力给"带偏"了。

如果不做检查点回滚机制会怎样?答案很明显,那21次退化的训练就会被直接保留下来,模型能力会实打实地变差。回滚机制的存在,本质上是给了系统一个"止损"的安全网,但它同时也暴露了一个更深层的问题:这套自我训练流程,大概率生产出来的是能力下降的模型,能保留下来的正向结果反而是例外。

自适应反馈协议的结果同样耐人寻味。一共30个"配置-目标"组合,28个成功产出了一个可评估的检查点,21个满足了预先设定的合格条件,但最终只有1个组合的检查点分数真正超过起始分数,并且通过了回滚检验被保留下来,那就是外部决策模型Terra在数学推理目标上,把Qwen3.5-4B从17.86分提到了20.10分。

这30个组合里,有22个产生了多个检查点,一共记录到62次连续的分数变化,其中28次上升,13次持平,21次下降。14个组合里,后续检查点的分数超过了最初的检查点,但这不代表它超过了起始基线。论文里举了个例子:Qwen3.5-4B在数学推理上从0.79分涨到1.75分再涨到2.38分,看起来是在持续进步,但这三个分数全都远远低于17.86分的起始基线。

这个现象揭示了一个容易被忽略的陷阱:如果只看"相比上一个检查点是否有进步",很容易误以为AI在稳步变强,但如果拿它和最初那个没被训练过的模型比,会发现它可能一直在谷底徘徊,所谓的"进步"只是从更深的谷底爬到稍浅一点的谷底。这就像一个人生病发烧到40度,吃了药退到39度,看起来是好转了,但正常体温是37度,这时候如果只盯着"体温从40降到39"就宣布病好了,显然搞错了参照系。

研究团队还发现了一个反直觉的现象:搜索得越多,不代表结果越好。外部决策模型Sol在探索上投入最多,总共产生了33个评估过的检查点,累计消耗76.56个GPU训练小时,但没有一个检查点超过对应的起始基线分数。而找到唯一那次真正改进的Terra,它后续的数学推理检查点分数还从20.10掉到了2.78,然后才又爬回18.17。

这说明,单纯堆搜索次数和算力,并不能保证找到更好的方案,反而暴露了持续优化本身也可能带来倒退,这也是为什么检查点选择和回滚机制在这套系统里如此重要的原因。

第三个问题:不改模型,能不能进化外壳

第三个研究问题换了个角度:既然改模型权重这么难,那如果模型本身完全不动,只改它外面那层运行系统,也就是智能体外壳,效果会怎样?

这次的场景聚焦在学术科研写作这个目标上。基准是原版的Qwen-Agent智能体框架,跑出来的任务宏观平均分是28.64分,样本微观平均分是27.65分。

Qwen-Agent:通义千问团队开发的一套开源智能体框架,提供了标准化的工具调用、对话管理等基础设施。

研究团队让Qwen3.5-4B自己作为"创造者"去尝试改造这套外壳,同时也让GPT-5.6扮演的三个角色Luna、Terra、Sol分别去尝试。结果很扎心:Qwen3.5-4B自己压根没能产出一个可用的新外壳,直接被判定失败得零分。

三个由GPT-5.6生成的外壳倒是都能正常运行,但没有一个真正超过了原版Qwen-Agent。表现最接近的是Sol生产的版本,27.22分和25.97分,比基准低了1.42分;Terra的版本是20.76分和20.14分;Luna的版本最差,19.32分和18.33分。

三个案例的失败原因还各不相同,挺值得说道说道。

Luna在自己设计的验证流程里,用一个8项检查清单测试了一版新提示词模板,从7项通过提升到8项全通过,然后又用两个类似结构的提示词也验证通过,跑了大概40分钟就停手了。但这个新模板有个问题:它加入了一套固定的五段式研究答案模板,覆盖研究问题、方法设计、分析、风险、局限性。问题是,遇到那些真正要求具体机制、公式、参数或工程细节的题目时,这套模板会把它们强行套进"研究设计"的框架里去回答,答非所问。

这就好比一个学生准备了一篇万能作文模板,无论考题问的是"描述你的家乡"还是"分析牛顿第二定律",他都往这个模板里硬塞,结果每篇文章看起来结构完整,但实际内容跟题目要求驴唇不对马嘴。他在自己的模拟测试里得了满分,因为模拟测试题恰好和他准备的模板匹配,但真正上考场就露馅了。这个案例也说明了一件事:AI自己设计的验证方式,如果覆盖面太窄,很容易导致模型在一个狭窄的代理指标上"作弊式达标",而没有真正解决问题。

Terra的问题更技术化一些。它一开始加了个二次审查机制,后来发现这个审查机制会凭空捏造出并不存在的统计显著性结果和效应量数据,于是把它删掉了,转而加了针对假设检验、模型调用、日志记录、计算器工具使用的更细致的防护措施。但它漏掉了一个关键环节:当模型调用计算器工具之后,如果最终的回复是空的,系统会直接把调用工具之前的草稿片段当作最终答案提交出去。在被检查的执行样本里,有两道题因此只提交了342字符和520字符的残缺片段,得分从75.00和52.33骤降到2.57和2.91,这两个案例加起来解释了那次执行里大约70%的分数损失。

Sol算是三者中搜索最全面的,花了3小时11分钟,测试了提示长度、工具调用失败恢复、禁用工具、加审查环节等四类方案,还顺手纠正了自己验证集里一个错误的参考答案。它最终选择的方案基本保留了原版Qwen-Agent的策略,只加了一条"最终回复不能为空"的完整性检查。但被检查的20道评测题里,这条检查一次都没被触发过,也就是说这个改动理论上更安全,但实际上并没有真正带来分数上的提升。

这三个案例合在一起,讲的其实是同一个道理:让AI自己去改造运行自己的系统,它确实能做出能跑起来、行为也不一样的新版本,但"能跑"和"跑得更好"之间,还隔着一道相当宽的鸿沟。这也再次印证了论文标题那个核心问题:闭合训练循环,不等于闭合能力循环。

写在后面

读完这篇论文,最触动我的其实不是那些下降的分数,而是那个"从0.79涨到2.38"的数学推理例子。

如果研究团队没有同时给出17.86这个起始基线分数,单看这三个检查点的曲线,任何人都会说这是一次成功的自我进化。这让我意识到一件事:判断一个AI系统是不是在真的变强,永远不能只看"它相比昨天的自己有没有进步",必须要有一个固定不变的参照系。这个参照系一旦丢失,进步的假象就会自动出现。

这个道理放到人类学习上其实也一样。我们经常用"和上次考试相比进步了多少分"来衡量自己,但如果每次考试的难度、范围都在悄悄变化,这个比较本身就是失真的。真正有意义的进步,得回头看那个最初的、没有经过任何针对性训练的起点。

另一个让我反复琢磨的细节,是那五个"数字标签"训练崩溃的案例。它揭示了一个挺朴素但容易被忽视的风险:AI在自己选择训练数据这件事上,可能会因为数据格式本身的偏差,无意中把自己原本具备的能力给覆盖掉,而它自己甚至意识不到这个问题,因为它在自己设定的验证流程里可能压根没测出来。这种"自己给自己挖坑还不自知"的情况,恐怕才是自主学习系统里最需要警惕的部分。

论文最后也坦诚地承认了自己的局限,只覆盖了六个目标方向,每个配置只跑了一次自适应反馈实验,没有做多次重复来验证结果的稳定性。这些都是留给后续研究的空间。

如果一个系统连"我到底该学什么"这个问题都还答不好,那"如何学得更快更好"这个问题,是不是问得太早了?

Q&A

Q1:Aspire是什么?

A:Aspire是由字节跳动Seed团队等机构提出的一个评测基准,专门用来测试AI大模型在只给一个模糊自然语言目标、看不到具体评测题目的情况下,能否自主判断该学什么、怎么学,并真正实现能力提升。

Q2:Aspire的实验结果说明AI自我进化能力强吗?

A:目前来看还很不成熟。在权重更新实验中,24次训练里只有3次最终效果超过起点,大部分训练反而导致能力下降;在外壳改造实验中,三个可用的新版本也都没能超过原版Qwen-Agent框架的表现。

Q3:为什么给AI设定模糊目标比明确任务更难?

A:因为AI不仅要想办法优化表现,还得先自己判断该优化什么、用什么数据训练、怎么验证进步。实验显示,面对模糊目标时AI会花更多时间在"想该干什么"上,实际训练时间反而变少,最终分数也普遍低于明确任务设定下的表现。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-