
这项由腾讯混元LLM前沿团队、马里兰大学、乔治亚大学、明尼苏达大学双城分校、印第安纳大学、里海大学、新加坡国立大学、香港理工大学等多家机构联合开展的研究,以预印本形式发布于2026年7月9日,论文编号为arXiv:2607.08964。有兴趣深入了解的读者可以通过该编号查询完整论文。
**一个关于AI"耐力"的大考**
现在市面上的AI助手越来越聪明,能写代码、能改文件、能在电脑终端里执行各种命令。很多人觉得,AI已经很厉害了——毕竟它们能在几分钟内修好一个代码错误,或者帮你完成一道编程题。然而,研究团队提出了一个更难的问题:如果任务不是几分钟能完成的,而是需要几十分钟甚至几小时,中间还要不断调整思路、反复调试,AI还能胜任吗?
这就好像考验一个厨师,不只是问他能不能煎一个荷包蛋,而是让他独立完成一整桌十二道菜的国宴——从采购食材、规划流程、掌控火候,到发现某道菜的食材坏了之后临时调整方案,最终端出每一道都合格的成品。这种"长线作战"的能力,就是研究团队最想测试的东西。
为此,他们建立了一个名为"Long-Horizon-Terminal-Bench"(简称LHTB,可理解为"长线终端任务基准")的全新测试框架,用46道精心设计的超难任务,向当前世界上最顶尖的15个AI模型发起挑战。结果令人大跌眼镜:即便是表现最好的模型,在这套考卷上的通过率也只有15.2%,而所有模型的平均通过率更是只有可怜的4.3%。
---
**一、为什么现有的AI测试不够用**
在理解这项研究的价值之前,有必要先搞清楚一件事:现有的AI评测,到底在测什么?
目前学术界最主流的AI能力测试,大多类似于"帮我修这个代码bug"或者"完成这道编程题"。这些任务通常在几分钟之内就能完成,而且只有两种评分方式:要么成功,要么失败。这种"非黑即白"的评分方式,在简单任务上还算合理,但一旦任务变得复杂、漫长,它就暴露出严重的问题。
打个比方,假设有两个学生在做一道100分的作文题。第一个学生写到第99分的程度,只差最后一句话收尾没写完;第二个学生交了白卷。如果按照"交了完整作文得分,没交就零分"的规则,这两个学生会得到完全相同的分数——零分。这显然是荒唐的,但目前大多数AI基准测试,就是在用这种方式评分。
研究团队将这个问题称为"稀疏奖励信号"——也就是说,整个测试过程中,AI只能在最终环节知道自己成功还是失败,中间过程得不到任何反馈。对于短任务来说,这还能接受;但对于需要几百步操作、持续几十分钟的长任务来说,这就如同让一个人在黑暗中走迷宫——走了大半程、只差几步就能出口,却和一开始就迷路的人得到同样的评价。
更深层的问题在于,真实世界里的专业工作,几乎从来不是简单短任务的堆叠。重现一篇科学论文的实验结果、修复一个复杂的机器人导航系统、分析一个多源数据集的异常、优化一个大型数据库的查询速度……这些任务少则几十分钟,多则数小时,中间充满了意外、错误和需要反复调整的环节。现有的测试体系完全无法衡量AI在这类任务上的真实水平。
LHTB正是为了填补这个空白而诞生的。
---
**二、这套考卷究竟有多难**
LHTB包含46道任务,横跨九个大类领域。这些任务不是凭空捏造的题目,而是从真实的专业工作场景中提炼出来的。
其中有些任务属于"实验重现"类,要求AI从头重现一篇已发表学术论文中的实验结果,包括浮点数压缩算法的校准实验、蛋白质结构搜索实验、计算机网络仿真实验等。有些属于"软件工程"类,要求AI修复一个故意损坏的代码仓库,比如逆向破解一个没有文档说明的配置格式、将一个老旧的AI框架代码迁移到新版本、修复一个开源数据库的查询优化器。还有些任务属于"地球与气候科学"类,比如审计一个用于分析极端气候事件的数据处理管道、重现电力系统潮流计算的回归测试、审计地下水流动模拟的输出结果。
更具挑战性的是"交互式游戏"类任务——AI需要在终端环境里实时操控游戏。比如在2048游戏中尽可能合并数字块,在超级马里奥游戏里尽量通关更多关卡,或者在国际象棋中对抗一个顶级引擎(Stockfish),看能撑多少步不被将死。还有"逻辑约束谜题"类,包括解决一系列越来越难的数独变体,或者通关一个四阶段的华容道(Rush Hour)谜题。
每道任务都被放置在一个隔离的容器化环境中——可以理解为一个独立的虚拟电脑。AI能做的,只有通过命令行输入指令、查看文件、运行脚本、分析输出结果,然后根据发现的问题修改代码或策略,再次运行,循环往复。没有图形界面,没有鼠标操作,只有纯粹的文字命令——这正是真实服务器上的工作方式。
任务的难度还体现在另一个维度:隐藏的验证机制。每道任务的评分不只依赖公开的测试用例,更重要的是一套隐藏的"压力测试"——这些测试会动态生成更难的输入,包括嵌套格式的数据、经过压缩加密的文件、字段名称被改过的数据表、含有噪声的传感器数据、旋转过的图像、被裁剪的帧,以及各种非标准的坐标系或时间格式。这样设计的目的,是确保AI不能通过死记硬背或者只修复表面问题来蒙混过关——必须真正理解问题并实现稳健的解决方案。
---
**三、全新的评分方式:给每一步都打分**
LHTB最核心的创新之一,是它的评分方式。
传统的测试只看最终结果——任务完成就得1分,没完成就得0分。LHTB则把每道任务拆解成若干个"子任务",每个子任务都有独立的得分,最终将这些分数按权重加总,得到一个介于0到1之间的综合得分。
举个具体的例子。假设一道任务要求修复一个气候数据分析管道。这个任务可能被拆解成:第一步,能否正确读取NetCDF格式的气候数据文件;第二步,能否正确计算热浪事件的频率;第三步,能否处理降水量的异常值;第四步,能否生成符合格式要求的输出报告;第五步,能否通过所有隐藏的压力测试。如果AI完成了前四步但在第五步失败了,它不会得零分,而是会得到一个反映实际完成进度的分数,比如0.80。
这种评分方式还有三种具体形态。对于有明确对错的检查,比如"程序是否能正常运行而不报错",采用0或1的二值评分。对于有量化目标的任务,比如"重现的实验结果与参考值的误差是否在允许范围内",则采用连续评分——误差越小,分数越高。对于那些需要反复执行多轮的任务,比如游戏类任务,采用聚合评分——统计在所有尝试回合中,成功完成目标的比例。
这种分级评分体系,就像给一场马拉松比赛的选手评分时,不只看有没有跑到终点,还记录他们跑到了第几公里、用了多少时间——这样才能真正区分出"差一点就到了"和"刚起跑就放弃了"的选手之间的差距。
---
**四、实验结果:顶尖AI的集体"翻车"**
测试结果出来的时候,相信不少人会被这个数字震惊:在"通过率"最宽松的设定下(得分达到0.95分才算通过),表现最好的模型GPT-5.5的通过率是15.2%,也就是说46道题里只答对了7道。而所有15个模型的平均通过率,只有4.3%。如果把通过标准提高到满分(1.0分),GPT-5.5的通过率下降到10.9%,而有10个模型的通过率直接变成0%。
在这15个被测试的模型中,GPT-5.5表现最好,其次是MiniMax M3和Kimi K2.7 Code,各自通过了3道题,通过率6.5%。DeepSeek V4 Pro同样也是6.5%的通过率。Qwen3.7 Max、Doubao Seed 2.1 Pro、Gemini 3.1 Pro、GLM 5.1、GPT-5.3 Codex各自通过了2道题,通过率4.3%。而GLM 5.2、Qwen3.6 Plus、GPT-5.4、Hy3各自只通过了1道题。Kimi K2.6和Grok 4.20一道也没通过,其中Grok 4.20的平均得分只有0.08,是所有模型中最低的。
从所有任务、所有模型加在一起的690次测试来看,只有30次通过了0.95的门槛,占比4.4%。另有224次测试的得分低于0.05,也就是说连5%的进展都没达到,占比32.6%。而剩下的433次测试,分布在0.05到0.95之间——这些是"有进展但没完成"的情况,占比高达62.8%。其中有180次测试的得分超过了0.5,说明模型完成了超过一半的工作,却功败垂成。
每道任务平均需要AI运行231轮操作,消耗990万个词元(可以理解为AI处理的文字量),花费85.3分钟的实际运行时间,产生约10.2美元的API调用费用。这些数字远远超过了之前所有类似的测试基准——以Terminal-Bench 2为对照,大多数任务在20分钟以内就会结束,而LHTB几乎每道任务都跑满了90分钟的限时上限。
---
**五、成本与性价比:贵的不一定好**
在看完通过率数据之后,一个自然的问题是:花钱多的模型,是不是表现更好?
答案是:不一定。
研究团队统计了每道任务的平均API费用。GPT-5.5的每题平均费用约为21.46美元,是通过率最高的模型,但不是最贵的。最贵的是GPT-5.4,每题平均费用高达27.57美元——这个模型每道任务平均需要302轮操作,而GPT-5.5只需要208轮,尽管两者的单位费率相近,但GPT-5.4效率更低、绕路更多,导致总花费更高,通过率却更低。
Grok 4.20每题费用约20.63美元,但通过率为0,是性价比最差的模型之一。相比之下,Hy3每题费用只有2.47美元,虽然通过率也很低,但它占据了"低成本端的帕累托前沿"——也就是说,在相同花费水平下,没有其他模型比它表现更好。Doubao Seed 2.1 Pro每题约5.16美元,MiniMax M3每题约6.13美元,两者在成本和通过率的综合表现上也处于帕累托前沿。
这个结论揭示了一个重要现象:在长线任务上,更高的推理费用并不等于更强的解决能力。决定成功与否的,更多是模型能否有效规划、避免重复探索、准确判断任务是否完成,而不仅仅是"更聪明的大脑"。
---
**六、为什么会失败:三种不同的死法**
研究团队深入分析了那些没有通过的测试,发现失败原因可以分为三大类。
最主要的失败方式是"超时"——在90分钟的时间限制到来之前,任务还没完成,系统强制中断。这种情况占所有失败测试的79%,也就是518次。更令人无奈的是,这些超时的测试并不是因为AI毫无进展,很多情况下,模型已经完成了大半工作,只是速度太慢、效率太低,在有限时间里无法全部搞定。这些超时测试的平均得分在0.10到0.35之间——不是白费功夫,但就是差那么一口气。
第二种失败方式是"提前放弃"——AI自己认为任务已经完成,主动停下来,但实际上并没有通过隐藏的验证测试。这种情况占所有失败的19%,也就是124次。研究团队将那些在得分超过0.75的情况下仍然提前停止的案例称为"假完成"——模型误以为自己已经做完了,带着一种莫名其妙的自信交卷,却不知道自己最后几步还差得远。
研究团队在分析中发现了14个典型的"假完成"案例,得分都在0.75以上。比如Kimi K2.7 Code在完成一道数据库优化任务时,在得分达到0.92时停止了,还剩大约20分钟没用完。GLM 5.2在一道金融咨询任务上得分0.90时停下。而有七个不同的模型,都在同一道法律咨询任务上,在得分介于0.80到0.87之间时停止,每个都还有大约20分钟可以继续工作。这说明这些模型在自我评估能力上存在系统性的偏差——它们倾向于高估自己的完成程度,不愿意再花时间去做最后的深度检验。
第三种失败方式是"系统错误"——评估框架本身出了问题,占所有失败的3%,是最不重要的一类。
这三种失败模式,共同指向一个结论:当前AI模型的瓶颈,不在于"每一步是否做对了",而在于"能否在有限时间内把所有步骤都连贯地做完"。在短任务上,AI已经表现相当不错;但在真正需要持续几十分钟、保持清醒规划的长线任务上,它们还差得很远。
---
**七、分级评分揭示了什么隐藏真相**
LHTB的分级评分体系,不只是技术上的改进,它还揭示了一些用传统评分方式永远看不到的信息。
以Kimi K2.6为例。这个模型在0.95门槛下通过率为0——传统二值评分会告诉你,这个模型一道题都没做出来。但分级评分告诉你:它有5次测试的得分非常接近通过线,平均得分0.25,最高的一次达到0.94。它在一道语法模糊测试任务上得了0.94分,在调度策略任务上得了0.90分,在漏洞利用任务和N体仿真任务上分别得了0.89分。如果用传统评分,Kimi K2.6看起来和一个完全不会做题的模型没有区别,但实际上它几乎每次都差一点点就成功了。
反过来,分级评分也能区分出那些"虽然分数差不多但原因截然不同"的模型。两个模型都得了0.30的平均分,但一个是因为每道题都做了三成就放弃,另一个是有些题做了八成、有些题几乎没动。这两种情况说明的是完全不同的能力特征,但在传统评分下完全无法区分。
从整体分布来看,所有690次测试的最终得分呈现出一种独特的形态:最多的一堆集中在0.05以下(无实质进展),然后是0.05到0.15之间有一个较大的群体,接下来随着分数升高,数量逐渐减少,但在0.85到0.95之间又出现了一个不小的"接近完成"的群体,大小几乎是"完全通过"群体的两倍。这说明很多模型都能做到快要完成,但就是差在最后一关。
---
**八、这项研究对未来意味着什么**
LHTB的研究结论,清楚地指出了当前AI系统在哪些方面需要重点改进。
首先是"时间预算管理"能力。现在的AI在长线任务中,经常在前半段做了很多低效的重复探索,等到时间快到了才开始着急,但已经来不及了。未来需要让AI学会在有限时间内更合理地分配精力——哪些步骤重要、哪些可以跳过、什么时候该加速、什么时候该仔细验证。
其次是"自我验证"能力。"假完成"的问题说明,当前模型在判断"任务是否真的做完了"这件事上,远没有达到令人满意的水平。AI需要学会更严格地自我检查,特别是在已经通过了明显的公开测试之后,还要主动去思考"是否还有我没考虑到的边界情况"。
第三是"长线记忆与状态管理"能力。做了几百步操作之后,AI需要能清楚地记得之前做了什么、发现了什么、还有什么没做,而不是在每一步都从头思考,导致重复劳动或者遗忘关键信息。
第四是"迭代调试"能力。很多任务在真实工作中都需要"发现问题——修复——再测试——发现新问题"的多轮循环。AI需要能在这种循环中保持方向感,不因为一次失败而乱了阵脚,也不因为表面上看起来修好了就提前收工。
说到底,LHTB的发布,既是一面镜子,也是一个靶子。它照出了当前最顶尖AI系统在真实长线工作中的真实水平,也明确地标出了下一阶段需要攻克的方向。在这套考卷面前,没有一个模型能说自己已经"毕业"了——这本身就是这项研究最有价值的地方。
归根结底,研究团队的发现给了我们一个清醒的认识:AI在回答"这个问题怎么解决"上已经颇为出色,但在"把整件事从头到尾做完"这件事上,还有很长的路要走。就像一个能背出所有菜谱的厨师,并不等于能独立掌厨一场国宴——知道怎么做,和真正能做成,是两件完全不同的事。
对未来的AI研究者和开发者来说,这套基准提供了一个明确的挑战目标。对于普通用户来说,这个研究提醒我们:在把需要长时间、多步骤、反复调整的重要工作完全交给AI之前,还是要多留一份心,仔细检查它是否真的完成了,而不只是看起来完成了。
有兴趣深入探索这项研究的读者,可以通过论文编号arXiv:2607.08964查阅完整论文,项目主页提供了数据集和评测框架的开源资源。
---
Q&A
Q1:Long-Horizon-Terminal-Bench和普通AI编程测试有什么区别?
A:普通AI编程测试通常几分钟内完成,只看最终结果对不对,评分是"成功或失败"二选一。Long-Horizon-Terminal-Bench的任务平均需要85分钟、231轮操作,而且会对每个中间步骤打分,能看出AI走了多远,而不只是有没有到终点。这样能发现那些"差一点就成功"的情况,这在传统评测里是完全看不到的。
Q2:为什么顶尖AI模型在Long-Horizon-Terminal-Bench上通过率这么低?
A:根据研究分析,主要原因不是每一步做错了,而是无法在有限时间内把几百步全部连贯地完成。79%的失败是因为90分钟时间用完了任务还没做完,还有19%是模型误以为自己做完了提前停下,但实际上没通过隐藏验证测试。核心瓶颈是长线规划、时间管理和自我验证能力不足。
Q3:LHTB测试里哪类任务最难?
A:根据各任务的平均得分,绝大多数任务(40道以上)被标注为"Hard",只有少数几道被标注为"Easy"。难度较高的包括气候数据分析、科学实验重现、卫星图像处理等需要专业知识的任务,以及需要对抗顶级引擎的国际象棋任务。相对容易的有N体仿真优化、代码覆盖率模糊测试、策略游戏机器人开发等。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。