
这项研究来自思科系统公司旗下的Foundation AI研究团队,同时有耶鲁大学的研究人员参与合作。论文于2026年6月17日发布在预印本平台arXiv,编号为arXiv:2606.19605,感兴趣的读者可以通过这个编号查阅完整论文。
当一个由多个AI环节串联而成的系统出错时,你怎么知道问题究竟出在哪里?是第一步的信息检索出了差错,还是中间的推理环节逻辑混乱,又或者是最后的输出格式不符合要求?这就是思科Foundation AI团队试图解决的核心难题,而他们给出的答案,是一套名为FAPO(Fully Autonomous Prompt Optimization,全自动提示词优化)的框架。
一、为什么多步骤AI系统的优化是一件头疼的事?
以一个现实场景为例:你委托一家律师事务所处理一起复杂案件。这家事务所的工作流程分成好几个环节——先由初级律师检索相关判例,再由中级律师分析法律逻辑,然后由高级律师撰写意见书,最后由合伙人审核格式与措辞。如果最终交出的文件漏洞百出,你该去责怪谁?是检索判例的初级律师没找到关键案例,还是分析逻辑的中级律师推断有误,还是其他某个环节出了问题?
现代AI系统的运作方式与此如出一辙。在安全分析、企业数据处理、知识问答等领域,AI往往不是单一模型一气呵成地完成任务,而是由多个步骤串联组成的"流水线":第一步检索相关信息,第二步进行推理分析,第三步按照特定格式输出结果。每一步都可能出错,而且一步出错往往会拖累后续所有步骤,就像流水线上的一个零件卡壳,整条生产线都得跟着停摆。
传统的优化方法通常只盯着其中一个环节——最常见的是调整给AI的"提示词"(Prompt,可以理解为给AI的指令或说明书)。但这就好比当整条流水线都出了问题时,你只去反复调整其中一道工序的操作手册,却对其他环节的结构性缺陷视而不见。这种方法有时候有效,但在真正复杂的多步骤系统面前,往往杯水车薪。
正是基于这个认识,思科Foundation AI团队提出了FAPO框架。它的核心理念是:先像侦探一样系统地检查每一个环节的"犯罪现场",找出问题的真正根源,然后有针对性地提出修复方案,并且经过独立审核后才付诸实施。更重要的是,它遵循一个"先小后大"的修复原则——优先尝试最简单的修复手段(调整提示词),只有在确认简单手段无法解决问题时,才会动用更复杂的结构性改造。
二、FAPO究竟是怎么工作的?
FAPO的工作方式可以用一套侦探办案的流程来类比,整个过程分成五个环环相扣的步骤,并且会反复循环直到案件告破——也就是直到AI系统的表现达到满意的水准。
第一步相当于"收集案发现场证据"。FAPO会在一批训练案例上运行当前版本的AI流水线,不仅记录最终输出的结果,还会细致地记录每一个中间步骤的输入与输出。这就好比侦探不只是看到了案发现场的最终状态,还对每个房间的情况都做了详细的笔录。
第二步是"分析证据、锁定嫌疑环节"。FAPO会深入审查这些记录,把所有出错的案例按照出错的原因归类:有些是因为检索到的信息不够充分(信息检索环节的问题),有些是因为模型拒绝给出答案(推理环节的问题),有些是因为答案太啰嗦或者格式不对(输出格式的问题),还有些是因为最后一步的指令不够明确(指令设计的问题)。通过这种分类,FAPO可以判断失败的根本原因是提示词写得不好,还是流水线的结构本身存在缺陷。
第三步是"提出一个有限范围内的修复方案"。FAPO的修复动作始终是克制的——每次只提出一个修改。而且它遵循严格的优先级:先尝试修改提示词,只有当提示词优化已经被证明无济于事时,才考虑修改流水线参数,而只有在前两者都无效的情况下,才会触碰流水线的结构本身(比如增加或修改处理步骤)。这就像一个谨慎的外科医生,能用创可贴解决的问题,绝不动手术刀。
第四步是"独立审核"。每一个修复方案在被正式测试之前,都要经过一个独立的"审核员"(variant-reviewer subagent,变体审核子代理)的仔细检查。这个审核员会逐一确认:修改是否超出了允许的范围?是否无意中把训练数据的答案泄露给了模型(这会导致作弊式的虚假高分)?是否破坏了评分系统的公正性?就像法庭上的法官,即使检察官的方案听起来合情合理,也必须经过严格的程序审查才能被采纳。
第五步是"对比验证,决定去留"。通过审核的方案会在验证集上(一批模型没见过的新案例)进行测试,只有实际表现比之前更好的方案才会被保留下来,否则就会被丢弃,优化过程继续从上一个最佳方案出发探索新的方向。整个循环会不断重复,直到达到50个变体或10轮优化的上限。
三、支撑这套系统运转的技术架构
FAPO的技术实现依赖于几个关键组件的协同配合。整个框架使用Claude Code(Anthropic公司开发的一套专为代码和工程任务设计的AI工具)作为"总指挥",负责驱动整个优化循环。被优化的AI流水线则用LangGraph(一个用于构建多步骤AI应用的框架)来表示,可以把它理解为一张描述信息如何在各个处理节点之间流动的"地图"。
在内部架构上,FAPO维护着三个各司其职的"代理"(Agent)。优化代理负责读取任务规范、制定允许修改的范围契约,然后主导整个优化循环的运转。步骤归因子代理专门负责分析每次评估后的失败案例,用规则检查和AI分析相结合的方式,把失败归因到具体的流水线步骤,并判断这个失败是靠调整提示词就能解决,还是需要结构性的改动。变体审核子代理则在每个修改方案被采纳之前进行独立审查,确保所有修改都在允许范围之内、没有数据泄露、不影响评分系统的完整性。
FAPO还引入了一套"租户"(Tenant)概念来组织不同任务的隔离。每个任务被称为一个租户,拥有自己独立的工作区间,包含任务说明、评分规则、提示词版本、数据集转换脚本、迭代历史记录等一系列文件。不同租户之间严格隔离,一个任务的设定和假设不会影响另一个任务的优化过程,这对于企业环境中多个业务线共享同一套优化基础设施的场景尤为重要。
在数据安全方面,FAPO设置了多重防护措施。优化代理可以查看具体的训练案例(需要这些信息来分析失败原因),但验证集和测试集只暴露汇总分数,而不是具体案例的详情,这样可以防止优化过程过度拟合到特定的评估样本上。每一个被测试过的提示词或流水线变体都会被保存为独立的版本文件,形成完整的可追溯历史记录。
四、和竞争对手的正面较量:六大测试场景
为了验证FAPO的实际效果,研究团队把它与一个名为GEPA(一种基于进化搜索来优化多步骤AI程序提示词的方法)的基准系统进行了系统性的比较。两个系统从完全相同的起点出发——相同的流水线架构、相同的基础提示词、相同的任务模型和评分规则。测试覆盖了六个不同性质的基准测试,并在三种不同的AI模型(GPT-4.1-mini、GPT-5.4-mini和Gemma 3-12B)上分别运行,总共形成18组对比实验。
第一个测试场景是HotpotQA,一个需要从多个不同文章中提取信息并综合推理来回答复杂问题的任务,相当于要求AI同时查阅好几本参考书才能给出一个正确答案。FAPO的归因分析在这个任务上识别出了三类典型失败:答案太啰嗦(13个案例)、模型拒绝回答(8个案例)、以及真正回答错误(17个案例)。针对这些发现,FAPO分两步调整了提示词:第一步加入了"答案要简洁"的约束,使验证集上的精确匹配率从39.22%跃升至65.7%;第二步加入了"必须给出答案,不允许拒绝"的规则,进一步将验证集准确率推高至70.3%。最终三个模型的测试结果分别比GEPA高出5.11、13.34和1.12个百分点。
HoVer是一个更复杂的多跳事实核查任务,每道题都要求从多篇维基百科文章中提取证据,然后判断一个陈述是否有依据。FAPO在这个任务上的归因分析发现了一个提示词无法解决的结构性问题:原有的检索链条只有3跳,根本不够用于需要横跨多篇文章的深度核查。于是FAPO触发了结构性升级——将检索链扩展到4到5跳,并引入多查询BM25搜索和实体感知的补救机制。这个改动的效果极为显著:三个模型的测试准确率分别比GEPA高出24.78、48.56和32.67个百分点,平均提升超过35个百分点。
IFBench考察的是AI是否能严格遵守提示词中规定的各种格式约束,比如"答案必须包含恰好五个段落"或者"每段话不超过三句"之类的硬性要求。FAPO的归因分析发现,单靠调整提示词无法可靠地强制执行这些约束,于是提出了结构性方案:在流水线末端增加专门的确定性后处理节点,通过代码逻辑而非AI推理来机械地执行约束检查。这个方案将三个模型相对于GEPA的测试准确率分别提升了38.95、37.70和19.84个百分点,是所有任务中优化幅度最为惊人的场景之一。
LiveBench-Math考察数学推理能力,使用的是专门设计来防止数据污染的新题目,失败原因通常是推理本身出错,或者最终答案的格式不符合评分要求。Papillon则是一个需要在回答质量和隐私保护之间寻找平衡的任务,AI系统需要在回答用户问题的同时,避免泄露敏感的个人身份信息。AIME使用的是竞赛级别的数学难题,要求精确的符号和数值推理,并且对答案格式有严格要求。在这三个场景中,FAPO主要依靠提示词优化(不触碰流水线结构)就取得了大多数的胜利,尽管AIME是一个例外——在这个场景下GEPA的表现反而略好一些,研究团队推测这可能是因为样本量相对较小,容易导致过拟合。
五、在网络安全领域的特殊考验
除了上述通用基准测试,研究团队还在一个真实的网络安全分类任务上测试了FAPO的能力。CTIBench-RCM(Cyber Threat Intelligence Benchmark - Root Cause Mapping,网络威胁情报基准-根因映射)要求AI系统阅读CVE(公共漏洞和暴露)的描述,然后将其正确归类到对应的CWE(常见弱点枚举)类别中——简单说,就是读懂一份漏洞报告,然后判断这个漏洞属于哪一类安全缺陷。这是一个263类的分类任务,数据集包含173个开发案例和827个测试案例,部分罕见类别只出现在测试集中,增加了难度。
这个实验严格限制在提示词优化范围内,不允许对流水线结构做任何修改。研究团队在三个不同的AI模型上分别进行了优化:面向通用用途的GPT-5、专门针对安全领域微调的Foundation-Sec-8B-Instruct,以及具有推理能力的Foundation-Sec-8B-Reasoning。三个模型总共测试了88个不同版本的提示词(GPT-5测试了31个,Foundation-Sec-8B-Instruct测试了30个,Foundation-Sec-8B-Reasoning测试了27个)。
有意思的是,对不同模型最有效的提示词策略截然不同,甚至方向相反。对于GPT-5来说,最有效的策略是让提示词变得更长、更详细——最佳版本(第29号变体)在基础提示词的基础上增加了一系列具体的NVD(美国国家漏洞数据库)映射规则,比如"栈/堆/未指明的缓冲区溢出应该映射到CWE-787而不是CWE-121或CWE-122"、"命令注入应该映射到CWE-77而不是CWE-78,除非描述明确提到操作系统级别的命令"等等。加入这些规则后,GPT-5的测试准确率从72.1%提升到了76.1%,提升了4个百分点。
然而对Foundation-Sec-8B-Instruct来说,情况完全相反——更复杂的规则反而损害了输出格式的稳定性,导致模型更容易产生难以被评分系统正确解析的输出。最终表现最好的提示词(第37号变体)是整个实验中最短的版本,只有两行,是基础提示词长度的一半。这个精简版本将测试准确率从63.9%提升到了71.0%,提升了7.1个百分点。Foundation-Sec-8B-Reasoning的最佳提示词与Instruct模型的最佳版本非常相似,只是额外加了一句"使用标准NVD抽象层次",这句话在消融实验中被证明贡献了2.9个百分点的提升,将测试准确率从71.0%推高到了73.0%。
这些发现揭示了一个关键洞察:提示词优化并不存在放之四海而皆准的通用策略,同一类任务上,不同模型需要截然不同的优化方向,这进一步印证了对每个具体场景进行系统性诊断的必要性。
六、数字背后的完整图景
综合来看,在18组模型与基准测试的对比实验中,FAPO在其中15组中击败了GEPA,总体平均领先14.1个百分点。在这15组胜利中,有11组的优势大到即便考虑实验的随机波动也不会影响结论——也就是说,这11组胜利是高度可信的统计性优势,而非偶然结果。
在被允许升级流水线结构的6组实验(HoVer和IFBench各3组)中,FAPO全部获胜,平均领先幅度高达33.8个百分点。而在仅限提示词优化的12组实验中,FAPO赢了其中9组,6组有明确的统计显著性。唯一一个GEPA全面领先的基准测试是AIME,但研究团队指出三个模型上的结果(-2.22、+3.78和+1.55个百分点)都在实验噪声范围之内,因此将这组结果定性为"不确定"而非"FAPO失败"。
研究团队还在论文中坦诚地讨论了一些潜在的复杂因素。FAPO的实验方差比GEPA更高,特别是在涉及结构性优化的场景下,原因是不同的优化轨迹可能走向截然不同的方向——有些试验中优化器识别出了结构性瓶颈并做出了结构性改动,有些则始终停留在提示词层面,两种情况下的结果差异很大,这自然会拉高跨试验的标准差。
此外,GPT-4.1-mini在基础测试中反而比GPT-5.4-mini表现更好,这个看似反直觉的结果其实另有隐情。两个模型都被给予了16000个token的生成预算,但提供商对这个预算的计算方式不同:对GPT-4.1-mini来说,这个限制只计算可见的输出文字;而对GPT-5.4-mini来说,这个限制是包含了内部推理过程的总预算,实际用于最终输出的token数量因此大打折扣。研究团队发现GPT-5.4-mini在数学任务上的可见输出中位数只有78个token,经常因为格式不完整而无法被评分系统识别,这是它基础分数偏低的主要原因,而非模型能力本身的问题。
说到底,FAPO的价值不仅仅在于它在基准测试上赢得了多少场胜利,更在于它提供了一种系统性的思维方式:当一个由多个环节构成的AI系统出了问题,不要急着盲目调整,而是先深入每一个环节去收集证据,找到真正的症结所在,然后从最小代价的修复手段开始尝试,只在必要时才动用更复杂的改造手段,而且每一步改动都要经过独立审核才能付诸实施。
这套思路对于任何构建和维护多步骤AI系统的从业者来说都有参考价值,无论是在安全分析、企业数据处理还是其他知识工作领域。FAPO的代码已经在GitHub上开放,感兴趣的读者可以通过检索"cisco-foundation-ai/fully-automated-prompt-optimization"找到相关资源。
---
Q&A
Q1:FAPO和普通的提示词优化工具有什么区别?
A:普通的提示词优化工具只会修改给AI的指令文字,把整个多步骤系统当成一个黑盒。FAPO的不同之处在于,它能深入检查流水线每个步骤的中间结果,判断问题究竟出在哪个环节,然后再决定是调整提示词就够了,还是需要对流水线结构本身动手术。可以理解为:普通工具只改菜谱,FAPO还能发现厨房的锅炉坏了需要换锅。
Q2:FAPO为什么在HoVer和IFBench上的提升幅度特别大?
A:因为这两个任务存在靠调整提示词根本无法解决的结构性问题。HoVer需要跨多篇文章查找证据,原有的3跳检索根本不够用;IFBench需要严格执行格式约束,而AI模型天然就不擅长机械地遵守这类硬性规则。FAPO的归因分析识别出了这些结构性瓶颈,并且被允许做出相应的结构性修改,所以提升幅度达到了30到50个百分点。
Q3:FAPO在安全漏洞分类任务CTIBench-RCM上是怎么做到对不同模型给出不同优化策略的?
A:FAPO对每个模型独立进行优化,通过反复测试不同的提示词变体,观察每次改动对验证集准确率的具体影响。对GPT-5,加入详细的NVD映射规则有效,所以提示词越来越长;对Foundation-Sec-8B-Instruct,实验发现复杂规则反而让模型输出格式变乱,所以最终选择了一个极简的两行提示词。这个过程完全由数据驱动,而非提前预设哪种方向更好。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。