
你有没有遇到过这种情况:让AI帮你写一篇报告,读起来通顺流畅,可是里面引用的数据源头早就变了,AI压根不知道。或者让AI画一张科研海报,图看起来挺精美,但是标题挤到边框外面去了,你让它改,它给你整张重画一遍,结果原来做得很好的配色又变了。
这不是AI不够聪明的问题。这是一整批研究者最近在琢磨的一个根本性问题:AI做东西的时候,到底应该怎么记住自己做过什么、怎么知道哪里出错了、怎么只改错的那一块而不动其他部分。
香港科技大学(广州)等多所高校的研究团队,联合梳理了259篇相关论文,写成了一篇综述,试图把这件事说清楚。他们给这类AI系统起了个名字,叫智能体式artifact创作。
artifact*:论文里反复出现的一个词,指的是任何有明确目标、被人为构造出来的成品,比如一篇报告、一张海报、一段视频、一个软件仓库,甚至一个物理仿真模型。
这篇综述最有意思的地方,不是又造了一堆新词,而是它试图回答一个很朴素的问题:为什么有些AI系统改起东西来又快又准,有些却动一下就全盘崩溃?答案藏在AI"记住状态"和"处理反馈"的方式里。
直接生成和反复打磨,差别到底在哪
先说一个可能违背你直觉的事实:让AI一次性把东西做对,往往比让它反复修改更难,但很多人对AI的期待恰恰是"一步到位"。
论文开篇举了个例子,叫Paper2Poster,就是把一篇学术论文自动变成一张海报。这事听起来简单,但海报要同时满足好几个条件:内容不能跑偏原论文的意思,得塞进固定大小的一张纸里,还要让人一眼看懂重点在哪。
这几个要求会互相打架。你把字体放大让人看得清楚,页面就装不下了;你把内容精简了塞进页面,可能又漏掉了论文里的关键结论。
论文提出的核心区分是这样的:如果AI只是把提示词丢进去,一次性吐出结果,中间没有检查、没有回头改的机会,这叫直接生成。如果AI在做的过程中会停下来看看效果怎么样,然后根据看到的结果决定接下来怎么改,这才叫智能体式创作。
这个区分听起来简单,但背后有个很重要的判断标准:不是看AI用了几个模型、调用了几次工具,而是看中间的观察结果有没有真的改变后续的动作。
这就好比你请一个装修师傅刷墙。如果他是那种闭着眼睛把整桶漆倒完就走的类型,那不管他用了多贵的漆刷、调了多少次颜色,本质上还是"一次性生产"。但如果他刷完一遍会退后两步看看哪里没刷匀,然后回头补刷那一块,这就是"边做边看边改"。前者出错了只能全部重刷,后者能精确定位到那一小块补救。
论文把这套边做边改的系统拆成了三个必须协同工作的零件。
第一个叫操作性表示,指的是AI用什么样的形式来记录"当前作品做到了哪一步"。这可能是一张还在编辑中的图片,也可能是一份带着各种参数和约束条件的结构化数据,还可能是一段可以运行的程序代码。
第二个叫构建策略,就是AI大脑里那个"接下来该做什么"的决策逻辑,它会结合任务要求、当前状态和之前收到的反馈,来判断下一步该改哪里、怎么改、还是已经可以交付了。
第三个叫运行时验证,负责检查刚做的改动到底达没达到要求,然后把检查结果转化成能指导下一步动作的信息。
这三个零件配合得好不好,直接决定了AI能不能做到"精准局部修复"而不是"每次出错都推倒重来"。
表示方式选错了,再好的反馈也没用
假设你现在有个明确的反馈:"这张海报标题挤到边框外面了",理论上这条反馈已经够清楚了。可是AI能不能真的只调整标题这一处,取决于它内部怎么"存放"这张海报。
论文把这种内部存放方式分成了三类。
第一类叫作品实例,就是直接存一份当前结果的原始文件,比如一张位图图片、一段音频波形。这类表示最直观,但你要单独改某个局部,往往牵一发动全身。
第二类叫结构化模型,把作品拆解成一堆带属性和关系的组件,像矢量图里的对象树,或者三维场景里的物体清单,每个部件都可以单独被点名修改。
第三类叫可执行程序,作品是用一段代码生成出来的,比如用代码画的数据可视化图表。
这三种表示方式的选择,直接决定了AI改起东西来是"精确制导"还是"地毯轰炸"。
论文举了个特别扎心的反例:如果一个系统内部用的是结构化的对象数据来管理海报设计,但唯一能用的修改操作只有"整张重新生成",那这个结构化数据其实白存了。反过来,如果用的是位图这种没有内部结构的表示,哪怕AI诊断出问题精确到了像素级别,它也没办法只改那几个像素而不影响周围区域。
这就像你去修一辆车。如果这辆车的说明书把每个零件都编好了号、画好了拆解图,那师傅坏了哪个零件换哪个零件就行。但如果说明书只写了"这是一辆车"四个字,哪怕你精确知道是火花塞坏了,你也没法只换火花塞,因为你根本不知道火花塞长什么样、装在哪。表示方式没跟上,诊断精度再高也是白费。
论文用EvoDiagram这个系统做了个正面例子。它专门用来画科学示意图,内部维护一个叫画布图式的结构,把语义上的逻辑关系、视觉上的样式、空间上的布局分开存放。这样一来,当用户说"保持布局不变,只改配色"的时候,系统真的可以只动配色那一层,而不会把好不容易调好的排版又打乱。
反馈这件事,光有诊断结果还不够
反馈机制的可以再往下拆一层。论文提出了个很实用的三层区分:一条反馈信息可能只是告诉你"这里不达标"(叫状态判定),也可能进一步说清楚"问题出在哪个具体部件、是哪个决定导致的"(叫故障诊断),最好的情况是它还能建议"应该往哪个方向改"(叫修改指引)。
这三层信息不是自动就都齐全的。很多评分系统只能给一个笼统的分数,比如"这幅图整体质量7分",这属于只有状态判定,没有故障诊断,你根本不知道该往哪改。
反过来,如果诊断精确到位,但可用的修改动作就只有"重新生成整个作品"这一种,那诊断的精细度也发挥不出作用。论文管这个叫诊断和修改能力的错位,这是整篇论文反复强调的一个核心矛盾:诊断的颗粒度必须匹配修改工具的颗粒度,光有一边强是不够的。
还有一个更微妙的坑,论文管它叫自我诊断的盲区。现在很多AI系统是同一个模型(或者是背景知识差不多的一批模型)既负责生成内容,又负责检查内容对不对。这种设置下,如果生成模型本身在某个知识点上有偏差,负责检查的模型很可能也在同一个盲区栽跟头,因为它们的"认知底子"是差不多的。
举个不那么恰当但好理解的类比:如果一个学生自己做完数学题,然后自己检查一遍答案对不对,那些他真正掌握了的知识点检查起来没问题,但那些他从根子上理解错了的概念,他检查十遍也发现不了问题,因为他检查时用的还是那套错误的理解方式。要想真正发现问题,得找一个用不同方法、不同知识背景的人来核对,比如让另一个独立的评分模型、或者干脆用可以直接运行验证的代码测试来核对,这样两边如果结论不一样,至少能提醒你"这里可能有猫腻,得再看看"。
这也解释了为什么论文特别强调多元化的诊断证据这件事的重要性,不是证据越多越好,而是这些证据得来自不同的判断路径,才能真正互相印证、堵住盲区。
六大艺术形式,各有各的痛点
论文把AI能创作的东西分成了六大类,每一类的"命门"都不一样。
文本类作品最大的麻烦是承诺的延续性。写小说的时候,第三章埋下的一个人物设定,可能在第十五章才被兑现或者违背,中间隔了太远,很难靠"读一遍找错"来发现。论文里提到一个叫Mr. Dre的评测发现,在反复修改研究报告的过程中,有16%到27%的比例会出现"倒退",原本正确的内容或引用,在后续修改中反而被改坏了。这说明光是"允许反复修改"这件事本身,如果没有配套的状态保护机制,反而可能越改越差。
二维视觉类作品,比如海报、图表、示意图,痛点是渲染出来的最终画面和背后支撑它的数据、逻辑之间容易脱钩。你看到的图表可能好看,但背后引用的数字可能早就算错了,光看画面根本看不出来。
音频类作品的痛点比较特殊,很多质量问题只有真正播放出来听了才能发现,符号层面的乐谱检查、代码层面的合成参数检查,都替代不了"耳朵听一遍"这个环节。
视频类作品的时间跨度最长,一个镜头里角色的表情、动作,到十个镜头之后可能就前后不连贯了,而且这种不连贯往往要等整段视频拼接完播放出来才会暴露。
三维空间类作品要考虑的东西更复杂,一个三维模型不仅要好看,还得考虑碰撞检测、能不能在里面走动、几何结构是否合理,这些属性光靠渲染出来的静态画面根本看不出来,得靠模拟运行才能验证。
行为类作品,比如软件系统、游戏,验证难度最大。因为它的对错取决于它在各种不同输入、不同交互场景下的表现,你不可能穷举所有可能性,只能抽样测试,而抽样测试永远存在盲区。
这六类作品放在一起看,你会发现一个共同的规律:越往后越难验证,不是因为技术做不到,而是因为"什么时候能看出问题"这件事本身就越来越滞后。文本的问题读一遍还能发现,视频的问题得播完才发现,行为类作品的问题可能要等到用户在某个极端场景下踩坑才发现。这个滞后性,论文管它叫失败可观测性,是贯穿全文的一条核心线索。
应用场景变了,"合格"的标准也变了
同一种作品类型,放在不同的应用场景里,"做得好"的标准完全不一样。
创意生产领域,标准是能不能给观众带来好的体验,这个判断很主观,需要创作者本人的审美介入。品牌传播领域,标准变成了跨渠道的一致性,一张海报和一段视频用的是不是同一套品牌调性。教育支持领域,标准是学习效果,内容再精美,学生没学到东西就是失败。专业工作领域,比如商业报告、法律文书,标准是能不能支撑真实的决策,还得有专业人士的审核签字。科研领域,标准是证据链的可靠性,能不能经得起同行评审。工程设计领域,标准最硬核,得靠物理测试和实际执行来验证,图纸再漂亮,装配不上就是零分。
这也是为什么论文反复强调评估目标要拆开来看。你不能只看最终作品的一个总分,因为总分可能掩盖了很多具体维度上的失败。一份报告可能读起来很流畅,评分很高,但里面的某个数据引用早就过期了,光看总分你根本发现不了这个问题。
论文举了个特别直观的例子,来自一个叫Design Arena的公开评测榜单。在给模型做网页设计、组件设计等多项任务的横向对比中,有个叫Kimi K3的模型在网站设计、组件设计等任务上几乎都排第一,但换到"原生安卓应用开发"这个任务上,它的排名一下掉到了百分位第54名左右,而另一个叫Claude Fable 5的模型在这个任务上反而冲到了第一。这说明单看一个综合排名会严重误导判断,一个模型在某个细分任务上强,不代表它在所有任务上都强。
四条原则,说到底就是"别让状态变成一团糊涂账"
论文最后提炼出了四条设计原则,说白了都在围绕同一件事:让整个创作过程始终保持"可查、可追、可控"的状态。
第一条是把承诺显性化。任何一个后续步骤必须遵守的约束,都得变成可以被查阅、被检查的具体状态,而不是散落在某个模型的记忆里,说不清楚就丢了。
第二条是明确责任边界。当任务被拆成多个模块、多个角色分头完成的时候,谁负责保证跨模块之间的一致性,这件事必须提前说清楚,否则每个模块单看都合格,拼起来却全盘出错。
第三条是让反馈变得可执行。一条反馈信息如果不能对应到一个具体可操作的修改动作,那这条反馈基本上是废的。
第四条是改动之后要重新验证受影响的部分。这条原则特别容易被忽略:你以为改了一处小问题就万事大吉,但这个改动可能悄悄破坏了原来通过验证的另一处内容,如果不重新检查,这种"隐藏的倒退"根本不会被发现。
这四条原则听起来抽象,但落到具体场景里就特别好理解。想象你在管理一个大型项目的多人协作文档,A组改了需求文档,B组基于旧需求写了代码,如果A组的改动没有及时通知B组、B组也没有重新核对自己的代码是否还符合新需求,那这个项目最终交付的时候大概率会出问题。这套四条原则,本质上就是在给AI创作系统装上一套类似的"变更管理流程"。
Q&A
Q1:智能体式artifact创作和普通的AI生成内容有什么区别?
A:普通生成是一次性把提示词丢给AI直接输出结果,中间不检查也不回头改。智能体式创作是AI在制作过程中会停下来检查效果,根据看到的问题决定下一步怎么改,中间的观察结果真的会影响后续动作,而不只是走个流程。
Q2:为什么AI改东西的时候容易牵一发动全身,改一处坏一片?
A:核心原因是AI内部存储作品状态的方式和它能用的修改工具颗粒度不匹配。如果作品只是存成一张完整图片而不是拆解成可独立编辑的部件,那哪怕诊断出问题精确到某个细节,AI也只能选择整体重新生成,这样必然会连累原本做对的部分。
Q3:为什么同一个AI系统自己检查自己生成的内容,容易查不出问题?
A:因为生成内容和检查内容如果用的是同一个模型或知识背景相近的模型,它们的认知盲区往往是重合的。这就像一个人自己检查自己的答案,那些他从根子上理解错的地方,检查多少遍都发现不了,得靠不同判断路径的独立验证才能真正堵住这个漏洞。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。