微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI写研究报告,为什么让"多个大脑"分头干活比"一个大脑"从头到尾更靠谱

AI写研究报告,为什么让"多个大脑"分头干活比"一个大脑"从头到尾更靠谱

2026-10-09 11:09
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-10-09 11:09 • 科技行者

你有没有让AI帮你写过一份深度研究报告?

那种几千字、要查资料、要分析、要有理有据的那种。如果你试过,大概率会遇到一个尴尬场面:AI一开始写得挺像样,写到后面开始重复啰嗦,或者你想让它补充一个新发现的信息,它一改就把前面写好的内容改乱了。

这不是AI偷懒,而是一个更深层的结构性问题。美团LongCat团队最近发的一篇技术报告,把这个问题讲透了,还给出了一套解法。这套系统叫LongCat-DeepResearch,在几个权威的深度研究评测集上拿到了不错的成绩,我们今天就来聊聊它到底解决了什么、怎么解决的。

写报告这件事,难在哪

先说一个可能违背你直觉的事实:写一篇开放性的深度研究报告,比回答一个具体问题难得多,难的不是"找不到答案",而是"你一开始根本不知道要找什么"。

这么说吧,如果你要查"2023年某公司营收是多少",这是个封闭问题,答案就在那里,找到就行。但如果你要写一篇关于"AI在金融投资中的应用"的综述报告,你在动笔之前,根本无法穷尽所有要涉及的理论、案例和最新进展。你可能写着写着才发现,漏了一个关键的研究团队,或者某个论断需要补充新证据才站得住脚。

这就是研究报告和普通问答的本质区别:证据需求是在写作过程中逐渐暴露出来的,而不是一开始就能列清楚的清单。

那现有的AI系统是怎么处理这个问题的呢?报告里提到,主流路径大概有两种。一种是让AI一边搜索一边推理一边写,走一步看一步;另一种是先搞出一份草稿,然后不断拿这份草稿去指导后续的检索和修改。

这两种做法都会撞上同一堵墙。

**当研究历史越滚越大,或者需要反复重写整篇报告时,会出现三个具体的麻烦。**

第一个麻烦是资源打架。证据、中间推理过程、草稿文字,这些东西全都要塞进AI的"脑子"(也就是它能处理的上下文窗口)里,空间有限,就得压缩。可压缩这个动作本身很危险,你现在觉得不重要而删掉的信息,很可能就是后面写到某一段时突然变得至关重要的证据。

**上下文窗口**:指AI一次能读取和处理的文本长度上限,好比一个人一次能记住的信息量,超出这个量就得取舍。

第二个麻烦更隐蔽,早期形成的一些结论会像磁铁一样吸住后续的思路,让AI后面的搜索都围着这个初步判断转,视野越写越窄。第三个麻烦是效率问题:每次有新证据进来就把整篇报告重写一遍,等于是为了改一句话,把全书都印刷了一遍。

这三个问题合在一起,逼出了LongCat团队的核心追问:**能不能让AI既保持一个共同的研究方向,又不必把所有细节都塞进一个越滚越大的雪球里?**

ResearchSpec:把"报告草稿"换成"报告说明书"

LongCat团队想出的办法,说白了就是四个字:分而治之。但这四个字怎么落地,才是真正见功力的地方。

他们引入了一个叫ResearchSpec的东西。

**ResearchSpec**:可以理解成一份"研究执行说明书",它不是报告本身,而是对报告需要覆盖哪些内容、每部分要回答什么问题、需要什么证据的一份紧凑清单。

这里的巧思在于,团队没有让AI一上来就动笔写草稿,而是先让多个独立的"规划写手"(Planning Writers)分头去互联网上简单搜索、阅读资料,然后各自提出一份候选的报告结构。这几份草案会被一个叫"规划裁判"的角色汇总合并,再由一个"批评者"角色专门去挑毛病、找遗漏,最后由"修订者"把这些反馈吸收进去,形成最终版的ResearchSpec。

这个过程你可以想象成公司里筹备一个大项目。如果只让一个人闷头做方案,那这个人的知识盲区就是整个项目的盲区,他没想到的角度,永远不会出现在计划里。但如果先让三个不同背景的同事各自琢磨一版方案,再开会碰撞、挑刺、补漏,最后拿出来的方案质量显然会更扎实。如果没有这个"多人分头探索再汇总"的步骤,报告的整体视野很可能一开始就窄了,后面写得再细也救不回来。

ResearchSpec里记录的东西很具体:每个小节要覆盖的范围、需要回答的研究问题、必须提到的实体或案例,还有初步的信息来源线索。每个可以独立执行的小节都有一个唯一编号,比如S1.2,团队管这些执行单元叫"section"。

**section(章节/执行单元)**:报告里可以被单独分配给一个研究员独立完成的最小写作单位,有点像团队项目里"这一块归你负责"的任务包。

值得一提的是,这份说明书在正式分发给各路"研究员"去干活之前,会经过验证器检查,编号有没有重复、父子关系对不对、顺序是否连贯、必填字段是否齐全。有问题就打回去修,实在修不好就回退到之前验证过的版本。这是个挺工程化的细节,但恰恰说明团队把"计划质量"当成了一件不能将就的事,毕竟这份计划一旦定下来,就要在后续阶段被"锁死",不会再轻易推翻重来。

有意思的是,团队专门做了个实验来验证"计划要不要反复打磨"这件事,值得多说两句。他们设计了四个阶段:W0是只用一个写手的方案,J0是三个写手方案经裁判整合后的版本,R1是再经过一轮"批评-修订"循环的版本,R2是两轮循环后的版本。

结果挺耐人寻味。**从W0到J0,也就是从单人方案到多人整合方案,无论是计划本身覆盖的完整度(从53.76%涨到60.47%),还是最终报告在ResearchRubrics评测上的得分(从81.67涨到85.13),都有明显提升。**

但从J0到R1、R2,也就是继续增加批评修订轮次,计划覆盖度确实还在爬(63.14%到62.48%),可最终报告的得分反而有点起伏,R1的83.24分和R2的84.89分都没超过J0的85.13分。

这说明什么呢?说明"集思广益"这一步是真金白银的收益,但"反复精雕细琢"之后,收益会打折扣,甚至可能不划算。研究团队自己也坦诚地写道,这是"喜忧参半的效果",没有回避这个不那么漂亮的结果。这种诚实挺难得的,很多技术报告会选择性地展示最好看的那组数据,但这篇报告把矛盾的地方也摆出来了。

每个章节独立开小灶:写作和查证不脱节

计划定好了,接下来就是真正动手研究和写作的阶段。这一步的设计思路也很有意思。

LongCat团队让每一个"研究员"智能体,只拿到三样东西:最初的用户问题、完整的ResearchSpec、还有分配给它的那一个具体章节任务。然后这个研究员就在一个完全独立的上下文环境里,自己去搜索资料、自己去阅读验证,最后自己把这一节内容写出来。

这里的关键设计是,同一个智能体既是这一节的"调查员",也是这一节的"撰稿人",中间不需要经过一次"我先总结给别人听,别人再帮我写"的转手。

这个设计解决了什么问题?我们可以拿记者写深度报道来打比方。如果一个记者去实地采访三个月,回来后只交给另一个人一份浓缩的采访提纲,让那个人凭提纲写稿子,那写出来的稿子必然会丢失很多现场的细节和微妙的语气,因为提纲本身就是一次信息损耗。但如果采访者自己动笔写,那些没写进提纲、但采访时记在心里的细节,反而更容易被自然地写进正文里。

如果不这样设计,让研究和写作分成两个角色,会发生什么?报告里专门做了对照实验,叫"一个跑全流程的研究员",也就是同样拿到完整的ResearchSpec,但不是分给多个人并行处理,而是让一个研究员用单一的研究历史来完成整份草稿。

**结果是DeepResearchBench II的分数从Full方案的48.68掉到了45.64,ResearchRubrics也从79.14掉到了78.49,平均分从63.91跌到62.07。**

这个差距足以说明,把研究工作拆开并行处理,不只是为了省时间,更是为了保证每一部分的调查深度不被稀释。

各个研究员是并行工作的,谁也不看谁写了什么,这样才能同时深挖多个方向而不互相干扰。但这也意味着,不同章节之间难免会出现内容重复,毕竟大家各干各的,谁也不知道别人已经写过某个论据了。这就引出了下一步:怎么把这些各自独立完成的稿子拼在一起,还不显得凌乱。

先拼装,再统筹修改:编辑不用重写整本书

前面说到,反复重写整篇报告的代价很高。LongCat团队给出的解法是把"全局判断"和"局部改写"这两件事彻底分开。

具体流程是这样的。各个章节写完之后,系统先按照ResearchSpec里规定的顺序机械地把它们拼接起来,形成一份完整草稿,哪怕这时候内容有重复也先不管。

然后,一个叫"全局编辑"(Global Editor)的角色会通读这份完整草稿,它的任务不是动笔改写,而是做判断:哪部分内容重复了、应该归哪一节负责、有没有前后矛盾的地方、需要做哪些调整。这些判断会变成具体的"指令"。

接下来,"局部编辑"(Local Editor)拿到这些指令,加上完整草稿和原始的ResearchSpec作为参考,只去修改自己被分配到的那一小节,而不是把整篇文章重新生成一遍。

这个分工方式,很像一本书的主编和分册编辑的关系。主编通读全书之后发现,某个历史事件在第三章和第七章都详细讲了一遍,就会在批注里写"详细内容放第七章,第三章简写并加个引用指向第七章",然后具体动笔精简第三章文字的,是负责第三章的编辑,而不是主编亲自重写。

如果没有这层分工,会怎样?每次编辑意见提出来都得把全书重新写一遍,且不说计算成本会飙升,更麻烦的是,每重写一次,就多一次把原本写得好的地方不小心改坏的风险。报告里提到了一篇叫Mr. Dre的研究,直接证明了"报告修订能满足新反馈,但也会损害原本已经写好的覆盖面或引用质量",这正是团队想要规避的陷阱。

报告里给了一个具体的案例,特别能说明这套编辑机制是怎么运作的。这个案例是一篇关于AI增强型投资组合管理的报告。在关于CAPM资本资产定价模型的章节里,研究员写了一段关于Fama-French 1992年研究的详细论述,说的是市场beta值对股票收益率没有解释力这件事。但这个发现其实在另一节,也就是三因子模型那一节里,也需要用到,且更适合详细展开。

全局编辑读完全文后做出判断:这个发现的详细论述应该放在三因子模型那一节,CAPM那一节只需要保留核心结论,加一句"详见另一节"的交叉引用就够了。局部编辑收到这个指令后,把CAPM那一节里原本详细的论述精简成了一句话,末尾加了"discussed in detail in S1.5"这样的引用。

这段修改被完整保留在了最终得分89.29分的报告里,说明这套机制确实起了作用。不过报告也很坦诚地指出了这个案例里的瑕疵,修改后的文字里保留了内部编号"S1.5",但最终展示给读者的标题其实并没有对应显示这个编号,算是一个"收尾没做干净"的小瑕疵。而且这份报告依然漏掉了Treynor和CPPI这两个应该被提及的知识点。

这恰恰说明了一件很朴素的事:一套设计精良的流程,也不能保证万无一失。研究团队没有回避这一点,反而把这个不完美的例子专门拿出来当案例分析,这种态度比一味展示"完美案例"要真实得多。

数据说话:到底好在哪、又差在哪

说了这么多设计思路,最终还是要看效果。LongCat-DeepResearch在三个公开评测基准和一个内部基准上,和Gemini-DeepResearch、ChatGPT-DeepResearch、Claude-DeepResearch这三个知名产品做了对比。

**在DeepResearchBench上,LongCat-DeepResearch拿到55.25分,比表现最好的对手(ChatGPT-DeepResearch的54.95)高出0.30分。**

**在DeepResearchBench II上,LongCat-DeepResearch拿到51.35分,比Claude-DeepResearch的48.18分高出3.17分,其中分析维度的优势尤其明显,60.69分对比第二名的52.26分,差距接近8.5分。**

**在ResearchRubrics上,LongCat-DeepResearch拿到79.83分,比ChatGPT-DeepResearch的74.21分高出5.62分。**

在内部基准上,LongCat-DeepResearch排名第二,76.04分,比ChatGPT-DeepResearch的76.59分低0.55分,但比Claude-DeepResearch的61.42分和Gemini-DeepResearch的42.49分要高不少。

有意思的是短板也很明显:在DeepResearchBench的"可读性"这个维度上,LongCat-DeepResearch的49.96分反而是四个系统里最低的,落后ChatGPT-DeepResearch的51.51分。这说明这套系统更擅长把信息查全、查深,但在让文字读起来轻松流畅这件事上,还有提升空间。团队在报告的局限性部分也直言不讳地写了这一点:这个框架优先保证证据的全面和研究要求的覆盖,写出来的报告可能偏长、偏密、甚至有点啰嗦。

再说说编辑这一步到底值不值得做。团队做了个对照实验,比较了原始编辑器(跑一轮)和"增强版编辑器"(可以看到引用来源的原文片段,还带事实核查指令,跑一到三轮)的效果。

结果显示,跑到第三轮增强编辑(B3)时,DeepResearchBench II的原生分数从没编辑时的55.87涨到了58.38,同时读者对可读性的偏好评分也从50分(打平)涨到了53.96分。**这说明多轮编辑确实能让文章读起来更顺,还能顺带修正一些事实错误。**

报告里举了个具体例子:某篇关于在线学习的报告草稿里,原本把一项调研的地点错误地写成了"Arab Region"(阿拉伯地区),参与人数写成3348人,经过编辑之后修正为"Jordan"(约旦),具体人数是280名学生加50名教师,这个修正让对应问题的原生得分提高了1.59分。

但团队也没藏着掖着地承认,编辑并非纯粹的正收益。比如在一篇关于全民基本收入的报告里,编辑让试点相关的段落结构更清晰,拿到了一个结构性加分项,但同时因为对定量数据的归因表述变弱了,反而丢掉了一个权重更高的引用质量加分项,最终净效果是扣了1.25分。

团队甚至还发现了一个挺微妙的"评分错觉":有些新增加分的事实其实早就存在于未编辑的原始草稿里,只是评分模型这一次"注意到了"而已。分数变高,未必真的是编辑增加了信息量,这提醒我们评测本身也是有噪声的,不能盲目迷信分数的绝对值。

从流程到数据:这套系统还在训练AI自己

除了直接拿来写报告,这套系统还有一个不那么显眼但挺重要的功能:它顺带给LongCat团队自家的通用模型提供了训练素材。

因为整个流程被拆分成了规划、研究、编辑这几个清晰的阶段,每个阶段的输入输出都是结构化、可检查的,这就天然适合拿来构造训练数据。团队会先基于一篇有明确授权的评论文章,或者一份经过整理的多信源简报,提炼出研究问题和对应的评分标准(rubric)。

**rubric(评分标准/评判准则)**:可以理解成给一篇报告打分用的详细checklist,规定了必须包含哪些事实、哪些分析、甚至有些是"不能出现的错误内容"这种反向要求。

这里有个细节挺值得说的,就是团队对"这道题能不能查到答案"这件事做了专门验证。对于要求"记忆事实类"的评分点,系统会去搜索除了原始那篇文章之外的其他信息源,看看这个事实是不是能被独立验证到,如果找到了完整支撑就标记"保留",只有部分支撑就标记"修订",完全找不到就直接"丢弃"。只有当一道题的所有评分点都拿到"保留",这道题才算通过质量关。

这道工序背后的用意其实很朴素:如果拿来训练AI的问题本身就是查无实据的伪命题,那再厉害的模型也只会学到一堆没法验证的空中楼阁。

硬碰硬的对照实验:换个"大脑"和换个"流程"哪个贡献更大

最后还有一组挺硬核的对照实验,回答了一个很实在的问题:到底是"底层模型更强"贡献大,还是"这套多智能体协作流程"贡献大?

团队做了三组对比。第一组是LongCat的上一代模型,配上一种更简单的边搜索边写作的方式(ReAct,直接生成报告,不走这套复杂流程)。第二组是同样的上一代模型,但换上现在这套完整的研究流程。第三组是最新的LongCat模型,同样配上这套完整流程。

**结果非常清晰:光是给老模型换上新流程,DeepResearchBench II的分数就从33.13飙升到48.68,涨幅接近50%;ResearchRubrics也从60.33涨到71.90。三个基准的平均分从47.04涨到58.05,涨了11分。**

而在流程不变的情况下,把模型从旧款换成新款,平均分又进一步从58.05涨到62.14。

这组数据传达的信息挺重要的:光靠堆更强的模型,未必能解决深度研究报告写作的问题,流程设计本身贡献了相当大一部分的提升,而模型能力和流程设计,是两个可以叠加、互相独立生效的改进方向,这也印证了整个报告开篇提出的那个核心判断,把研究和写作拆开、把全局协调和细节调查分开处理,这个架构性的思路,本身就是有实打实价值的。

写在后面

读完这篇报告,最触动我的其实不是那几个评测分数,而是团队处理"失败"和"不完美"的方式。

大部分技术报告习惯把最好看的结果放在最前面,把有争议的地方一笔带过。但这篇报告反而花了相当篇幅去讲"计划反复打磨之后效果反而下降了"、"编辑有时候会把好的引用质量改坏"、"某个案例最后拿了89分,但里面还是漏了一个关键学者的理论"。

这种诚实带来一个挺有意思的启发:一个系统的"优秀",不是靠消灭所有瑕疵,而是靠让每一次失误都变得可追溯、可归因。你能清楚地指出"CAPM那一节的引用编号没显示对",本身就说明这套流程留下了足够清晰的痕迹,让问题定位变得可能。这比一个黑箱式地吐出一份看起来完美、但你说不清哪里可能有问题的报告,其实更值得信任。

还有一个细节让我反复琢磨:那个"计划集思广益有用、但反复精雕细琢收益递减"的实验结果。这让我联想到写作这件事本身,一开始多听几个人的意见确实能打开思路,但如果无限次地开会讨论、反复推翻重来,很可能到最后大家已经忘了最初想解决的问题是什么,反而把计划改得四不像。什么时候该停止讨论、动手去做,这可能是任何协作系统,无论是AI还是人类团队,都要面对的共同难题。

那么问题来了,如果连AI系统都要在"集体智慧"和"过度打磨"之间找平衡点,那我们自己在做一份方案、写一篇文章之前,是不是也该问问自己:我现在是在真正补全信息盲区,还是只是在用"再想想"来逃避真正动笔的那一刻?

Q&A

Q1:LongCat-DeepResearch是什么?

A:LongCat-DeepResearch是美团LongCat团队推出的深度研究系统,结合了增强版的LongCat大模型和一套多智能体协作流程,能够针对开放性问题生成有证据支撑的完整研究报告。

Q2:ResearchSpec在LongCat-DeepResearch中起什么作用?

A:ResearchSpec是一份紧凑的研究执行说明书,记录了报告每个章节要覆盖的范围、需要回答的问题、必须提及的实体和信息来源线索,它在正式研究写作前先由多个规划智能体讨论确定,之后保持固定,用来指导各章节独立研究和写作。

Q3:LongCat-DeepResearch的评测表现怎么样?

A:它在DeepResearchBench拿到55.25分、DeepResearchBench II拿到51.35分、ResearchRubrics拿到79.83分,均超过对比的三款知名深度研究产品,但在内部基准和可读性维度上略逊于ChatGPT-DeepResearch。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-