
这项由上海交通大学医学院附属精神卫生中心与EverMind AI公司、天桥脑科学研究院联合完成的研究,于2026年8月发表在第32届ACM SIGKDD知识发现与数据挖掘会议论文集(KDD '26)上,发表地点为韩国济州岛,论文DOI为10.1145/3770855.3817539,arXiv预印本编号为2602.09379。感兴趣的读者可通过上述编号查阅完整原文。
全球大约每八个人中就有一个人正在经历某种精神心理障碍——抑郁、焦虑、强迫、双相……这些疾病悄无声息地影响着数以亿计的家庭。然而,精神科医生的数量远远跟不上需求,看诊排队、候诊数月的情况在全世界普遍存在。与此同时,精神科诊断本身也极具挑战性,它不像验血那样有明确数字,而是高度依赖医生与患者之间的面对面交流、问诊、观察,主观成分较重,不同医生对同一个患者的判断可能存在差异。
正因如此,人工智能辅助精神科诊断的研究方向近年来受到越来越多的关注。大型语言模型(也就是像ChatGPT这类能理解和生成文字的AI)展现出了令人期待的潜力。但在实际落地之前,有一个根本性的问题必须先回答:这些AI到底有多厉害,又在哪些地方还差得远?要回答这个问题,就需要一个足够真实、足够全面的"考场"来考一考它们。
来自上海交大精神卫生中心和EverMind AI的研究团队,正是为了搭建这样一个考场,才设计出了今天要介绍的这套系统——灵犀诊断基准(LingxiDiagBench)。这是目前为止规模最大、最贴近真实临床场景的中文精神科AI诊断评测平台,也是第一个能同时评测AI"静态读诊断"和"动态问诊"两种能力的综合性框架。
一、为什么现有的AI考场都不够用
要理解这项研究的价值,先得明白现有的评测工具有哪些问题。
以往的精神科AI测评,大多像是纸笔考试——给AI一段已经写好的对话或病历,让它从中判断患者得了什么病。这种方式有三个明显的缺陷。
其一,那些对话大多是模板化生成的,听起来不像真人说话,缺乏真实病人在诊室里那种混乱、迂回、情绪化的表达方式。其二,很多测评数据集里缺少做精准区分诊断所必需的关键信息,而且诊断标签也没有经过真正的临床医生核实,可靠性存疑。其三,几乎没有哪个测评平台支持让AI真正"开口问诊"——也就是说,它们只测了AI"看诊断记录做判断"的能力,而没有测AI"主动与患者交流、收集信息、逐步得出结论"的能力。
这就好比你想知道一个厨师的真实水平,却只给他看菜谱,从不让他实际下厨。
灵犀诊断基准的设计初衷,正是要同时测这两件事:既测AI看着现成对话做诊断的能力,也测AI自己主导问诊、主动采集信息、最终给出诊断的能力。
二、数据从哪里来——一万六千份"仿真病历"的诞生
整个研究体系的地基,是一个叫做"灵犀诊断-16K"(LingxiDiag-16K)的数据集,里面包含一万六千份合成问诊对话和对应的电子病历。
这些数据并非凭空捏造,而是有严肃的临床依据。研究团队首先在上海精神卫生中心收集了约4500名门诊患者的真实数据,经过匿名化处理、语音转录和人工核验后,最终整理出1709份配有完整电子病历和经过验证转录文本的真实案例,构成了"灵犀临床数据集"(LingxiDiag-Clinical)。这项工作经过上海精神卫生中心伦理委员会审查批准,每位参与者或其监护人均签署了知情同意书。
有了这1709份真实案例作为基础,研究团队的下一步是把它们的统计规律"提炼"出来,构建成一张知识图谱,再根据这张图谱批量生成合成数据。具体来说,合成过程包含七个环节:从真实数据的经验分布中采样年龄、性别、科室和ICD-10诊断编码(即世界卫生组织的国际疾病分类体系中的精神疾病代码),然后依次生成陪同就诊者信息、个人史、主诉、现病史、辅助字段,最后将所有字段组装成完整的电子病历。
这样做的好处是双重的:一方面保护了患者隐私,没有任何真实病人的信息被直接使用;另一方面,生成的数据在统计分布上与真实数据高度吻合。从表格数据来看,两个数据集在年龄分布、性别比例、各疾病类型占比上的差异均控制在5个百分点以内。以抑郁发作(F32)为例,真实数据中占比35.2%,合成数据中为34.8%;焦虑障碍(F41)分别为22.1%和22.5%。除了这些数字层面的一致性,合成数据还复现了真实数据中的社会规律——比如年轻患者更多是学生、中年患者多已婚就业等年龄相关的生活模式——以及临床文本的语言特征,包括主诉和现病史的字符长度分布。研究团队用詹森-香农散度(JS散度,一种衡量两个分布相似程度的数学工具,值越小越相似)来量化这种一致性,各诊断类别的主诉长度JS散度均在0.03到0.07之间,说明合成数据与真实数据在语言风格上极为接近。
三、考场里有三位"演员"——患者、医生、诊断师
灵犀诊断基准不是单纯的静态题库,而是一个动态的多智能体(multi-agent,即多个AI协作运行)框架。在这个框架里,扮演着三种不同角色:患者智能体、医生智能体和诊断智能体。
患者智能体的任务是模拟真实患者在门诊中的行为。它以真实病历数据为基础,被注入患者的基本信息、主诉、病史和诊断信息,同时获得对话历史作为上下文,以此来生成符合真实患者特征的回应。
然而,研究团队发现,仅靠这些还不够。直接让大语言模型扮演患者,往往会出现三个不自然的问题:回复太长,症状一股脑全部说出来而不是逐渐透露,以及语言过于书面化、缺少口语的粗糙感。为此,研究团队专门设计了一套精细的提示词工程(也就是通过精心设计给AI的"指令"来改变它的行为),让AI患者的回应更加简短、零散、自然,同时还从真实数据的经验分布中采样目标回复长度来控制字数。这套改进版患者智能体被命名为"灵犀患者"(LingxiDiag-Patient)。
医生智能体扮演精神科医生的角色,负责主导问诊过程。研究团队为它设计了四种不同的问诊策略,以便对比不同策略下的效果。
第一种叫"自由发挥"(Free-form):AI被告知自己是一位资深精神科医生,可以自主决定问什么、怎么问,以及什么时候信息收集够了可以做诊断。这种策略没有任何外部框架约束。
第二种叫"症状树"(Symptom-Tree):借鉴了此前一项叫MDD-5K的研究所使用的症状决策树方法,沿着预先定义好的症状路径逐一询问。这种方法的局限在于它需要一个有限的预设症状集合,当目标疾病种类增多时,需要查询的症状数量会急剧膨胀,效率较低。
第三种叫"APA引导"(APA-Guided):遵循美国精神病学协会(APA)的五阶段临床访谈指南,依次经历筛查(主诉和症状持续时间)、评估(核心症状细节和功能损害)、深挖(具体症状及潜在原因)、风险评估(自杀和自伤筛查)和总结(关键信息确认)五个阶段,每个阶段有必问项目和可选项目,以及明确的阶段切换条件。
第四种叫"APA引导+多轮诊断检索增强"(APA-Guided + MRD-RAG):在第三种的基础上加入了检索增强模块。具体来说,在评估和深挖阶段,系统会根据当前对话内容和疑似诊断,从一份中文临床指南文档中检索出最相关的诊断标准段落(使用Qwen3-Embedding-8B生成向量,通过FAISS索引进行相似度搜索,再用Qwen3-Reranker-8B重排序,最终提供排名前三的疑似诊断的相关指南内容),为医生智能体的下一个问题提供循证支持。
诊断智能体的工作则相对独立。它不参与实时问诊,而是接收完整的对话记录,根据完整信息给出诊断结论和支持性临床推理。
四、两种考试模式——静态做题和动态问诊
灵犀诊断基准设计了两种互补的评测范式。
第一种是"静态评测"(LingxiDiagBench-Static):给AI提供固定的问诊对话文本,让它直接从中做出诊断判断。这种模式侧重于可重复的标准化评测,方便对不同AI进行横向比较。静态评测包含两个任务:一是"辅助诊断",二是"医生下一问预测"。
辅助诊断任务按难度分为三个层级。最简单的是二分类任务:只区分抑郁和焦虑两种疾病,而且专门排除了同时患两种病的情况。中等难度是四分类任务:在抑郁和焦虑之外,还要区分"混合型抑郁焦虑"(两种病同时存在)和"其他精神疾病"。最难的是十二分类任务,涵盖ICD-10中的12个主要精神疾病类别:精神分裂症(F20)、双相情感障碍(F31)、抑郁发作(F32)、未特指心境障碍(F39)、焦虑障碍(F41)、强迫症(F42)、应激相关障碍(F43)、躯体形式障碍(F45)、睡眠障碍(F51)、童年起病障碍(F98)、咨询服务(Z71)以及其他类别。这个任务要求AI具备跨越多种异质性疾病的宽泛鉴别诊断能力。
医生下一问预测任务则是给AI看到当前对话进行到某一步,让AI预测医生接下来应该问什么问题。这个任务考查的是AI对问诊流程的理解是否足够深入,能否生成在临床上合理的后续问题。评测指标包括BLEU分(衡量词语层面的重合度)、ROUGE-L分(衡量最长公共子序列的相似度)和BERTScore(衡量语义层面的相似度)。
第二种是"动态评测"(LingxiDiagBench-Dynamic):医生智能体与患者智能体进行真实的多轮对话,完成整个问诊过程后再给出诊断。这种模式考查的是端到端的完整能力,既测问诊质量,也测最终诊断准确率。
五、大模型们的成绩单——有惊喜,也有令人担忧的盲区
研究团队对一大批当前最先进的大语言模型进行了全面测评,包括来自阿里巴巴的Qwen3系列(1.7B、4B、8B、32B四个规模)、百川的Baichuan-M2-32B和Baichuan-M3-235B、月之暗面的Kimi-K2-Thinking、DeepSeek-V3.2、谷歌的Gemini-3-Flash、OpenAI的GPT-OSS-20B和GPT-5-Mini,以及Anthropic的Claude-Haiku-4.5。此外还测了传统机器学习方法作为基线对比,包括TF-IDF特征提取配合逻辑回归、支持向量机和随机森林分类器。
静态评测的结果呈现出清晰的难度梯度。对于区分抑郁和焦虑的二分类任务,各方法的准确率普遍较高——在合成数据集上,Gemini-3-Flash达到了85.4%的最高准确率;在真实临床数据集上,Qwen3-4B达到了88.7%。这个成绩放在医疗AI领域算是相当不错的,说明现有大模型在区分最常见的两种精神疾病上已经具备了相当的能力。
然而一旦加入"两种病同时存在"的可能性,进入四分类任务,准确率就明显下滑。在合成数据集上,传统方法TF-IDF加随机森林以47.9%的准确率领跑,Qwen3-32B达到43.8%;在真实临床数据集上,Qwen3-32B以52.4%居首。这意味着,当AI需要识别"这个患者既有抑郁又有焦虑"这种共病情况时,它的表现会大幅退步。
到了最难的十二分类任务,局面就更加严峻了。在合成数据集上,GPT-5-Mini以40.9%的准确率排名最高;在真实临床数据集上,Qwen3-32B的宏平均F1分数(一种综合考量各类别均衡表现的指标)最高,达到27.8%。值得注意的是,Top-3准确率(即正确诊断是否出现在模型给出的前三个候选中)要高得多——在真实数据上,Qwen3-4B的Top-3准确率高达69.8%,说明模型大多时候能把正确答案"圈"在候选范围内,但难以精准地把它排到第一位。
整体评分(Clf-Ovl,综合所有任务指标的综合得分)方面,在合成数据集上,传统的TF-IDF加逻辑回归以0.533分意外位居榜首,略高于GPT级别的大模型;在真实临床数据集上,Qwen3-32B以0.548分领先。这个结果耐人寻味,传统方法在综合评测中并没有被完全碾压,说明精神科诊断并非单纯靠"大"就能胜任的任务。
医生下一问预测任务的结果则相对集中,各大模型之间差异不大。BLEU分大约在20%到23%之间,BERTScore在72%到84%之间。其中DeepSeek-V3.2在合成数据集上的BLEU(22.2%)和ROUGE-L(24.6%)表现最突出,Qwen3-8B的BERTScore(84.4%)最高。这说明在理解问诊流程、预测下一步该问什么这件事上,现有大模型已经具备了相当水准,但距离完美仍有差距。
六、动态问诊的挑战——会聊天的AI不一定会诊断
动态评测的结果揭示了一个更为复杂的图景。
在二分类任务上,动态问诊模式下的最高准确率达到了92.3%(DeepSeek-V3.2,使用APA引导加检索增强策略),甚至高于静态评测的最好成绩。这说明对于最基础的诊断任务,AI通过主动问诊收集到的信息,有时反而比阅读一段固定对话更有帮助。
但在四分类和十二分类任务上,动态模式的表现往往低于静态模式。最好的四分类准确率为43.0%(Grok-4.1-Fast,APA引导加检索增强),最好的十二分类准确率为28.5%(同样是Grok-4.1-Fast,同样策略)。这意味着,在实时问诊中,AI如果问诊策略不当、信息收集不充分,就会直接拖累最终的诊断判断。
四种问诊策略之间的差异也很明显。总体来看,APA引导加检索增强策略的综合诊断得分(Clf-Ovl)在大多数模型上都优于其他三种策略,比纯APA引导策略平均提升了约5个百分点,说明在问诊过程中引入临床指南的实时检索确实有助于提升诊断精准度。而且,研究团队使用真实临床数据(而非AI模拟患者)进行了同样的动态评测,发现整体诊断准确率反而更高——二分类最高达91.2%,十二分类最高达47.0%。这很可能是因为真实临床案例的症状表现更为典型,而AI模拟患者的回应尽管逼真,但在某些细节上仍与真实患者有所差异。
值得关注的是,问诊质量评分与诊断准确率之间的相关性并不高,皮尔逊相关系数约为0.43。换句话说,一个AI医生"问得好"和"诊断对"是两件相对独立的事情,不能简单地用前者推断后者。这个发现提示:在训练和优化AI精神科助手时,问诊能力和诊断推理能力需要分开来针对性地提升,而不能寄希望于"只要问诊问得像样,诊断自然就准"。
七、AI患者的考核——谁演得最像真实患者
研究团队还对患者智能体本身的质量进行了系统评估,评分维度包括六个方面:信息准确性(回答是否符合病历背景)、诚实性(是否如实作答,不夸大或捏造)、简洁性(是否简短而非长篇大论)、主动性(是否自然地主动透露部分信息)、克制性(是否保持情感上的真实克制,而非过度表现)和语言润色(语言是否自然口语化)。所有维度采用1到5分制打分,评分由三个AI评判模型(Gemma-3-27B、GPT-OSS-20B和Qwen3-30B-A3B)构成的评审团进行,三者取均值,对缺失评分使用中位数插补。
改进后的灵犀患者在所有行为真实性维度上都大幅优于此前研究中使用的MDD-5K患者智能体。以Qwen3-32B为骨干模型的灵犀患者综合得分达到4.67分,而相同骨干下MDD-5K患者的得分仅为3.05分,差距相当显著。有趣的是,灵犀患者的最高综合得分(4.67)甚至略超过了真实临床数据的基准得分(4.30)。研究团队分析,真实临床数据之所以没有拿满分,可能是因为录音中的实际对话和医生后来填写的电子病历之间存在偶尔的不一致——毕竟人工填写总有疏漏。
在不同骨干模型中,大体呈现出模型规模越大、真实感越强的规律,但也有例外——Grok-4.1-Fast和Qwen3-4B在准确性维度上出现了较大的方差,说明这两个模型的角色扮演稳定性相对较弱。Qwen3系列中较小的模型(1.7B、8B、32B)反而在大多数维度上表现非常稳定,Qwen3-8B(4.64分)和Qwen3-1.7B(4.65分)与Qwen3-32B(4.67分)差距极小,说明在精心的提示词工程加持下,较小的模型也能胜任高质量患者模拟任务。
研究团队还邀请了两位执照精神科医生对64份对话样本进行人工评分,结果与AI评审团的判断高度一致:灵犀患者在所有六个患者维度上都显著优于MDD-5K患者(统计显著性p<0.001,效应量r=0.547);在医生策略排名上,AI评审团与人类精神科医生的肯德尔一致性系数高达0.90,斯皮尔曼相关系数为0.80,83.3%的两两比较方向一致。这说明,用AI评审团代替人类专家进行大规模评测,在这个场景下是可信的。
八、合成数据真的有用吗——迁移学习的实证检验
有人可能会怀疑:这些合成数据毕竟是AI生成的,用它来训练或评测AI,会不会只是"用镜子照镜子",看起来效果好,实际上并没有真正学到有用的东西?
研究团队用一个实验回答了这个问题。他们用LoRA(一种参数高效微调技术,类似于给模型装了一个轻量级的"知识插件"而不必重写整个模型)对Qwen3-8B和Qwen3-32B在合成训练集上进行微调,然后分别在合成测试集和真实临床测试集上评测。如果合成数据只是"镜子",那么在真实数据上的提升应该很有限。
结果却令人信服:Qwen3-8B在真实临床数据上的十二分类精确准确率从4.1%跃升至41.4%,足足提升了37.3个百分点;Qwen3-32B从20.4%提升至39.7%,提升了19.3个百分点。综合分类得分(Clf-Ovl)在真实数据上分别从0.529和0.548提升至0.553和0.558。这充分说明,合成数据不只是表面上和真实数据像,而是确实编码了有临床价值的医疗知识,用它训练出来的模型能够真正泛化到真实的精神科门诊场景。
说到底,灵犀诊断基准这项工作揭示了一幅既令人鼓舞、又需保持清醒的图景。一方面,当前最先进的大语言模型在区分抑郁和焦虑这两种最常见的精神疾病上已经展现出了相当高的水平,最高准确率超过九成;另一方面,一旦遇到共病(同时患两种及以上疾病)识别或者需要在十多种疾病之间做精细区分的场景,AI的表现就会大幅下滑,差强人意。动态问诊比静态判断更难,会问问题和会做诊断是两种需要分别培养的能力,强大的闲聊能力并不直接等于精准的诊断能力。
这些发现对于未来的AI精神科助手研究者来说,提供了非常清晰的路线图:需要专门提升模型对共病模式的识别能力;需要针对动态问诊过程单独优化信息采集策略;不能只靠做大模型规模就期望诊断准确率自然提升,问诊和诊断这两条腿都得练。
当然,这套系统目前还有局限。数据来自上海一家医院,以中文为主,在文化和语言层面未必能完全推广到其他国家和语言环境,尽管框架本身在技术上是语言无关的。此外,评测覆盖的是初诊阶段,治疗方案制定、随访管理这些同样重要的临床环节还没有被纳入考量,这将是未来研究的方向。
研究团队已经将灵犀诊断-16K数据集和完整评测代码开源,任何感兴趣的研究者都可以在此基础上继续探索。如果你想深入了解这项研究的所有技术细节,可以通过DOI 10.1145/3770855.3817539查阅完整论文原文。
Q&A
Q1:灵犀诊断-16K数据集是怎么保护真实患者隐私的?
A:灵犀诊断-16K中的所有对话都是AI根据真实数据的统计规律生成的合成数据,并不包含任何真实患者的原始信息。真实患者数据在收集时已经过严格匿名化处理,去除了姓名、身份证号、联系方式等全部个人标识符,整个研究方案也经过了上海精神卫生中心伦理委员会审批。两位执照精神科医生对合成数据集中的样本进行了抽检,确认没有任何受保护的健康信息被保留。
Q2:大语言模型在精神科诊断上目前最大的短板是什么?
A:根据灵犀诊断基准的测评结果,当前大语言模型最明显的短板有两个。一是共病识别能力薄弱,当患者同时患有抑郁和焦虑时,AI的准确率会从九成左右骤降至四成多。二是动态问诊能力与诊断推理能力的脱节,一个AI"问诊问得像样"并不能保证它"诊断做得准确",两者相关性仅约0.43,说明需要分别针对性地训练这两种能力。
Q3:灵犀诊断基准能用于训练真正的临床AI系统吗?
A:灵犀诊断基准目前定位是研究评测工具,而非直接可部署的临床系统。研究团队明确强调,基于这套数据训练的AI系统应当作为辅助工具来增强医生判断,而不是替代专业临床决策。在真正进入临床应用之前,还需要经过严格的临床验证、监管审批和人工监督。不过,交叉验证实验已经证明,合成数据训练出的模型能够泛化到真实临床数据,具备作为训练资源的实际价值。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。