微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 北京大学、北京交通大学联手打造"古希腊陶器智能讲解员",博物馆导览从此不再胡说八道

北京大学、北京交通大学联手打造"古希腊陶器智能讲解员",博物馆导览从此不再胡说八道

2026-07-22 17:40
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-22 17:40 科技行者

这项由北京大学、北京交通大学、华中科技大学、拉筹伯大学及中国科学院大学联合完成的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.06374,提交至IEEE模式分析与机器智能汇刊(IEEE Transactions on Pattern Analysis and Machine Intelligence)审核。

一、博物馆里的"嘴硬导游"问题

走进一家博物馆,你指着一只古希腊陶罐问导游:"这是谁画的?画的什么故事?大概是哪个年代的作品?"一个优秀的导游会告诉你他知道的,同时坦诚地说:"关于这位画家的身份,学术界目前还有争议,我没有足够把握给你一个确切答案。"然而,一个糟糕的导游会不管三七二十一,流利地给你编造一套听起来头头是道却毫无根据的解释——还一副胸有成竹的模样。

数字博物馆里的AI助手,恰恰经常扮演那个糟糕导游的角色。近年来,视觉语言模型(可以同时"看图"和"说话"的人工智能,简称VLM)的进步让在线博物馆能够为观众提供自然语言交互,用户可以用普通话向AI提问,AI会根据展品图片给出解释。这本是一件好事,但问题随之而来:当AI不知道答案时,它往往不会承认不知道,而是继续侃侃而谈,给出那些听起来专业、实际上完全站不住脚的回答,甚至还会贴上根本无法访问的参考链接。这种现象在技术圈有个名字,叫"幻觉"——AI凭空捏造了不存在的事实。

古希腊陶器是一个格外考验这类系统的领域。解读一只古希腊彩绘陶罐,光靠"看"是不够的。你需要了解器形(这是双耳细颈瓶还是宽口酒壶)、绘画技法(黑绘式还是红绘式)、画面上的神话场景(赫拉克勒斯的哪段功绩?是宙斯还是阿波罗?)、考古背景,还有艺术史上关于画家归属的种种争论。这些知识大多散落在学术数据库和博物馆馆藏记录中,并非AI在训练时能充分学到的内容。于是,面对这类专业问题,AI要么给出错误答案,要么以假乱真地编造答案。

研究团队在这样的背景下提出了VaseMuseum系统,目标是打造一个"既能看懂文物、又能诚实作答"的数字博物馆智能导览框架。

二、从"看图说话"到"查证后再说话"

VaseMuseum是一套完整的互动式数字博物馆解决方案,其核心由两部分组成。第一部分是虚拟博物馆展示界面,用户可以在其中浏览古希腊陶器的高清图片乃至三维模型,就像在网页上逛博物馆一样,可以自由选择展品、放大细节、提出问题。第二部分是VaseAgent,也就是那个负责回答问题的"智能导览员"。

这套系统的研发并非从零出发。研究团队此前已经建立了VaseVQA和VaseVQA-3D两个专门针对古希腊陶器的视觉问答数据集和评测基准,证明了专门针对该领域进行优化能够显著提升AI对陶器的结构性理解。然而,那些早期工作更像是在一个封闭的考场里做选择题,而现实中的博物馆对话更像是开卷考试,用户会问各种千奇百怪的问题,答案质量参差不齐,AI必须学会在不确定时说"我不确定"。VaseMuseum正是为了弥合这一差距而生。

当用户对着一只陶罐提问时,VaseAgent会按照一套精心设计的流程处理这个问题。首先,它会像一位训练有素的鉴赏家一样,仔细分析陶器的视觉特征,包括器形轮廓、绘画风格、画面人物、场景构图和图像母题等。这些视觉线索能够回答一部分问题,比如"这是什么形状的器物"或者"画面上有几个人物"。但对于那些需要历史背景和学术知识才能回答的问题,仅凭肉眼观察是不够的。此时,VaseAgent会切换模式,主动去外部权威来源查找证据。

查找证据的过程并非简单地"谷歌一下"。VaseAgent采用了一种被称为"深度研究"式的迭代检索机制。它会把用户的问题拆解成若干个具体的检索意图,向网络上的学术资源和博物馆数据库发起查询,处理返回的内容,然后根据初步结果判断是否需要进一步查找——如果第一轮结果太模糊或与具体展品关联不强,就会调整搜索策略再试一次。这个过程有点像一位认真的研究生在图书馆查资料:不满足于第一本找到的书,而是顺着线索一路追查,直到积累了足够可靠的证据。

三、证据的"质检员":过滤掉那些不可信的来源

然而,在互联网上查资料有一个众所周知的风险:你会找到大量质量参差不齐的内容。有些链接根本打不开,有些页面内容与问题毫不相关,有些来源虽然听起来权威却充斥着错误,还有些不同来源给出了互相矛盾的说法。如果AI把这些乱七八糟的内容不加筛选地吞进去,最后给出的答案可能比不查资料还要糟糕。

为了解决这个问题,VaseMuseum在检索环节加入了一个"来源控制"层,专门负责对搜索结果进行质量把关。这个质检机制分几道工序进行。

第一道工序是"可用性验证"。系统会检查每一条搜索结果:这个链接能不能正常访问?页面上的文字内容是否足够丰富、具备实质意义?通过计算一个综合分数来判断,只有同时满足"链接可访问"和"内容足够充实"两个条件的结果才会进入下一环节。

通过第一道筛选的结果,会进入第二道"质量与相关性评分"。系统会评估这条结果与用户问题的关联程度、来源网站的可信度,以及内容的丰富程度,三者加权得出一个综合预评分,低于门槛的结果会被淘汰。

通过了前两道筛选的结果,还要接受第三道"去冗余选择"。如果留下的结果中有很多内容高度重复——比如同一段文字被多个网站转载——系统会采用一种叫"最大边际相关性"的方法,优先保留那些内容不重复且来自不同域名的结果,最终筛选出不超过5条最有价值的证据,形成一个精炼的证据库。

这整个过程就像一位严格的图书馆员在为你整理参考资料:先检查每本书有没有缺页,再判断每本书与你的课题是否真的相关,最后从选出的书里去掉重复内容,确保每本书都能带来独特的信息增量。

四、答案的"核查员":出口时再把一道关

证据库建好了,AI会据此生成一个初步答案。但故事还没结束——在答案返回给用户之前,还要经过"回答控制"层的审核。这个环节的任务,是检查AI给出的每一个具体说法是否都能在证据库中找到支撑。

具体的操作方式是这样的:系统会把用户的问题和AI的初步答案分解成若干个独立的"声明单元",比如"这只陶罐属于黑绘风格"是一个声明,"描绘的是赫拉克勒斯的劳役"是另一个声明。然后,系统会对照证据库中的每一条证据,检查这个声明在证据中是否有对应的文字支持。

与此同时,系统还会检测证据之间是否存在矛盾。古希腊艺术研究领域经常出现这种情况:不同学者对同一件陶器的断代或画家归属有不同意见,两个博物馆馆藏记录给出了不一样的解读。当系统检测到证据之间存在高度相似但结论相互矛盾的情况时,会把这个"冲突信号"记录下来,降低整体答案的可信度评分。

最终,系统会综合计算一个"置信度分数",这个分数综合考虑了有多大比例的声明得到了证据支持、有多少声明获得了多个独立来源的支撑、证据库是否非空,以及检测到了多少对矛盾冲突。如果置信度低于一个预设的门槛,VaseAgent会自动切换到"谨慎模式",在回答前加上一段说明,指出哪些方面证据不足或存在争议,用更加中立、留有余地的措辞来表达,而不是继续以确定无疑的口吻胡说。

五、"候选答案赛马":不需要重新训练就能更聪明

除了上述的单次问答流程,VaseMuseum还设计了一个可选的增强机制,灵感来源于强化学习领域的GRPO算法(群体相对策略优化)。这个机制的核心思想是:与其只生成一个答案,不如让AI同时生成多个候选答案,再从中挑选最好的那个。

具体来说,系统会以不同的随机种子运行4次完整的检索和回答流程,得到4个候选答案。这4个候选答案在引用链接的有效性、证据覆盖的充分性、面对不确定证据时的中立程度,以及对矛盾信息的处理方式等方面,往往会有所不同。系统根据这些维度给每个候选打分,选出综合表现最好的那个作为最终答案。

这个"赛马机制"有一个关键的特性:它完全不需要修改或重新训练底层的语言模型。现有的模型保持原样,只是在生成答案之后多了一个裁判环节。这大大降低了应用门槛,因为训练大型语言模型需要消耗海量的计算资源和时间,而这套机制相当于用更少的代价换取了更可靠的输出。

实验发现,把候选答案数量从1增加到4,可靠性指标会有明显提升;但继续增加到8、12、16时,提升幅度越来越小,而计算耗时却大致按线性增长。因此,研究团队把默认候选数量定为4,在质量和效率之间找到了一个平衡点。

六、系统的"考场"和"考题"

为了检验VaseMuseum的实际表现,研究团队构建了一套专门的评测数据集。数据基础是VaseVQA-3D已收录的3000多张古希腊陶器图片及其结构化标注,包括材质、工艺、器形、年代、归属和装饰等信息。在此基础上,团队识别出518件在LIMC数据库(《古典神话图像志词典》,一部权威的古典神话图像学参考资料)中有明确记录的陶器,以这些记录为锚点,进一步关联了博物馆馆藏目录、古典图像志数据库等额外资源,为每件陶器补充了神话场景描述、考古背景、替代归属说法和文献引用等信息。

基于这套数据,研究团队设计了三类考题,模拟真实博物馆访客可能提出的不同类型问题。

第一类叫"纯视觉题",问题的答案完全可以从展品图片中直接观察得到,比如"这件陶器是什么形状"或者"画面中有哪些可见的场景元素"。这类问题测试AI的基础视觉感知能力。

第二类叫"视觉加知识题",问题需要结合视觉观察和外部历史知识才能回答,比如"这件陶器大约属于哪个年代"、"画面描绘的是什么神话故事"或者"这种器形在古希腊社会是用来做什么的"。这类问题最接近真实的博物馆问答场景。

第三类叫"模糊争议题",问题本身有意设计成存在多种合理解释的形式,或者涉及学术界尚无定论的内容。这类问题专门测试AI在证据不充分时能否避免过度自信、给出恰当的模糊答案,而不是武断地选择其中一种解释。

三类题各取100题,形成一个规模适中但场景覆盖全面的测试集,另外还有100道改写题用于调试提示词而不污染测试集。

七、实验结果:哪里进步了,哪里还有差距

研究团队用四个系统进行了对比测评:一是Qwen3-VL-8B(直接模式,也就是直接问直接答,没有网络搜索);二是Qwen3-VL-8B加搜索功能(会上网查资料,但没有可靠性控制);三是VaseAgent去掉GRPO机制的版本;四是VaseAgent完整版。

评测结果揭示了一个耐人寻味的规律。直接问答的AI在纯视觉题上表现还算过得去(答题准确率44%),因为这类问题本来就不需要上网查资料。然而,一旦给AI加上了搜索功能但不做任何质量控制,情况反而变糟糕了——纯视觉题的准确率掉到了20%,幻觉率(AI编造内容的比例)从54%飙升到79%。这个反直觉的结果说明,不加筛选的搜索结果会"污染"AI的判断,让它反而更容易犯错。

VaseMuseum最显著的优势体现在那些需要外部知识的问题上。在"视觉加知识题"中,完整版VaseAgent的幻觉率是所有方法中最低的(22%),groundedness分数(衡量答案有多少比例有证据支撑,简称"有据性"分数)是最高的(0.73),中立性评分也是最高的(3.75分,满分5分)。这三项指标共同说明,VaseAgent给出的答案不仅更少胡说,而且更多地建立在真实证据之上,在面对不确定情况时也更倾向于如实说"这件事我没有充分把握"。

在引用链接的有效率方面,对比更加鲜明。未加控制的搜索AI给出的外部链接只有不到29%是真正可以访问、且与答案相关的;加上来源控制层后,这个比例提升到44%;完整版VaseAgent进一步提升到60%。换句话说,大约有40%的链接还是无效的,但相比基线的70%无效,已经是相当可观的改进。

消融实验进一步拆解了每个模块的贡献。去掉来源控制模块,主要是引用链接的有效率大幅下滑;去掉回答控制模块,主要是中立性评分明显下降。这说明两个控制模块各有侧重、缺一不可:来源控制负责净化进入AI视野的证据,回答控制负责校正AI在输出端的表达方式,两者互相补充,分别堵住了"垃圾进、垃圾出"和"过度自信乱表态"这两个不同的漏洞。

另外,纯粹追求答题准确率的激进配置(把GRPO的奖励信号完全导向答题正确率)确实能把准确率提到59%,但代价是引用有效率跌回到29%、中立性评分掉回到2.91——几乎和没有可靠性控制的搜索AI一样差。这个对比清晰地说明了一个在博物馆场景下的核心权衡:如果只追求答对,AI会变得更加武断,反而在可靠性上全面倒退。

八、坦诚面对不足

研究团队在论文中坦率地讨论了几项尚未解决的问题。首先,整个系统的证据质量高度依赖于外部网络和博物馆数据库的覆盖范围、稳定性和准确性。对于那些考古记录极不完整、专门文献稀少的冷僻文物,系统能检索到的有用信息本来就很有限,再好的过滤机制也无法弥补原始来源的缺失。

其次,目前的系统只专注于古希腊陶器这一个类别,使用的也是英语和中文两种语言环境。如果要扩展到其他类型的文物,比如中国青铜器、埃及木乃伊棺椁或波斯地毯,需要针对那些领域的专业知识体系和数据来源重新进行调校,不能直接套用。

第三,引用链接有效率和中立性评分这两个关键指标,在定义上仍然存在一定的主观性,人工评分的标准难以在不同评测者之间保持完全一致,未来需要更大规模的专家评测和更清晰的评分标准来加强结论的可靠性。

研究团队认为,下一步的理想方向是将系统与机构级别的权威知识库深度对接,比如大英博物馆、卢浮宫、大都会博物馆等机构自己整理的结构化馆藏数据库,而不只是依赖公开网页的搜索结果。这样既能提升证据质量,又能让引用来源更容易被核实。

说到底,VaseMuseum想解决的问题,本质上是"AI说话不负责任"的老问题在博物馆场景下的具体表现。一个AI如果能对着一只古希腊陶罐滔滔不绝地讲出一套精彩故事,这本来是一件很酷的事情。但如果那些故事一半是捏造的,另一半是没有出处的,那它对观众的伤害可能比沉默更大——因为人们更容易相信一个说得头头是道的谎言,而不是一片空白。

VaseMuseum用的方法是在AI的"出口"和"进口"两端同时设卡。进口端(来源控制)负责过滤掉那些质量低劣、无法核实的证据,让AI只看到相对可靠的信息。出口端(回答控制)负责审查AI说出来的每一句话,确保有据说有据,无据则坦承无据,争议则说明争议。两道关卡叠加,再辅以候选答案赛马机制,形成了一套无需修改底层模型就能大幅提升可靠性的框架。

这个框架背后有一个对博物馆场景来说很重要的价值判断:在知识介绍领域,"说少一点但说对"的价值,高于"说多一点但说错"。一个保守的、承认不确定性的答案,在博物馆教育场景下比一个自信满满的错误答案要体面和有益得多。当然,目前60%的链接有效率还远不是令人满意的水平,三分之一的V+K题目仍然无法答对,说明这条路还很长。但作为一个不需要重新训练模型、仅靠推理时的控制机制就能实现的改进,这套思路提供了一个实用而有启发性的参考方向。

对这项研究感兴趣的读者,可以通过arXiv上的论文编号arXiv:2607.06374查阅完整论文,研究团队也开放了项目代码库和演示网站供进一步探索。

Q&A

Q1:VaseMuseum是做什么用的?

A:VaseMuseum是一套针对古希腊陶器的数字博物馆智能导览系统。用户可以在虚拟展厅里选中一件陶器,用自然语言提问,系统会结合陶器图像和从权威来源检索到的外部知识来回答问题,并且在证据不足时主动告知用户存在不确定性,避免AI编造内容。

Q2:VaseMuseum如何判断AI的回答靠不靠谱?

A:系统在回答生成前后各设了一道关卡。检索到资料后,"来源控制"层会检查每条搜索结果能不能访问、内容是否相关、来源是否可信,过滤掉低质量内容。AI生成初步答案后,"回答控制"层会把答案里的每个具体说法和证据库逐一比对,计算整体置信度,若证据不足则自动改用更谨慎的措辞作答。

Q3:VaseMuseum的训练免费GRPO机制是什么意思?

A:这是一种不修改AI模型本身就能提升答案质量的方法。系统会让AI同时独立生成4个候选答案(每次使用不同的随机设置),然后从引用有效性、证据覆盖、答案中立性等维度给每个候选打分,最终选出综合得分最高的那个作为输出,相当于在答案层面做了一次"赛马选优"。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-