
这项由新西兰奥克兰大学、美国宾夕法尼亚大学、斯坦福大学及哈尔滨工业大学(深圳)联合完成的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.09936,有兴趣深入了解的读者可通过该编号查询完整论文。
**城市的"体检报告"为什么需要AI来写**
每当你走进一家购物中心,掏出手机拍下那道让你眼前一亮的旋转楼梯,或者在某个广场的喷泉前留下一张合影,然后发到微博——你大概没意识到,这个举动本身就在悄悄"投票"。你选择拍什么、分享什么,代表着你认为这个地方值得被记录,也就是说,这个地方对你有吸引力。
城市规划师和建筑学家早就知道,一个公共空间是否"成功",关键不在于它有多漂亮,而在于它是否真的吸引人来、留人住。问题在于,传统的调研方式——派人去现场数人头、发问卷、做访谈——既昂贵又费时,而且只能覆盖很小的范围。一个研究团队不可能同时守在北京三里屯、成都太古里和上海新天地,一边数人头一边记录感受。
然而,每天有数以百万计的用户自发地在微博上打卡、发图、写下感受。这些图片不是任何机构安排拍摄的,完全是用户的主动选择。某个地方被拍的次数越多,恰恰说明它对人的吸引力越强。这就是社会科学里所说的"显示性偏好数据"——不是问你喜不喜欢,而是看你的实际行动说明了什么。
面对这座庞大的数据金矿,研究团队发现了一个令人沮丧的现实:没有任何一个现成的工具或数据集,能让AI从这些社交媒体图片里,真正理解城市空间的社会含义。现有的AI视觉数据集,要么只会识别"这是一家购物中心",却无法区分这家购物中心里到底有没有人在活动;要么只能处理图片,完全忽略了用户发帖时写的那段文字;要么只覆盖街道外景,完全不管室内。更要命的是,研究者们想用不同的工具做不同的任务时,必须自己动手把七八套不同的数据集拼在一起,每套数据集的标签体系都不一样,拼出来的结果根本无法横向比较。
正是为了填补这个空缺,研究团队历时两年多,构建了Urban-ImageNet——一个专门为城市空间感知设计的、迄今为止规模最大的多模态数据集与评测平台。
**一、两百万张照片背后的数据工程**
要理解Urban-ImageNet的规模,可以用一个具体的场景来感受。假设你是一位城市研究者,你的目标是研究中国各大城市商业区的活力变化。你需要收集足够多的图片,覆盖不同城市、不同类型的商业空间、不同的时间段,还要配上用户当时写的文字描述。
研究团队做的,正是这件事的超大规模版本。他们编写了一套自动化爬虫程序,专门在新浪微博上,根据特定地点的话题标签(hashtag)来抓取内容。之所以选择话题标签而非GPS定位或关键词搜索,是因为微博的地点话题标签和真实物理地点之间的对应关系非常紧密——搜索"#成都太古里#"得到的内容,几乎可以确定是真的在太古里拍的或写的,偏差极小。
最终,爬虫在61个城市商业地标,跨越2019年至2025年共七年时间,抓取了超过两百万条公开帖子,每条帖子最多包含9张图片和一段用户原创文字,原始数据体积超过4TB。这61个地点分布在24座城市,横跨华东、华南、华北、西南、东北、西北、中部和中原八大区域,既有北京、上海这样的一线城市,也有昆明、贵阳这样的二三线城市,既有完全封闭的室内购物中心,也有开放式的步行街区。
原始数据当然不能直接使用。研究团队对数据进行了四道清洗工序。第一道是去重——用一种叫做"感知哈希"的技术,把拍摄内容高度相似的图片识别出来并剔除,就像把一沓照片里几乎一模一样的重复快照挑出来扔掉。第二道是过滤掉分辨率太低(小于256×256像素)的模糊图片。第三道是用一个专门训练过的分类器过滤掉不适合公开展示的内容。第四道是识别并去除那些系统性重复发布的商业广告帖子——因为这些不是真实用户的自发分享,而是品牌方的营销操作,混进来会污染数据的真实性。
隐私保护是这个数据集格外重视的环节。所有用户名都被替换成随机数字编号,任何能追溯到具体账号的信息都被抹去。更进一步,所有图片都经过了自动化的人脸检测、车牌识别和二维码识别,凡是检测到的区域一律模糊处理,并经过人工抽样复核以确保效果。公开发布的图片分辨率被限制在最长边512像素,这大幅降低了通过图片细节来反向识别具体个人的可能性。那份原始的4TB高清数据,只由研究团队安全保存,不会对外分发。
为了满足不同规模的研究需求,数据集提供了四个版本:1K版本(每类100张,共1000张),10K版本(每类1000张),100K版本(每类10000张,总计约6.15GB),以及完整的2M全量语料库。前三个版本是严格平衡的,每个类别的样本数完全相同,适合做公平的模型对比评测;全量版本则保留了真实的类别不均衡分布,反映现实中不同类型图片的自然比例,适合做大规模预训练。
**二、给城市图片贴上"懂城市"的标签**
收集到数据只是第一步,更难的问题是:怎么给这些图片贴上对城市研究真正有意义的标签?
现有的图片数据集,比如Places365,会告诉你一张图片拍的是"购物中心"还是"广场",但这对城市研究者来说远远不够。一个购物中心,有可能人声鼎沸、活力四射,也有可能空空荡荡、毫无生气——这两种状态在城市规划角度具有根本性的不同意义,但Places365的标签系统根本无法区分。更大的问题是,Places365的分类体系是靠数网络图片的频率统计出来的,谁在网上出现得多,谁就成为一个类别,而不是根据城市研究的理论需求来设计的。
研究团队为此专门开发了一套叫做HUSIC的分类框架——Hierarchical Urban Space Image Classification,直译是"分层城市空间图像分类"框架。这个框架最重要的特点,是它不是凭空发明的,而是从三位在城市研究领域影响深远的学者的理论中直接推导出来的。
第一位是法国哲学家亨利·列斐伏尔。他提出,城市空间存在两个维度:一个是"构想的空间",也就是设计师画图纸时想象的空间;另一个是"生活的空间",也就是真实的人在其中活动时创造出来的空间。一个广场,设计师可能设想它是市民聚集的地方,但如果实际上没有人去,它就只是"构想"而非"生活"。这个区分,直接催生了HUSIC框架中最核心的一个维度:同一个空间类型,"有人"和"没人"是两个完全不同的标签。
第二位是丹麦建筑师扬·盖尔。他研究了数十年公共空间中的人类行为,发现社会活动(人和人之间的互动)既是衡量公共空间成功与否的指标,也是吸引更多人来的原因——好的公共空间形成正向循环。这个洞察进一步强化了为什么"激活的"和"未激活的"空间必须分开标注。
第三位是美国城市规划师奥斯卡·纽曼。他提出了"可防御空间"理论,认为城市环境应该按照从公共到私密的梯度来理解。这为HUSIC框架提供了空间层级的骨架:最公开的室外广场、半公开的商业室内、酒店等过渡性空间、以及私人住宅室内,构成了一条清晰的公私梯度线。
在这三种理论的指引下,HUSIC最终定义了10个类别。在空间类相关的类别中,室外有人的城市空间和室外无人的城市空间分别独立成类,前者捕捉的是"广场上熙熙攘攘的人群"这样的激活状态,后者捕捉的是"建筑立面、景观设计"这样的纯空间状态。室内商业空间同样一分为二:室内有人的城市空间与室内无人的城市空间。住宿类空间也分为商业住宿(酒店客房等)和私人住宅室内两类。非空间类内容则包括食物饮品图片、零售商品与陈设图片、以人物为中心的肖像照片,以及其他非空间内容(广告、截图、二维码等)。这最后一类的作用格外关键——它是一个"噪音过滤器",让研究者能够把真正反映城市空间的内容从社交媒体的海量噪音中筛选出来。
10万张图片的核心标注工作,由三名经过系统培训的研究人员手工完成。为了确保标注质量,他们专门挑出3000张图片做双重标注,计算出的科恩卡帕系数(κ)为0.87。这个数字可以用一个类比来理解:假设两位裁判在给体操动作打分,他们的评分如果高度一致,κ值就接近1;如果完全随机,κ值接近0。0.87意味着这两位标注员几乎总是意见一致,学术界通常把这个级别称为"几近完美的一致性"。
**三、三项考试,检验AI是否真的"懂"城市**
Urban-ImageNet不是一个简单的图片库,而是一个配套了完整评测体系的研究平台,叫做Urban-ImageNet-lib。这套平台为AI模型设计了三种不同类型的"考试",分别考察不同层面的城市空间理解能力。
第一种考试,是城市场景语义分类(T1)。给AI看一张图片,让它判断这张图片属于10个HUSIC类别中的哪一个。这是最基础的能力考察,相当于问AI:"这张照片拍的是什么类型的城市空间?"
第二种考试,是跨模态图文检索(T2)。这类考试又分为两种子情境。第一种子情境是"类别级检索"——给AI一段描述,比如"这是一张室外有人的城市空间照片",让它从一堆图片里找出所有匹配的照片。第二种子情境更接近真实使用场景,也更有挑战性——给AI一条真实的微博原文,让它从图片库里找出这条微博配的那张(或几张)照片,反之亦然。这个考试考察的是AI能不能理解图片和人们用来描述它的自然语言之间的关系。
第三种考试,是实例分割(T3)。这是计算机视觉领域最细粒度的任务:不只是告诉AI图里有什么,还要让它在图里把每一个独立的物体"圈"出来,精确到像素级别。一张购物中心内部的图片,AI需要能圈出里面每一个人、每一部扶梯、每一个货架陈列。
为了生成实例分割的标注数据,研究团队采用了一套半自动化流程。他们为10个HUSIC类别各准备了16到20个与该类别最相关的物体词汇,然后用一个开放词汇目标检测模型(Grounding DINO)来找出图片里对应的物体位置,再用另一个先进的图像分割模型(SAM 2)来生成精确的像素级轮廓。训练用的伪标注,要求检测置信度高于0.35且分割质量指标高于0.80;用于最终评测的子集,则采用了更严苛的阈值(0.50和0.88),并经过人工审核,确保作为"标准答案"的可靠性。
**四、AI模型的成绩单:有人轻松拿高分,有人惨遭滑铁卢**
研究团队邀请了一批主流AI模型来参加这三项考试,结果相当耐人寻味。
在第一项图片分类考试中,来自谷歌的EfficientNet-B4模型表现最佳,以84.9%的总体准确率和84.9的宏平均F1分数(这个指标可以理解为对每个类别分别评分后取平均,避免某个类别的好成绩掩盖其他类别的差成绩)拿下第一。ResNet系列和视觉Transformer类的模型(ViT-B/16、DeiT-B)表现接近,大约在79%到80%的准确率区间。
最戏剧性的对比出现在CLIP模型身上。CLIP是OpenAI开发的一种图文对齐模型,它在通用场景下通常表现很强。然而当研究团队直接用它来做零样本分类(也就是不给它看任何Urban-ImageNet的训练数据,直接让它用10个HUSIC类别名称来判断图片)时,它的准确率只有37.9%——在一个10类分类任务里,随机猜的基准是10%,37.9%看起来似乎还不错,但相比其他经过训练的模型差了将近一半。原因很明显:HUSIC的类别名称,比如"未激活的室外城市空间"或"室内有人的城市空间",在CLIP的预训练数据里几乎从未出现过,CLIP没有机会学到这些概念的含义。经过在Urban-ImageNet上微调之后,CLIP的准确率提升到69.1%,但依然低于最佳的纯视觉分类模型。
从逐类表现来看,最难区分的类别是"室内无人的城市空间"——这在几乎所有模型身上都是得分最低的类别之一。仔细想想也合理:一张没有人的商场走廊和一张没有人的酒店走廊,视觉上可能非常相似,AI要区分它们,必须注意到装修风格、家具类型等极为细微的差异。同样的道理,"有人的室外空间"和"无人的室外空间"之间,唯一的区别就是有没有人出现,AI如果只依赖场景的整体外观而不注意人的存在与否,就很容易出错。
第二项图文检索考试的结果,呈现出鲜明的两极分化。当文本查询是HUSIC类别名称("类别级检索")时,经过微调的BLIP和CLIP模型表现非常出色,BLIP达到了94.2%的R@1(意思是:给出一个类别名称,从所有测试图片里找到的第一张,有94.2%的概率确实属于这个类别),CLIP也达到了92.7%。
然而,当查询变成真实的微博原文时,情况急转直下。微调后的CLIP,R@1只有8.1%——表面上看数字不大,但考虑到随机猜测的基准只有约0.1%,8.1%实际上已经是随机基准的76倍,是这个任务上所有模型里最好的结果了。即便如此,8.1%意味着近九成的时候,AI找到的第一张图片都不是对应那条微博的那张。这个结果真实反映了问题的本质难度:微博用户写帖子的目的是表达情绪和分享体验,不是描述图片内容;一句"周末来这里打卡了!好美好美"和配套的三张图片之间,几乎没有任何直接的语义对应关系。研究团队把这个结果定性为"一个真实的开放性难题",为未来专门针对中文城市社交媒体的图文模型指出了明确的研究方向。
把HUSIC类别信息拼接到微博原文后面一起用作查询("Post + label"配置),能把R@1提升到9.3%、R@10提升到32.3%,成为所有配置中的最高分。这个结果说明,元数据信息对于提升检索质量有实质性帮助,但即使有了额外的语义辅助,精确匹配仍然是个难题。
第三项实例分割考试,展示了一个特别实用的发现。研究团队分别测试了两种经典的实例分割模型:Mask R-CNN和Cascade Mask R-CNN,以及它们与SAM(Segment Anything Model,Meta开发的通用分割模型)结合使用的版本。在标准AP(平均精度)指标上,单独使用Cascade Mask R-CNN得到0.290,单独使用Mask R-CNN得到0.267。
关键的惊喜来自SAM的加持。研究团队不对SAM做任何专门的微调或训练,只是把Mask R-CNN或Cascade Mask R-CNN检测出来的物体边框坐标,当作"提示"输入给SAM,让SAM在这些边框范围内生成更精确的像素级轮廓。这个操作零额外训练成本,但效果显著:Mask R-CNN+SAM的AP提升到0.373,相对提升40%;Cascade+SAM的AP提升到0.369,相对提升27%。这意味着,仅仅是把一个现成的通用分割模型接在现有检测器后面做"精修",就能得到大幅度的免费性能提升——这对实际工程应用来说是个非常有价值的发现。
为了给未来的研究设定一个理论上限,研究团队还测试了"GT-box SAM Oracle"——直接把人工标注的精确边框给SAM用,让它只需要做轮廓精修而不需要做定位。这个理想状态下,AP达到0.749,远高于任何可训练模型的结果,清楚地表明:制约当前模型表现的主要瓶颈,在于精确定位目标物体的位置,而非描绘其轮廓的形状。
**五、数据越多,AI越聪明——但增长有规律**
研究团队还做了一个很有意思的规模化实验:用同一批模型,分别在1K、10K和100K三个数据规模的训练集上训练,然后都在同一份10K测试集上评测,观察性能如何随数据量变化。
结果呈现出一个清晰的规律。以ResNet-50为例,从1K训练到10K,准确率从66.5%跳升到78.1%,足足提高了11.6个百分点;而从10K到100K,准确率从78.1%提升到83.5%,只提高了5.4个百分点。数据量增加了10倍,但带来的提升却只有前一个10倍的一半左右。这与学术界通常描述的"规模化法则"完全吻合:数据量越大,每新增一倍数据带来的边际收益越小。
LLaVA-1.5,一种融合了大型语言模型能力的视觉问答模型,在小数据量(1K)情况下表现出明显优势,以76.8%的准确率超过了所有其他模型。这反映的是它庞大的语言预训练带来的强大先验知识——即使训练数据很少,它也能凭借已有的"语言理解直觉"做出相对准确的判断。然而,这种优势随着数据量增大而逐渐收窄,并且它面临一个严重的实际问题:计算成本极高,每张图片的推理时间大约是ResNet-50的3200倍。在10K规模的训练集上,LLaVA-1.5需要的训练时间超过3小时,而100K规模的训练被估算需要超过150个GPU小时,远超资源限制,最终未能完成。
在HUSIC分层结构上的实验也证实了这套分类框架的设计合理性。同样的模型,在判断"这张图片是不是空间相关内容"这个粗粒度问题上,准确率高达约94%;在判断"这是室外还是室内"这个中等粒度问题上,准确率约为95%;而在完整的10类分类任务上,准确率降至83%到85%。这说明HUSIC的10个类别确实捕捉到了有意义的语义层级——类别之间有真实的区分度,但也存在合理的难度梯度,不是随意设计的。
**六、这套工具箱让研究者不再"自己造轮子"**
Urban-ImageNet项目的另一个重要贡献,是配套了一个开箱即用的标准化评测库——Urban-ImageNet-lib。在这个领域做研究的人都知道,即使有了数据,为每个模型、每个任务单独搭建训练框架、写评测脚本,本身就是一项耗费大量时间和精力的工程工作,而且不同研究者各自搭建的框架,细节差异会导致结果无法比较。
Urban-ImageNet-lib的设计目标就是消除这个障碍。它在一套统一的接口下,支持三种任务(分类、检索、分割);内置了所有评测指标的标准计算逻辑;支持跨数据集的横向比较(附带了Places365、MS-COCO和Cityscapes的适配器,让研究者能直接看Urban-ImageNet上的结果和这些通用基准上的结果之间的差距);并提供了固定的随机种子和可复现的训练流程,让不同时间、不同研究者做的实验可以直接对比。对于想在这个领域展开研究的团队来说,这等于省掉了数周的基础工程搭建工作。
**一项工作,牵出城市研究的未来**
说到底,Urban-ImageNet做的这件事,是在尝试弥合一个已经存在很久的鸿沟:城市研究者有丰富的理论框架来理解城市空间,AI研究者有强大的工具来处理图像和文本,但两者之间缺少一座桥梁——一套能让AI"看懂"城市空间的理论化语言,以及一个能让研究者公平评估不同AI工具的标准化平台。
这项工作最值得关注的发现是:图片分类这件事,AI已经做得相当不错(最高85%的准确率),尽管"有人还是没人"这类依赖细节的判断仍然是难点;但跨模态检索,尤其是把真实社交媒体文字和对应图片匹配起来,目前仍然是一个远未解决的问题,最好的模型也只有8%的精确匹配率,说明AI距离真正理解人类在社交媒体上描述空间体验的方式,还有很长的路要走。另外,SAM这类通用基础模型的后处理接入,能以几乎零额外成本带来实质性的分割精度提升,这个工程发现对实际系统构建很有参考价值。
这项研究最终指向一个具体的未来:当AI真正能从社交媒体图片中读懂城市空间的活力状态,城市规划者就有可能用一种前所未有的方式监测城市生活的脉搏——不是每年发一次调查问卷,而是近乎实时地感知哪些公共空间正在繁荣,哪些正在凋落,为城市更新和规划决策提供比传统手段细腻得多的依据。至于这条路还有多远,Urban-ImageNet给出的,是一个诚实的现状评估,和一套可以出发的基础工具。有兴趣深入研究这一方向的读者,可以通过arXiv:2605.09936查阅完整论文,也可以访问论文中提供的Hugging Face数据集页面和GitHub代码库,直接动手探索。
Q&A
Q1:Urban-ImageNet数据集和Places365这类常见图像数据集有什么本质区别?
A:Places365的分类体系是根据网络图片出现频率统计出来的,不区分空间是否有人使用;Urban-ImageNet则基于城市规划理论,专门区分了"有人激活"和"无人空置"的同类空间,并且包含用户发帖时的原始文字,同时覆盖室内外多种城市空间类型,可以同时支持分类、图文检索、实例分割三类任务。
Q2:HUSIC框架里"有人"和"没人"的区分,对城市研究有什么实际用处?
A:一个广场或商场,外观可能完全相同,但有没有真实用户在其中活动,在城市规划角度具有根本性差异。区分"激活"和"未激活"的空间,可以让研究者用社交媒体数据来衡量一个商业区的真实活力,而不只是看它的建筑设计,这对空间改造优先级判断和商业选址分析都有直接意义。
Q3:为什么微博原文和配套图片的匹配准确率这么低,只有8%?
A:因为微博用户写帖子是为了表达情绪和分享体验,不是为了描述图片内容。一条"今天来打卡了好美"配三张照片,文字和图片之间几乎没有直接语义对应。加上现有的CLIP、BLIP等模型主要用英文数据预训练,处理中文口语化表达时存在额外的语言障碍,这些因素叠加在一起,使得精确匹配成为一个目前远未解决的开放性难题。
好文章,需要你的鼓励
这项研究系统比较了四种AI图像分词策略在640000张星系图像上的表现,发现重建质量与物理属性预测能力之间存在根本性解耦,为天文基础模型的分词器选择提供了实验依据。
阿里Qwen团队研究如何将大模型的规模化训练思路迁移到机器人操作领域,通过统一多机器人表示与38100小时数据预训练,让机器人在陌生场景和陌生机型上也能完成复杂操作任务。
MemoBench是哈佛大学等机构联合推出的视频生成评测基准,专测AI在物体消失再重现场景下的记忆能力,揭示了当前所有主流模型的核心盲区。
研究发现AI代码修复工具默认的"写代码→跑测试→再改"流程中,禁止运行测试几乎不影响修复成功率,却能节省超过一半的时间和费用。