微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 巴西联邦大学团队的停车场革命:不用贴标签,AI照样认得出哪个车位空着

巴西联邦大学团队的停车场革命:不用贴标签,AI照样认得出哪个车位空着

2026-06-26 11:52
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-26 11:52 科技行者

这项由巴西巴拉那联邦大学与巴拉那天主教大学联合开展的研究,已被2026年IEEE系统、人与控制论国际会议(SMC 2026)接收,论文预印本编号为arXiv:2606.20886,发布于2026年6月18日,最终正式版本将在IEEE Xplore数据库中公开。研究团队同时将训练好的模型和完整源代码发布在公开平台上,供外界复现与使用。

每天早上,无数开车上班的人都经历过这样一件烦心事:在停车场里一圈一圈地转,眼睛盯着每个角落,却不知道哪里还有空位。这种看起来微不足道的麻烦,放到整个城市的规模上,其实是一个让人头疼的大问题。研究表明,驾驶员在寻找停车位上花费的时间,会显著加剧城市交通拥堵,带来额外的燃油消耗,最终转化为更多的碳排放。随着城市持续扩张、人口密度不断攀升,这个问题只会越来越突出。

解决方案其实并不复杂:在停车场装上摄像头,让计算机自动判断每个车位是空的还是被占用的,然后把信息实时传递给驾驶员或者城市管理平台。这种技术被称为"基于视觉的停车位占用状态识别",听起来高大上,本质上就是让电脑看懂停车场里的照片。近年来,这一领域已经取得了不少进展,但有一道门槛始终横亘在实用化的道路上,那就是"打标签"的问题。

训练一个能识别停车位状态的人工智能,传统做法需要有人坐在电脑前,一张一张地看照片,然后标注哪个位置是空的、哪个是有车的。对于一个拥有数百个车位、全天候运行的停车场来说,这意味着海量的标注工作。更麻烦的是,在一个停车场训练好的模型,换到另一个环境往往会"水土不服"——不同的摄像头角度、光线条件、天气状况,都会让模型的判断准确率大幅下滑。这道坎让许多停车场管理系统的推广部署举步维艰。

正是在这样的背景下,巴西这支研究团队提出了一套全新的思路。他们的核心想法是:能不能让模型在目标停车场完全不需要任何人工标注的情况下,就能达到很高的识别准确率?答案是肯定的,而且效果相当不错。

一、训练AI的老问题:为什么每个新停车场都要"从头学"

要理解这项研究的意义,不妨把训练一个停车位识别模型比作培训一名新保安。传统做法就像这样:你把这名保安带到停车场A,手把手地告诉他哪些车位是空的、哪些是满的,反复训练几个月,直到他对这个停车场了如指掌。这时候,他在停车场A的表现堪称完美,准确率轻松超过99%。

问题在于,当你把这名保安调到停车场B时,他突然变得不那么好用了。停车场B的摄像头角度不同,光线也不同,车辆的种类和排布方式也有差异。即使是同样的"空车位",在他眼里看起来已经完全不一样。如果没有人重新在停车场B给他"补课"——也就是重新标注大量数据——他的判断就会频繁出错。

这个问题在学术上叫做"跨环境泛化能力差",翻译成大白话就是:模型在没见过的新环境里表现不好。早期的研究者已经注意到这一点,并尝试了一些缓解方法。比如,佛罗里达州立大学的研究者发现,只要给目标停车场提供大约1000个带标注的样本,就可以对模型进行微调,让准确率重新逼近97%。这已经比从零开始省事多了,但1000个标注样本依然意味着相当大的人工成本。另一项更近的研究则尝试完全绕开人工标注:先让一个"老师"模型在停车场运行最初几天,自动给观察到的图片打上伪标签,然后用这些伪标签去训练一个轻量级的"学生"模型。这种方法确实不需要人工标注,但依赖一个"老师"模型的存在,整个系统的结构相对复杂。

巴西这支团队选择了一条不同的路:自监督学习(self-supervised learning)。

二、自监督学习:让AI从"没有答案的习题集"里自学

自监督学习是一种让模型在没有人工标注的情况下自主学习的方法。这个概念听起来有些玄妙,但它背后的逻辑其实非常直观,可以用一个"闯关游戏"来理解。

设想你给一个孩子一堆乱拼的拼图,但不告诉他最终图案是什么。孩子没有"参考答案",但他可以通过反复尝试、观察哪些拼法看起来更顺眼、哪些形状天然吻合,逐渐学会识别图形的结构规律。当他真正拿到一幅有图案的拼图时,这种积累的经验会让他完成得又快又好。

自监督学习的思路与此如出一辙。模型在没有标注的图片上自己给自己出题——例如,把同一张图片做两种不同的处理(改变亮度、随机裁剪、加模糊等),然后要求模型判断这两张处理后的图片是否来自同一张原图。在这个过程中,模型被迫学会抓住图片中最稳定、最本质的视觉特征,因为只有这样才能在各种干扰下仍然做出正确判断。这种能力一旦形成,就像一种通用的"视觉语感",可以被迁移到各种具体任务上。

研究团队选用的具体方法叫做SimCLR,全称是"简单对比学习框架"。它的工作方式正如上面描述的那样:对同一张图片生成两个不同的"变体",训练模型让这两个变体在特征空间里尽量靠近,同时让来自不同图片的特征尽量远离。执行这一任务的"大脑"是一个叫做ResNet-50的网络结构,这是一种在计算机视觉领域被广泛验证、性能可靠的图像处理架构,相当于一个经验丰富的"视觉专家"。

三、三步走的训练食谱:从通才到专才的进化之路

巴西团队设计的训练流程分为三个阶段,如同一名保安从新手成长为专家的完整培训路径。

第一个阶段,是在海量通用图片上进行自监督预训练。这里用到的是著名的ImageNet数据集——一个包含数百万张各类日常物品图片的大型图库,有猫、有车、有植物、有家具,包罗万象。模型在这些图片上完成SimCLR的对比学习任务,学会了识别各种视觉模式的基本能力。这就像是让保安先去接受通识教育,练出一双敏锐的眼睛。值得一提的是,这个阶段的预训练权重由研究团队直接从公开资源获取,省去了重新训练的成本。

第二个阶段,是在停车场专属的图片上再次进行自监督训练,但这次图片仍然没有任何人工标注。模型看到的都是来自真实停车场的照片——各种角度、各种天气、各种光线条件下的车位图像——并在上面继续做对比学习的"闯关游戏"。通过这个阶段,模型从一个通才进化成了停车场领域的半专家,它的视觉语感开始向停车场这个特定场景深度校准。这一策略的灵感来自医学影像领域的研究:医学AI领域的学者发现,在通用预训练之后增加一个医学图像的自监督微调阶段,能显著提升模型在医学诊断任务上的表现。巴西团队将这一思路平移到了停车场场景。

第三个阶段,才引入少量有标注的停车场图片,对模型进行有监督的精调。注意这里一个关键细节:这些有标注的图片来自"通用停车场数据",也就是说,目标停车场依然一张标注都不需要提供。研究团队在模型顶部加上一个简单的分类层,告诉它"这种特征对应空车位,那种特征对应占用车位",让模型学会把前两个阶段积累的视觉能力转化为最终的判断输出。

走完这三个阶段,就得到了研究团队所称的"强通用模型"(Strong General Model)——一个不需要目标停车场任何标注数据,就能对各种环境下的停车位状态做出准确判断的分类器。

四、两阶段部署策略:先用通才,再培养专才

研究团队并没有止步于此。他们进一步设计了一套更聪明的实际部署方案,称为"两阶段部署策略"。

这套策略的逻辑是这样的:当一个新停车场准备接入智能管理系统时,第一步先把"强通用模型"直接部署上去,让它在最初的N天里负责识别工作。在这个过程中,系统会悄悄地收集目标停车场的无标注图片——只是拍照存档,不需要任何人工标注。N天过后,研究团队把这些收集来的图片混入第二阶段的自监督训练数据中,重新走一遍三步走的训练流程,得到一个专门针对这个停车场定制的"专用模型"(Specialized Model)。从此以后,专用模型接替通用模型,在这个特定的停车场持续工作。

研究团队在实验中将N设定为7天,这与此前相关领域研究的设定保持一致。这意味着,一个停车场在接入系统一周之后,就会自动获得一个更贴合自身环境的专用识别模型,整个过程对管理人员来说几乎是透明无感的,唯一的成本是7天的等待时间以及一次大约25小时的GPU训练时间。

两个模型的本质区别在于第二阶段的自监督训练数据构成:强通用模型只用来自通用停车场的图片,而专用模型则把目标停车场头7天收集到的无标注图片也加了进去。这个小小的差异,让专用模型能够把目标环境的具体视觉特征内化到自己的理解框架中,从而在该环境下表现得更加精准。

五、三个数据集的严格考验:在陌生环境里是骡子是马

为了验证这套方案的实际效果,研究团队在三个公开的停车场数据集上进行了系统评估,这三个数据集各有特点,覆盖了相当广泛的真实世界条件。

第一个是PKLot数据集,来自巴西的两所大学:巴拉那联邦大学和巴拉那天主教大学。这个数据集包含大约120万张带标注的停车位裁剪图片,平均分辨率为57×59像素,涵盖三个摄像头视角(UFPR04、UFPR05和PUCPR),以及晴天、雨天、阴天三种天气条件,采集历时100天。第二个是CNRPark-EXT数据集,来自意大利国家研究委员会,约包含16.5万个样本,平均分辨率96×91像素,设置了9个不同角度的摄像头,同样涵盖三种天气条件,采集历时23天。第三个是PLds数据集,来自美国匹兹堡国际机场,约包含10.4万个样本,平均分辨率303×108像素,特点是视角较低、容易出现遮挡,包含晴天、雨天、阴天、雪天和晴夜共五种天气条件,采集历时115天,共设三个摄像头。

评估采用的是"留一法交叉验证"协议,也就是说,每次实验都把其中两个数据集的数据用来训练,然后在第三个完全没见过的数据集上测试。这样做的目的是模拟真实的跨环境部署场景,确保测试结果反映的是模型在陌生环境中的真实能力,而不是在熟悉环境中的"表演"。

为了公平比较,研究团队同时设置了两条基线方案。第一条是"有监督基线":用已经在ImageNet上做过有监督训练的ResNet-50,直接在停车场有标注数据上微调。第二条是"自监督基线":用SimCLR在ImageNet上预训练,然后直接在停车场有标注数据上微调。这两条基线都代表了当前标准的迁移学习做法,区别只在于预训练方式不同。

六、数字说话:97%背后的故事

实验结果的核心数据已经足够清晰地说明问题。

有监督基线的全局平均准确率为97.1%,自监督基线为97.0%,两者相差无几。强通用模型的全局平均准确率为97.2%,略微超过两条基线。两阶段部署方案的全局平均准确率则进一步提升到97.8%,在所有方案中表现最佳。

这些数字需要放在具体语境中才能体现它们的价值。首先,这些结果均来自跨数据集评估——模型在训练时完全没有见过测试环境的任何图片。一项对该领域的系统综述指出,在跨停车场评估场景中,以往方法的平均准确率约为91.8%。而巴西团队的方案在同等条件下达到了97%以上,差距超过5个百分点,这在停车位识别这类任务中是相当显著的提升。

细看各数据集的表现,有一个值得关注的细节。在PKLot数据集上,强通用模型和两阶段部署方案的表现都明显优于两条基线,其中两阶段方案在UFPR04摄像头下达到98.9%的准确率,在PKLot整体上平均达到98.0%。在CNRPark-EXT数据集上,强通用模型和两阶段方案也整体略优于基线,两阶段方案平均96.8%。然而在PLds数据集上,情况出现了一些反转:强通用模型的平均准确率为96.8%,两阶段部署为96.7%,均低于有监督基线的97.6%。研究团队分析认为,PLds的低角度拍摄方式容易造成车辆遮挡,导致视觉特征本身就更难区分,通用的特征提取能力在这种极端条件下不如针对性训练的监督模型。这是一个诚实的局限性承认,也为未来的改进指明了方向。

两阶段部署方案与此前同类研究的对比同样耐人寻味。在相关领域,有一项采用了"教师-学生框架"的两阶段部署研究,教师模型平均准确率为95.3%,学生模型为97.0%。而巴西团队的方案中,强通用模型在最初7天就达到了97.3%的平均准确率,专用模型在后续阶段达到97.9%。不仅起点更高,最终成绩也更好,而且完全不需要教师模型这一中间环节。

七、当标注样本有限时:自监督的优势更加凸显

除了完全无标注的场景,研究团队还测试了一个更贴近实际的情形:如果愿意提供少量来自目标停车场的标注样本,各个方案的表现会如何变化?

实验设计是这样的:从目标停车场前7天的数据中随机抽取一定数量的样本并加以标注,然后用这些标注样本对各个模型进行额外的微调,评估在剩余时间段上的表现。标注样本数量从32个一路增加到8192个,覆盖了从极度稀缺到相对充足的整个区间。

结果显示,专用模型在整个标注数量区间内始终优于其他所有方案,这条优势曲线从样本数为零时就开始出现,随着样本增加,差距基本保持稳定。当标注样本数达到1000个时,一项此前的相关研究报告了约97%的准确率,而巴西团队的专用模型在同等条件下达到了98.8%,高出近2个百分点——尽管需要注意这两项研究所用的数据集和模型规模不完全相同,直接比较需谨慎。

自监督基线在这个测试中暴露出一个明显的弱点:它对标注数据的依赖程度更高,在标注样本较少时表现明显落后于其他方案,即使标注样本增加到8192个,它的准确率仍然低于所有其他模型(包括有监督基线)。这说明,仅仅依靠标准的"ImageNet预训练→停车场微调"两步流程,还不足以充分挖掘自监督学习的潜力,增加一个领域特定的自监督微调阶段才是关键所在。

八、树莓派上的实战:23秒扫完100个车位

实际落地时,模型不仅要准确,还要足够快。研究团队特别在一台树莓派5(一种约手掌大小、价格实惠的微型计算机,常用于物联网和边缘计算场景)上测试了推理速度,以模拟真实停车场的边缘部署环境。

结果是:识别一个停车位图片平均耗时0.2282秒,其中0.2140秒用于神经网络推理,其余时间用于图像裁剪等预处理步骤。换算一下,一个有100个可见车位的停车场,全部扫描一遍只需要不到23秒。对于一个需要周期性刷新车位状态的管理系统来说,这个速度是完全可以接受的。

不过,研究团队也坦诚指出,这个速度比此前采用轻量级学生模型的方案慢了大约20倍。对于更严格的功耗受限设备,这一延迟可能会成为问题。这是当前方案的一个实际局限,未来需要在模型轻量化方向上投入更多努力。

训练成本方面,无论是强通用模型还是专用模型,完整训练一次大约需要25个GPU小时,在配备NVIDIA RTX 6000 Ada显卡(48GB显存)的服务器上完成。这一成本对于需要定期更新部署模型的场景来说,属于可承受的范围,但对资源匮乏的小型停车场运营方而言,仍然需要仔细权衡。

九、训练细节:让结果可以被重现

研究团队在论文中详细披露了所有超参数设置,这对于希望复现或改进这项研究的人来说非常有价值。

在第二阶段的自监督训练中,他们使用了LARS优化器(一种专为大批量训练设计的优化算法),学习率设为0.3,批量大小为512,权重衰减为10的负6次方,对比损失的温度参数τ设为0.5,特征投影到128维的潜在空间。训练步数设为80000步,不使用学习率调度或预热策略。

在第三阶段的有监督微调中,使用了带Nesterov动量(0.9)的SGD优化器,训练30000步,批量大小为256。学习率和权重衰减通过网格搜索选取,学习率候选值从10的负3.5次方到10的负0.5次方,权重衰减候选值包括0、10的负5次方、负4次方和负3次方。微调阶段不使用数据增强。

数据增强策略在第二阶段发挥着核心作用:随机大小裁剪(缩放比例0.08到1.0,宽高比3/4到4/3)、随机水平翻转(概率0.5)、颜色抖动(概率0.8)、随机灰度转换(概率0.2)和高斯模糊(概率0.5)。这些操作组合在一起,确保模型必须学会在各种视觉扰动下保持对图片本质内容的正确判断,从而形成真正鲁棒的特征表示。所有输入图片均被缩放至224×224像素,并使用ImageNet的均值和标准差进行归一化。

说到底,这项研究解决的是一个让很多人头疼却又无处诉苦的问题:停车找位难。巴西联邦大学和天主教大学的研究团队找到了一条不需要任何目标停车场人工标注,就能把识别准确率推到97%以上的路径。他们的方案就像是训练了一名天生视觉敏锐、又在停车场环境中充分自学过的保安,即使派到从未去过的停车场,也能很快上手,还能随着时间推移越做越好。

这项研究真正有意思的地方,在于它证明了一件事:在很多实际场景中,"告诉机器答案"这个步骤其实可以大幅压缩甚至省略,机器完全可以通过大量无标注数据的自我摸索,发展出足够强大的判断能力。停车场只是一个起点,类似的思路完全可以迁移到其他需要大量数据标注的监控场景,比如工厂流水线的质量检测、医院停车场的安全监控,乃至更广泛的城市感知系统。

当然,这条路还没有走完。模型在树莓派上的推理速度依然有待提升,在低角度摄像头场景下的表现也存在明显短板。研究团队在展望中提到,未来将探索其他自监督学习范式、不同的模型架构,以及如何在精度与计算效率之间取得更好的平衡。对这一方向感兴趣的读者,可以通过arXiv编号2606.20886查阅完整论文,也可以直接访问研究团队公开的代码库,亲自动手复现和探索。

Q&A

Q1:自监督学习的停车位识别方案和传统方法相比,到底省去了哪些麻烦?

A:传统方法每次部署到新停车场,都需要人工为大量图片打标签(标注哪个车位空、哪个有车),耗时耗力。巴西团队的自监督方案完全不需要目标停车场的任何人工标注,模型通过自己"做题"的方式学会识别停车位状态,新停车场接入后只需等待7天自动收集数据,系统就会自动生成专用模型,全程无需人工干预。

Q2:两阶段部署策略中的"专用模型"为什么比"强通用模型"更准确?

A:专用模型在训练时把目标停车场头7天拍摄的无标注图片加入了自监督训练阶段,让模型有机会"熟悉"目标环境的具体光线、角度和视觉特征。相比之下,强通用模型只用通用停车场数据训练,对目标环境的了解较为有限。加入目标环境数据后,模型的特征提取能力得到了针对性校准,因此在该停车场上的表现更为精准,全局平均准确率从97.2%提升到97.8%。

Q3:这套停车位识别方案能在低功耗小设备上运行吗?

A:研究团队在树莓派5(8GB内存)上实测过,识别一个停车位图片平均耗时约0.23秒,一个100个车位的停车场全部扫描一遍不到23秒,对于定期刷新车位状态来说完全够用。但如果设备比树莓派更低端、功耗限制更严格,目前的速度可能就不够快了。研究团队也坦承这是当前方案的局限之一,未来需要在模型轻量化方向上继续优化。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-