微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 用帕德瓦大学与哥伦比亚大学联手打造的"四像素眼睛",机器人导航还需要几百万像素的摄像头吗?

用帕德瓦大学与哥伦比亚大学联手打造的"四像素眼睛",机器人导航还需要几百万像素的摄像头吗?

2026-05-29 10:45
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-29 10:45 科技行者

这项由意大利帕多瓦大学信息工程系与美国哥伦比亚大学计算机科学系联合完成的研究,于2026年5月以预印本形式发布,论文编号为arXiv:2605.19990,目前已投稿至IEEE旗下期刊等待正式发表。研究的核心问题极为简单却令人深思:机器人在室内外自由行走时,究竟需要多少只"眼睛"才能知道自己走了多远、走向了何方?

普通人或许从未思考过这个问题,但它关乎着每一台送餐机器人、仓库搬运小车乃至自动驾驶汽车的命运。今天大多数机器人都靠摄像头来感知自己的位置,这些摄像头动辄拥有几百万个像素点,耗电量惊人,计算负担沉重。对于那些只有有限电池和算力的小型机器人而言,这种方案就像让一个小孩扛着一台专业级摄影设备去导航——能用,但代价太大。研究团队给出的答案是:只需四个光传感器,配合一个惯性测量单元,就能实现稳定可靠的平面导航。

一、为什么摄像头的"像素税"让机器人喘不过气

机器人的导航系统通常有两类感官。一类是"内感",就像人感知自己肌肉用了多少力气——比如轮子转了多少圈的编码器,以及感知加速度和旋转的惯性测量单元(IMU,可以理解为一块精密的"电子平衡感受器")。另一类是"外感",就是对外部世界的感知,摄像头是最常见的代表。

把这两类感官融合起来的技术叫做视觉惯性里程计(VIO),是目前机器人领域最常用的导航手段之一。它的工作原理类似于你在一个陌生城市里,一边用手机地图看周围的路标,一边靠自己的步伐感觉走了多远,两者结合来确定位置。然而问题在于,这个"手机地图"——也就是摄像头——实在太耗资源了。

摄像头消耗的电力大致与其像素数量成正比。一块普通图像传感器在正常工作时会消耗数百毫瓦的电力。对于需要长时间连续工作的小型机器人来说,这相当于一台功率巨大的电器一直开着,很快就会把电池榨干。此外,处理每一帧画面还需要大量计算,这对算力有限的嵌入式平台来说更是雪上加霜。

研究团队把目光投向了一个更根本的问题:既然我们只想知道机器人跑得多快,真的有必要每秒处理几十帧、每帧包含几百万像素的图像吗?

二、向自然界取经:苍蝇的眼睛给了研究者启发

生物学家很早就发现,昆虫的复眼虽然远不如人眼精细,却能在飞行中精准感知速度和方向。这背后的秘密在于:运动产生的视觉信号,本质上是空间纹理被时间"刷过"时留下的频率特征——不需要认清每一个细节,只需要感知这种频率的变化就够了。

理解这一点,需要借助一个直觉化的思想实验。假设你坐在火车上,闭上眼睛,只通过窗帘缝隙感受外面光线的明暗交替——当列车快速穿过一片树林时,光线会快速闪烁;停下来时,闪烁停止。仅凭这种闪烁的频率,你就能大致判断列车的速度,而完全不需要看清楚树林的全貌。

这正是研究团队传感器设计的核心直觉。他们在地面朝下安置了四个光电二极管(简单来说就是能感知光强的微小电子元件),每个元件前面放置了一块特殊的光学滤镜——这块滤镜的图案就像斑马线,由黑白条纹交替构成,但条纹并不是均匀分布的,而是越靠近中心越宽、越靠近边缘越窄,整体形成一种叫做"Gabor函数"(一种特定的数学波形)的图案。

这种斑马线滤镜的作用,是从地面纹理中"捕捞"出某一特定的空间频率成分——就像一个特定孔径的滤网,只让某种大小的颗粒通过。当机器人在地面上移动时,地面纹理被这个滤网"过滤"后产生的光信号,其振荡频率与机器人的行进速度直接相关:走得越快,信号振荡越快;停下来,信号也不再振荡。

从数学上说,这个原理可以这样理解:地面的空间纹理有各种各样的"空间频率"(就像声音有各种频率一样),当传感器以速度 v 移动时,空间频率 ξ? 会被转换成时间频率 f? = ξ? × v。只要能测出信号的振荡频率 f?,再除以已知的滤镜频率 ξ?,就能算出速度 v。

三、一个方向搞不定,四个传感器协同解决难题

不过,上面这个优雅的原理有一个致命的缺陷:它只能告诉你速度的大小,却无法判断方向。原因在于,正弦波信号本身是对称的——无论机器人向前还是向后行走,产生的信号频率完全相同,就像一段旋律正放和倒放听起来节奏相同一样。

研究团队用一个颇为巧妙的方法解决了这个问题。他们引入了第二个传感器,其滤镜图案与第一个完全相同,但在空间上偏移了四分之一个条纹周期——这相当于把同一首歌的播放进度拨快了四分之一拍。这种偏移在信号处理领域叫做"正交",也就是两个信号之间始终保持90度的相位差。

当机器人向前走时,第一个传感器的信号"领先"第二个传感器90度;当向后走时,则反过来,第二个传感器"领先"第一个90度。通过判断哪个信号领先,就能确定运动方向。这个原理与直流电机的编码器工作方式非常相似,只不过这里是通过光学滤波而非机械接触来实现的。

然而还有一个工程上的现实问题:光学滤镜的透过率只能是正数(你不能让一块玻璃"负传光"),但Gabor函数的值有正有负。研究团队的解决方案是把每个Gabor滤镜一分为二:一块只保留正值部分,另一块只保留负值部分(等价于把负值变为正值再做一块新滤镜)。将两块滤镜对应传感器的输出相减,就等价于使用了一块完整的、有正有负的Gabor滤镜。

这样一来,两个方向(余弦相和正弦相)各需要两块滤镜,总共恰好需要四块滤镜和四个光电二极管。这就是"四像素传感器"名字的由来——不是四百万像素,不是四万像素,就是实实在在的四个光感元件。

四、高度变化带来的烦恼,以及意外的惊喜

在现实中,机器人行走时难免颠簸,车体相对地面的高度会随着地形起伏而变化。这对传感器来说是个麻烦:高度变化会改变滤镜投影到地面上的实际尺寸,从而改变有效的"捕捞频率",让速度的计算出现偏差。

更复杂的是,四个光电二极管在物理上不可能完全叠放在一起,它们之间必然存在一定的间距。当高度发生变化时,四个传感器看到的地面区域会略微不同步,就像四双眼睛从不同角度看同一个物体时产生的视差。这种视差会影响两路信号之间的相位差,原本应该精确是90度的相位关系会随高度变化而偏移。

然而,研究团队发现这个"干扰"实际上蕴含着有用的信息:相位差的变化量与高度偏差之间存在一定的对应关系。换句话说,传感器的信号里不仅包含速度信息,还隐藏着高度变化的线索。人工智能模型有能力从这些混杂在一起的信号中,同时学会速度和高度的关系,从而在速度估计上保持稳健。

这个发现后来在实验中得到了验证。当模型在训练时故意加入了各种程度的高度随机扰动之后,它在实际测试时应对颠簸路面的能力明显优于那些只在固定高度下训练的模型。以标称高度正负25%的范围进行随机扰动训练的模型,在同等测试条件下的速度估计均方根误差仅为每秒0.048米,甚至比只在标称高度训练时的0.054米还要更好——这说明适度的"干扰训练"反而帮助模型学到了更深层的物理规律。

五、用模拟器和神经网络联手"调教"传感器

知道了传感器的工作原理,接下来的问题是:Gabor滤镜的具体参数应该如何设定?条纹应该多密?高斯包络应该多宽?振幅应该多大?这些参数决定了传感器对哪个空间频率最敏感,也决定了它在各种地面纹理和运动条件下的表现。

研究团队的答案是:不要手工猜测这些参数,让机器学习自己找到最优解。为此,他们构建了一个高度仿真的模拟器,能够模拟传感器在各种地面纹理、各种速度和旋转组合下产生的信号。模拟器使用了来自Matador数据集的约7200张高质量真实地面材质图像,涵盖57种材质类别,包括瓷砖、砖块、大理石、混凝土、地毯、碎石等等,保证了多样性。运动轨迹则来自TartanGround数据集,覆盖超过80公里、12小时的行驶记录,速度范围从静止到每秒5米,转弯角速度最高达每秒1弧度。

整个模拟管线是完全可微分的——这意味着误差信号可以像电流一样从神经网络一直反向流到Gabor滤镜的参数上,让滤镜参数和神经网络参数同时被优化。这就好比你在设计一副眼镜的同时,也在训练大脑读图的能力,两者相互配合,共同进化。

解码速度的神经网络采用了时序卷积网络(TCN)架构,拥有约18.4万个参数——这个规模在深度学习里属于轻量级。网络接受一秒钟的信号窗口(1000个时间步的两路信号),通过层叠的扩张卷积提取多尺度时间特征,再经过一个注意力池化层——注意力机制的作用类似于"自动调焦",当信号质量差时自动降低该时段的权重,避免噪声干扰最终判断。最后,网络不仅输出速度的估计值,还输出一个不确定度的量化指标,让系统知道自己的估计有多大把握。

训练对比实验显示,联合优化的Gabor参数(称为"学习型Gabor")比手工设定参数的固定Gabor方案,均方根误差降低了29%,平均绝对误差降低了35%。而那些完全没有Gabor约束、让神经网络自由学习任意滤镜形状的"自由像素"方案表现最差——没有了Gabor先验的约束,滤镜退化成了模糊的斑点,网络只能依靠四个传感器之间的时间延迟来间接估计速度,精度大打折扣。

六、从实验室走向真实世界:920米的实战检验

研究团队为四像素传感器制作了实物原型。四块Gabor滤镜图案被打印在透明胶片上,每块面积16×16平方毫米,安装在四个滨松S9119-01光电二极管前方,整个传感器阵列以2×2的方格排布,相邻二极管间距1.9厘米,二极管与滤镜之间距离11.4毫米,每个二极管拥有70度的视场角。这套系统被安装在LeoRover差速驱动机器人的底部,距地面标称高度6厘米,朝向正下方。

为了应对室内环境可能出现的强烈镜面反射,传感器外围加装了遮光罩;为了应对昏暗的室内环境,机器人底盘上悬挂了一盏低功耗LED灯(在室外或光线充足的室内不开启)。整套传感系统的功耗仅为2.5毫瓦,而普通相机图像传感器的功耗通常在数百毫瓦量级——这意味着功耗降低了两个数量级,也就是大约缩小到百分之一以下。

实验阶段,团队在11条室内轨迹(总计618米,61分钟)和5条室外轨迹(总计306米,26分钟)上对机器人进行了遥控测试,共计920米、87分钟的行驶数据。地面类型覆盖了瓷砖、大理石、地毯、混凝土、砖块、碎石等多种材质,环境从整洁的室内走廊到崎岖的室外路面不等。

参考轨迹由安装在机器人上的Intel RealSense D455深度相机配合RTAB-Map视觉里程计软件生成,代表当前技术条件下较为精准的参考基准。对比基线方案包括两种:纯轮式编码器里程计,以及编码器与IMU融合的里程计(与本系统使用相同的陀螺仪数据来估计转向角)。

量化结果相当有说服力。衡量轨迹整体几何一致性的平均绝对轨迹误差(ATE)方面,纯编码器方案在室内平均误差高达9.75米、室外14.09米,方差极大(标准差超过均值),说明轮子打滑导致严重不稳定;编码器加IMU融合后改善明显,室内0.75米、室外0.74米;而四像素传感器加IMU的方案,室内仅0.28米、室外0.42米,比编码器加IMU方案分别提升了约63%和43%。

衡量累积漂移的终点漂移率(端点误差除以总行驶距离)方面,纯编码器方案室内高达25.60%、室外30.25%,几乎无法实用;编码器加IMU方案室内1.62%、室外1.37%;四像素方案室内0.60%、室外0.62%,约为编码器加IMU方案的三分之一。

此外,研究团队还测试了不同更新频率下的性能表现。当TCN以1000赫兹、100赫兹和30赫兹三种频率更新速度估计时,轨迹误差的差异微乎其微——从1000赫兹降到30赫兹,室内ATE基本不变,室外ATE仅从0.42米增加到0.44米。这说明即便大幅降低计算频率(从而进一步节省算力),系统性能几乎不受影响。

七、这套系统的工作细节与工程处理

在实际信号处理流程上,外部数据采集系统以41.6千赫兹的采样率对四路模拟信号进行数字化采集。采集后的信号先经过一个60赫兹的陷波滤波器,去除交流电照明(日光灯闪烁)引入的干扰;再经过450赫兹的低通滤波器去除高频噪声;最后降采样至1000赫兹,送入TCN处理。

TCN使用1秒滑动窗口处理两路差分信号(每路1000个采样点),输出当前时刻的瞬时速度估计和对应的不确定度。系统会根据不确定度自动丢弃低置信度的速度估计,再用一个简单的中值滤波器剔除瞬时异常值,最后将滤波后的线速度与来自RealSense D455相机IMU的陀螺仪偏航角速度融合,通过简单的运动学积分计算出平面轨迹。

值得注意的是,整套系统从头到尾完全依赖模拟数据训练,没有在任何真实世界数据上进行微调或再训练。能够如此直接地从模拟器迁移到真实世界,一方面归功于模拟器对物理过程的精细建模(包括探测器有限面积导致的模糊效应、方向响应函数、透视收缩效应、硬件增益、读出噪声、量化噪声和动态范围限制),另一方面也得益于训练数据中丰富多样的纹理和运动轨迹组合。

说到底,这项研究讲述的是一个关于"够用就好"的故事。研究团队用四个比指甲盖还小的光感元件,加上一片打印在透明胶片上的花纹,再配合一个轻量级神经网络,就实现了比造价远高、功耗远大的轮式编码器方案更好的导航精度。这对资源受限的机器人平台来说,意味着可以把省下来的电力和算力用于其他更关键的任务。

对于普通人而言,这项研究的意义可能体现在不远的将来:当你在医院走廊看到一台轻盈地穿梭送药的小机器人,或者在仓库里见到一台持续工作却不需要频繁充电的搬运车,背后或许用的正是类似这样极简而精妙的感知方案。未来,研究团队计划将整套系统集成到定制嵌入式芯片上,实现真正的片上实时计算;同时也在探索将这套思路扩展到无人机等具有更多运动自由度的平台,以及用于地形识别和碰撞预警等更广泛的机器人感知任务。

Q&A

Q1:四像素传感器靠什么原理来测量机器人的移动速度?

A:传感器的每个光电二极管前面放置了一块具有特定条纹图案的光学滤镜(Gabor滤镜)。当机器人在地面移动时,地面纹理透过这块滤镜产生的光信号会发生规律性的振荡,振荡的频率与移动速度成正比——走得越快,信号振荡越快,停下来则不再振荡。通过测量信号的振荡频率,就能反推出速度。

Q2:四像素传感器比普通摄像头省多少电?

A:四像素传感器的整体功耗仅为2.5毫瓦,而普通相机的图像传感器通常消耗数百毫瓦。两者相差约两个数量级,也就是说四像素方案的功耗大约只有普通摄像头的百分之一,甚至更低,对电池续航有显著改善。

Q3:四像素传感器在室外凹凸不平的地面上还能准确工作吗?

A:可以,但性能会略有下降。研究团队在训练时特意加入了传感器高度的随机扰动来模拟颠簸路面,使神经网络学会从信号的相位变化中推断高度偏移并修正速度估计。实验结果显示室外轨迹误差(0.42米)略高于室内(0.28米),但仍远优于传统轮式编码器加IMU方案(0.74米)。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-