跳到主要内容
返回时间线
arXiv来源发表:

在仅640KB SRAM的STM32H563ZI单片机上,用INT8量化超分网络把VL53L9CX SPAD传感器的低分辨率深度与强度图同时重建为高分辨率图像

核心概要

该工作提出一种双分支超分辨率深度学习框架,同时放大消费级VL53L9CX SPAD飞行时间传感器采集的低分辨率深度与强度图像,通过两阶段PixelShuffle重建头与简化传感器固件控制激活内存,将模型导出ONNX并INT8量化后生成C代码部署到仅640KB SRAM、2MB Flash的STM32H563ZI裸机MCU上,实现完全在片上的超分推理。

Source-provided article image: On-Device Super-Resolution Imaging for a Low-Cost SPAD Array on a 640-KB-SRAM Microcontroller
Fig. 1 ·

Fig. 1: (a) DL architecture. Modality-specific branches process depth and intensity, with intensity-gradient guidance provided to the depth branch. (b) Simplified PixelShuffle module. The interchangeable backbone is (c) SAFM, (d) RLFN, or (e) SPAN. Each branch upsamples through two compact PixelShuffle stages and uses an interpolated residual connection for reconstruction.

arXiv

深度剖析

提出并验证了一个双分支超分辨率网络,可同时重建深度与强度图像,深度分支使用Charbonnier、Sobel梯度、全变分与结构项组合损失,强度分支省略全变分项,因为反射纹理对强度是信号而非伪影。 与以往将直方图与高分辨率RGB融合、在GPU或大内存嵌入式平台上运行的方法不同,该框架仅以单传感器低分辨率深度与强度为输入,不依赖跨相机配准。 在八个Middlebury合成场景上,三种学习模型将深度RMSE从双三次插值的0.051米降至0.042米,约18%改善;强度PSNR从26.88dB提升至27.71dB(SAFM),GMSD从0.0017降至0.0014。

设计了内存高效的两阶段PixelShuffle重建头,将单阶段头拆分为两级并降低中间通道数,使峰值激活内存从超过SRAM容量降至可容纳范围,参数量从21037个INT8数降至3780个。 以往超分网络的内存瓶颈通常被视为权重存储,该工作指出峰值SRAM占用主要由骨干网络之后的大激活张量决定,并据此重新设计上采样模块。 三种量化骨干在MCU上的RAM占用为522至533KB(约占81%至83%),Flash占用为141至171KB(约占7%至8%),推理延迟为0.44至0.75毫秒。

建立了从PyTorch训练到ONNX导出、INT8训练后静态量化、ST Edge AI Core编译为C代码并集成简化传感器固件的自动化部署流程,在STM32H563ZI裸机MCU上实现片上超分。 据作者所述,这是首个在低成本裸机MCU上运行、面向消费级低分辨率SPAD传感器并同时重建深度与强度的非融合超分深度学习模型。 INT8量化后强度PSNR仅从27.71降至27.68dB,SSIM从0.8226降至0.8213;深度RMSE从0.0423米升至0.0470米,AbsRel从0.0093升至0.0158。

在真实测量中,超分输出将低分辨率下呈阶梯状和锯齿状的人体轮廓、手臂与躯干间隙、抬起的手部以及面部与衣物纹理清晰分辨出来,点云将人物与背景墙壁分离。 真实数据验证补充了合成实验,表明该框架在消费级SPAD传感器的实际噪声与场景条件下仍能产生更密集的深度、强度与点云输出。 七次真实采集(空场景与人物由近及远再返回)显示高分辨率深度梯度不再呈条纹状,强度通道中面部特征与衣物纹理从平坦亮斑中显现。

启示与展望

该结果面向在STM32H563ZI裸机MCU(单核Arm Cortex-M33,250MHz,640KB SRAM,2MB Flash)上、以VL53L9CX消费级SPAD飞行时间传感器为输入的深度与强度联合超分场景,系统总成本约120美元。它使低成本机器人、自主平台与三维感知设备无需GPU、嵌入式Linux处理器或专用神经处理单元即可获得更密集的深度、强度与点云输出。作者指出,进一步收益可来自更高效的骨干架构、编译与执行流水线优化(如针对目标DSP指令集的内核改进与激活缓冲管理),以及将高分辨率重建限制在真正需要细节的空间区域(感兴趣区域超分)。

合成评估仅使用八个Middlebury场景,真实评估为七次采集,样本范围有限,尚不清楚在更广泛场景与传感器批次上的表现。深度阈值指标接近饱和,作者也指出这些指标在本文深度范围内区分度有限。INT8量化对绝对深度精度带来可测量退化(RMSE从0.0423米升至0.0470米,AbsRel从0.0093升至0.0158),而强度重建几乎不受影响,这一不对称性在精度敏感应用中值得关注。损失权重消融显示多数权重在一个数量级内变化对性能影响很小,作者建议对少数权重做进一步联合调优。感兴趣区域超分被提出为降低延迟的方向,但其感兴趣区域选择精度与计算节省的权衡尚未评估。此外,加载文本中多处数值(如SRAM容量、损失权重、延迟与内存字节数)以占位符形式缺失,若需精确复现应查阅原文图表。

来源