跳到主要内容
返回时间线
arXiv来源发表:

用预训练扩散模型加多模态条件精修摄影测量DSM,法国城市密集城区RMSE从6.00米降到3.45米

核心概要

该研究把预训练Stable Diffusion 3改造为仅图像流的生成骨干,用剪枝文本流与逐块归一化策略,在摄影测量DSM与Pléiades-HR光学影像双重ControlNet条件下精修垂直配准的DSM,在法国八个在上下文城市把密集城区RMSE从6.00米降到3.45米,在地理留出的波尔多从4.16米降到2.77米。

AI-generated editorial illustration: Enhancing Photogrammetric Digital Surface Models with Pretrained Diffusion Models and Multimodal Conditioning

深度剖析

逐块归一化让预训练扩散模型能稳定适配均值高程与局部起伏差异很大的三维高程图,并在采样后还原到原始物理单位。 此前扩散模型用于地形多集中在空洞填补或文本驱动生成,直接对原始高程做流匹配会因局部方差远小于数据集整体高程跨度而不稳定;该工作用从条件DSM估计的尺度与偏移重参数化噪声与目标,把损失归一到接近自然图像训练的量级。 论文报告在扫描的LiDAR支撑上最小原始标准差为0.00473米,未使用截断或零方差回退,且报告的训练运行中未观察到由逐块缩放引起的不稳定;该策略的统计量在附录C中给出。

把SD3的文本流剪枝成纯图像生成器,在保留预训练图像权重的同时把Transformer从约2B降到1B参数,并提升推理吞吐。 相对原始SD3多模态扩散Transformer,该工作把联合文本-图像注意力改为图像自注意力,移除文本专用投影、前馈网络、LayerNorm与调制层,从而在无文本标注的地图生成任务上得到更轻的骨干。 附录B表A3给出合成50步去噪加VAE解码基准:剪枝后Transformer为1.033B参数、每个ControlNet为0.547B,在批大小32下吞吐约1.74样本/秒(含两个ControlNet时约0.82),均高于未剪枝配置。

同时以摄影测量DSM和Pléiades RGB影像为条件,比只用DSM条件进一步降低高程误差,密集城区与道路收益最明显。 论文把DSM-only与DSM+RGB放在同一配对协议下比较,并报告在上下文城市与留出城市波尔多的分地类MAE/RMSE,显示RGB在多数地类上带来额外增益。 在上下文测试的6385个地理斑块上,密集城区RMSE由校准输入的6.00米降到DSM-only的3.85米、DSM+RGB的3.45米;波尔多3209个斑块上由4.16米降到3.10米与2.77米,指标在共同有限LiDAR/DSM支撑上按20个推理种子平均。

精修模型对原始DSM空洞具有次要的恢复能力,DSM+RGB在两个测试集的全部五个地类上空洞RMSE都低于DSM-only。 空洞填补此前多由专门的DEM空洞填补方法处理,这里作为稠密立体DSM系统校正的附带能力被单独评估,且校准输入在空洞处没有数值基线。 附录D.2表A7按地类报告空洞像素RMSE,仅纳入LiDAR有效而输入DSM无高程的像素,并排除源DSM影像之外的缺失像素。

启示与展望

该工作面向满足两个假设的输入:DSM与LiDAR垂直配准(A1),且两者代表同一物理表面(A2);估计目标是校正局部误差,而非从任意未校准或表面不一致的输入重建DSM到LiDAR。适用场景是法国城市中0.5米分辨率的Pléiades-HR与CARS立体DSM配对数据,波尔多是同一采集与处理设置下唯一的地理留出城市。对读者而言,这提供了两条可延展的线索:一是把逐块归一化作为适配其他物理量栅格的通用手段,二是把剪枝后的扩散骨干当作下游地理空间任务(如分割与目标检测)的预训练表示;作者还提出可评估灾前灾后立体DSM精修是否改善高程变化图,但需先确认精修保留而非抑制或引入真实变化。

论文自身指出若干开放问题:RMSE筛选只是表面兼容性的间接启发式而非经验证的表面变化掩膜,且会改变评估数据的地类构成(密集城区像素在排除集中占比高出1.81倍);采集日期差异与残余错位会干扰DSM-LiDAR差异的解释;LiDAR参考中小空洞插值对屋顶与树冠附近的影响尚未量化;高层建筑、桥梁与陡峭地形未单独评估;相邻训练与测试斑块可以相接而无空间缓冲,城市级自助区间不能消除这种空间依赖;10米Theia标签在0.5米网格上只提供粗分层。此外,实验比较确立的是相对校准DSM与DSM-only配置的增益,而非优于其他增强方法,任务匹配的常规与监督基线、替代融合与训练策略、独立重复训练仍有待补充。本总结基于论文全文,但未获取源影像、高程栅格与模型权重,这些受许可限制不可再分发。

来源