跳到主要内容
返回时间线
arXiv来源发表:

一个点云抓取策略在液压林业起重机上清空原木堆,BC与BCRL分别回收93.8%和88.9%库存,超过几何启发式的80.4%

核心概要

该工作训练一个在未分割点云上分类抓取点并预测深度与偏航的网络,用行为克隆(BC)、其强化学习微调(BCRL)和从零强化学习三种方式在仿真中学习清空200根原木的密堆,并在拖车式液压林业起重机上完成12次现场试验:BC与BCRL分别回收93.8%和88.9%的合并库存,高于几何启发式的80.4%,BCRL的循环成功率83.6%也高于启发式的79.6%和BC的65.7%,但微调在仿真中获得的负载稳定性优势未迁移到起重机试验台。

Source-provided article image: Learning Grasp Targeting from Point Clouds for Log Pile Clearing on a Hydraulic Crane
Fig. 1 ·

Fig. 1: Trailer-mounted hydraulic forestry crane, suspended grapple, source rack, and destination trailer. The policy selects the grasp; a common controller transports and deposits the logs.

arXiv

深度剖析

提出一个从无分割点云直接输出抓取决策的策略:网络对每个观测点给出选择分数、垂直偏移和倍角偏航编码,取分数最高的未掩码点确定抓取位置与朝向,同一网络同时服务于行为克隆、强化学习微调和部署。 与依赖几何滤波或独立分割网络的做法不同,该策略把材料选择与抓取预测放在同一映射中学习;与直接回归抓取坐标的回归头相比,按点分类保留了堆中多个分离的可抓区域,避免平方误差把备选目标平均到无料处。 在三个训练种子下,评分头分别清空98、98、99个(共100个)仿真原木堆,而回归头为33、0、0;在1784条回归决策记录中14.6–24.7%的水平0.5米内没有观测点,评分头在2140条决策中没有此类失败。

在真实液压起重机试验台上,完全在仿真中训练、权重不变、且输入未滤波点云(仍含货架横梁与立柱)的BC与BCRL,比部署的几何启发式回收更多库存。 此前林业抓取工作多针对给定目标规划运动或在静态场景中规划单次抓取,未涉及状态随自身动作演化的整堆顺序清空,也未报告堆尺度的硬件试验;该工作给出12次完整抓取—搬运—卸载循环的现场对比。 合并三次试验,BC回收93.8%、BCRL回收88.9%的初始库存,启发式为80.4%;在三种堆形中的两种以及合并口径上学习策略均领先,平堆差异最明显(两种学习策略均清空,启发式停在62.0%),双丘堆则相反(启发式全部卸出)。

微调带来的负载稳定性提升没有迁移到起重机试验台,而清空优势迁移了;现场失败按原因与试验阶段被分类。 该结果把仿真到现实的差距定位在“操作/搬运”而非“清空完成度”,并提示任务完成与负载处理应分开评估。 微调策略在每种堆形上的稳定性都低于BC和启发式,差距0.02–0.06,与其仿真增益量级相当;空循环原因被分为结构或噪声误选、夹钳被过多物料卡住(choke)、在物料上方闭合(深度故障)和控制故障,启发式的6次结构/噪声循环全部出现在试验后三分之一。

从零强化学习在测试的奖励与预算下未超过BC,且表现出系统性深度偏差,需要人工深度偏移才能在真机上抓取。 探索确实偏离了示范的“堆顶”策略——前五个循环的相邻目标中位间距0.4米,而专家与微调策略为1.5米——但这种区域式策略并未带来更好的清空完成度。 从零RL在三种堆形上稳定性最低,合并对齐度与每次成功循环的原木数也最低;去掉人工偏移后,其在丘堆上的目标中位高度位于观测表面上方0.17米,而BC与BCRL的深度来自用起重机调试重新标注的示范。

启示与展望

该策略面向拖车式液压林业起重机在货架内清空密堆原木的场景,抓取决策限定在预设动作盒内,水平目标只能落在已观测表面上;训练完全在仿真中完成,部署时权重不变,输入为含货架横梁、立柱与噪声的未滤波点云。对希望复用的读者,这提供了一条无需分割网络或几何支撑滤波的路径,并说明按点分类的抓取表示可与行为克隆、强化学习微调和部署共用同一网络。作者建议的后续方向包括:用少量真实试验数据修正残余深度故障、把立柱惩罚扩展到基座横梁、以及在训练中随机化接触属性。

每种策略每种堆形仅一次重建堆试验,且重建堆只共享堆形类别而非相同配对状态,因此跨平台性能与稳定性结果的原因尚不能确定;作者也指出仿真未复现真机中的卡料与现场稳定性排序,可能来源包括液压与悬挂动力学、未测量的摩擦以及真实原木的树皮与节疤。此外,从零强化学习的结果包含人工深度偏移,其表现不能与完全自主的深度预测直接等同;评分头与回归头的对比、以及分类点选择与高斯坐标探索的对比,均来自有限种子,从零学习的种子间差异较大。

来源