小模型GUI定位中动作类型如何注入:辅助损失、加性嵌入与提示词各提升5–7个hit@0.10点,但增益多来自序列化缺陷
核心概要
该研究用LoRA微调Qwen2-VL-2B在Android in the Wild上比较五种向小型GUI定位模型提供动作类型的方式,在匹配数据、算力与解码条件下发现辅助损失、加性嵌入和提示词各使hit@0.10提升五到七点,但重训去除序列化造成的退化类别后无机制在命中率上超过基线,仅辅助损失缩短平均误差。
Figure 2: Conditioning advantage over the flat baseline as a function of training-set size on all_with_coords , three seeds per cell, 95% episode-clustered bootstrap intervals. Each size is scored on a different validation slice with a different class mix, so only within-size differences are meaningful, and 24 contrasts are shown without correction.
arXiv深度剖析
在混合点击、滚动与输入事件的流上,辅助损失、加性嵌入和提示词三种机制在hit@0.10上比平坦基线高五到七点,且三者彼此不可区分;硬路由与前置token与基线无显著差异。 此前缺少在匹配数据、算力、适配器与解码条件下对多种类型注入方式的直接比较,也缺少对训练后模型是否真正读取该信号的检验。 五个种子,按episode聚类的自助区间与种子级配对检验;基线种子间波动大(0.169至0.280),故采用配对统计而非最佳单次运行。
混合流上的增益主要来自作者自身序列化选择:AITW对type事件记录屏幕外触点,序列化器将其钳制到原点,使平坦基线须为一个未被告知的类别预测固定点,该类别把基线的点击整体拉向原点。 将表面上的空间先验增益归因于预处理造成的退化类别,并通过去除该类别的重训加以量化。 去除type事件重训后平坦基线hit@0.10从0.229升至0.296,各条件化变体变化在0.025以内且区间过零;干净流上无机制在头条指标上超过基线,区间紧到可排除两个百分点的效应。
对训练后模型的干预显示两种学习嵌入在推理时都被读取:错误类型使加性嵌入从0.275跌至0.054,前置token从0.242跌至0.079;置零后加性模型距基线不超过一点,而前置token模型低于基线七点。 提出错误、置零与类别均值三类干预协议,用以区分训练效应与推理效应,并检验条件信号是否被读取。 五个种子,episode自助区间与种子级检验;前置token在共享学习率下其行几乎不动(位移0.016,初始化范数0.78),学习率提高十倍后达到其他三种机制水平。
通过inputs_embeds注入条件会使Qwen2-VL对图像token回退到一维位置编码,损失九点,该静默失败曾使作者得出反对条件化的结论。 记录并对照库源码定位了一个静默的位置编码回退,说明其如何反转结论。 依据库源码与冻结嵌入对照推断,而非在失败运行中直接转储位置id;保留input_ids的前向钩子消除了该缺陷。
启示与展望
该结果面向在AITW类数据上微调小型VLM定位模型的研究者与工程实践者,适用于动作类型与坐标在同一自回归流中输出的设定。其价值在于提供一套可复用的比较与干预协议:在匹配数据、算力、适配器与解码下比较类型注入方式,并用错误、置零与类别均值干预检验信号是否被读取。对部署而言,提示词与辅助损失无需新增参数即可获得与学习嵌入相当的效果,且加性嵌入在置零后距基线不超过一点,适合作为低风险默认选择。序列化审计这一教训可直接迁移到任何在坐标上施加监督的流水线。
干净流上辅助损失缩短平均误差这一残余效应是否在更大切片上保持,以及退化类别风险是否为单一序列化与单一数据集的特性,仍是开放问题。前置token在共享学习率下的失败被归因于调度而非架构,但更快训练仅用三个种子,且未在修正路径上训练冻结槽位对照。类别均值干预在方向上匹配前置token但范数不匹配。端到端结果中,预测类型流水线相对基线的优势未被确立,且错误类型会使所有推理时条件化的模型崩溃,分类器误差是主要风险。注意力分析仅用一个种子与一层,且教师强制使测量与预填充阶段的定位不可直接比较。
