Soft Spatial Reasoning 用 AdaptSoft 按步调节软思考温度,在 OmniSpatial 上把加权平均准确率提到 49.68
核心概要
该工作提出 Soft Spatial Reasoning 后训练框架,让大型视觉语言模型在空间推理的每个思维链步骤用混合 token 嵌入的连续软状态代替硬性选择单个 token,并用 AdaptSoft 控制器依据当前隐藏状态与预测不确定性逐步调节软度,配合梯度对齐目标训练;在 OmniSpatial、SpatiaLab、MindCube 三个基准上,其加权平均准确率均高于同骨干的硬思考与固定软度思维链基线以及所比较的现有模型。
深度剖析
提出面向大型视觉语言模型空间推理的软思考后训练框架,把中间推理步骤表示为混合 token 嵌入的连续软状态,最终答案仍以离散语言输出。 作者称这是首个专门面向大型视觉语言模型空间推理的软思考框架;此前软思考多用于语言模型,或虽在视觉语言模型中保留连续视觉表示,但思维链仍以离散 token 选择推进。 论文给出方法推导,包括 Gumbel 重参数化似然与软步骤 GRPO 比率,并在三个基准上与同骨干的硬思考、固定软度思维链基线做受控比较。
设计 AdaptSoft 控制器,用当前隐藏状态与下一 token 分布的预测不确定性逐步决定软度,使温度在基础值附近按步变化。 既有软思考方法通常使用固定软度,而该工作让软度随推理步骤自适应,以在保留多种候选解释与避免冲突空间关系相互干扰之间取舍。 消融显示去掉隐藏状态输入平均准确率下降 3.53 分,去掉预测不确定性下降 2.11 分;附录分析报告温度随归一化熵升高而下降,相关系数为 -0.71。
提出梯度对齐学习目标,用每一步对策略梯度的贡献与参考梯度的对齐程度,为软度控制提供步骤级学习信号,无需中间推理标注。 GRPO 的 rollout 级共享优势无法区分不同步骤应如何调节软度,该目标在不依赖外部评估器或中间推理监督的情况下补上这一信号。 消融中把步骤级梯度对齐换成 rollout 级任务优势造成最大平均降幅 4.07 分,其中 Hypothetical 推理下降 6.52 分;去掉梯度中心化平均下降 1.57 分。
在 OmniSpatial、SpatiaLab、MindCube 三个基准上,该方法在所比较的非专有模型中取得最高加权平均准确率,并优于同骨干的硬思考与固定软度思维链。 同骨干同后训练设置下,基础软思考比硬思考高 1.01 分,自适应软度再高 2.75 分;零样本迁移到 SpatiaLab 时自适应软度比基础软思考高 1.85 分,而硬思考到基础软思考仅高 0.65 分。 OmniSpatial 加权平均 49.68,分别超过 InternVL3-14B、SoFar、LaCoT 3.74、4.54、4.02 个百分点;SpatiaLab 48.71,超过最强先前开源权重模型 LVR 2.93 个百分点;MindCube 38.13,比骨干高 4.51 分。
启示与展望
该框架面向以大型视觉语言模型做空间推理问答的场景,训练使用 OmniSpatial 的 6,902 条训练样本,评估覆盖 OmniSpatial 的 1,533 条留出测试样本以及零样本的 SpatiaLab 与 MindCube;方法以 Qwen3-VL-8B-Thinking 为骨干,软思考只作用于推理 token,遇到 </think> 后切换为离散答案生成。对希望把软思考引入视觉语言模型推理的研究者与工程团队,这提供了一套可复现的控制器与训练目标,代码已公开。
AdaptSoft 目前没有对视觉证据不确定性的显式度量,作者把在思维链各步纳入视觉不确定性列为未来方向。温度与不确定性关系的分析基于推理 rollout 的统计,不同空间任务上自适应软度的增益幅度差异较大,其适用条件仍待更多场景检验。本总结依据的是论文全文与首页证据包,未包含图表原图,因此图 4 中逐步温度变化的具体数值无法在此复述。
