跳到主要内容
返回时间线
arXiv来源发表:

SSR 将多模态搜索智能体的推理改为候选选择,在 2B/4B 模型上保持成功率的同时把每轮推理延迟降低逾 90%

相关研究与后续进展

核心概要

该工作提出 Selection-based Structured Reasoning(SSR),把多模态智能体每步动作前的开放式推理改写为从预先设定的可复用自然语言推理候选中按上下文似然进行选择,无需辅助任务头,并借助教师强制预填充与共享上下文 KV 缓存并行打分;在七个多模态搜索基准、2B 与 4B 模型上,跨多种强化学习目标与监督微调,SSR 取得与同规模领先搜索智能体相当的平均成功率,同时将每轮推理延迟降低逾 90%、每题模型总推理延迟降低 28-54%。

Source-provided article image: Selection-Based Structured Reasoning: Toward Efficient Multimodal Search Agents
Figure 1 ·

Figure 1: SSR significantly reduces inference latency. Left: Parallel reasoning decoding replaces autoregressive reasoning generation. Right: Across four training objectives and two model sizes, SSR achieves comparable or higher success rates while reducing mean reasoning latency per turn by more than 90 % 90\% . Mean total model inference latency per question is reduced by 28 28 – 54 % 54\% (Table 2 ).

arXiv

深度剖析

SSR 把推理从开放式生成重构为选择:把反复出现的高层推理表示为预先设定、可复用的自然语言候选,模型每轮依据当前上下文给出的似然在这些候选间选择。 相对于常见的每步动作前自由生成推理的做法,该框架不再让模型逐字生成推理文本,而是把推理空间限定在预定义候选集合内。 摘要以框架描述与在七个多模态搜索基准上的评测支撑这一设计,并说明选择过程不需要辅助任务头。

预定义推理轨迹使并行打分成为可能:教师强制预填充在共享上下文 KV 缓存下,同时计算候选内部与候选之间的 token 似然。 这一机制把原本串行的推理生成转化为可并行的似然计算,是效率收益的直接来源。 摘要给出机制说明,并报告每轮推理延迟降低逾 90%、每题模型总推理延迟降低 28-54%。

在 2B 与 4B 小模型上,SSR 在多种强化学习目标与监督微调下均带来显著效率提升,且未牺牲任务表现。 该结果针对的是模型容量有限时推理冗长却对动作生成指导有限的问题,说明效率改进不必然以成功率为代价。 摘要报告在七个多模态搜索基准上的评测,平均成功率与同规模领先搜索智能体相当。

启示与展望

该结果面向多模态搜索智能体这一设定,适用于推理步骤具有反复出现的高层模式、因而可以预先设定为可复用自然语言候选的任务;评测覆盖 2B 与 4B 规模模型,并在多种强化学习目标与监督微调下验证。对希望在同规模模型上压缩推理延迟、同时保持任务成功率的工程实践者,SSR 提供了一条以选择替代生成的实现路径,其并行打分依赖教师强制预填充与共享上下文 KV 缓存。

摘要未说明推理候选集合的规模、来源与构建方式,也未给出各基准的逐项成功率与延迟测量条件,因此效率收益在不同任务分布与候选设计下的稳定性仍是开放问题。此外,摘要未报告与更大规模智能体的对比,SSR 在模型容量提升后的相对优势有待进一步观察。

来源