跳到主要内容
返回时间线
arXiv来源发表:

JOVE 联合分配执行模型与付费验证,在四个推理基准上保持竞争性准确率的同时把平均成本与延迟降低至少 3.17 倍

相关研究与后续进展

核心概要

JOVE 是一个在线框架,把复杂推理查询分解为有向无环任务图并分配到异构 LLM 上执行,同时联合决定哪些中间输出送去付费验证;它通过求解逐查询的混合整数线性规划做执行与验证决策,用验证反馈在线更新任务相关的 LLM 质量估计,并以信息增益奖励把学习价值纳入分配,在长期预算与单查询延迟约束下取得次线性的质量学习遗憾,在四个推理基准上准确率与标准推理基线相当,平均成本与延迟至少降低 3.17 倍。

Source-provided article image: JOVE: Joint Execution and Verification for Resource-Aware LLM Task Graphs
Figure 1 ·

Figure 1: Overview of JOVE. A planner decomposes each query into a task graph and identifies candidate executor LLMs for each node. JOVE jointly assigns executors and selects outputs for verification, subject to a long-term execution/verification budget and latency constraints. Verification proceeds asynchronously without delaying the current response, improving model-quality estimates.

arXiv

深度剖析

提出 JOVE,一个把执行器 LLM 分配与中间输出付费验证选择联合起来的在线框架,验证异步运行并用于改进后续分配。 以往把任务图分配到异构 LLM 的工作通常只做执行侧调度,而这里把“现在花在执行上的钱”与“为将来学习而花的验证钱”放在同一个决策里权衡。 论文以框架描述与算法设计给出该贡献,并说明验证异步运行、反馈回流到未来分配;未在摘要中给出验证预算或验证频率的具体数值。

把该权衡形式化为长期预算与单查询延迟约束下、服务质量和成本与执行时间初始未知的随机优化问题,并用逐查询混合整数线性规划序列求解。 将资源感知的 LLM 任务图调度表述为可求解的 MILP 序列,而不是启发式规则,从而能显式表达预算与延迟约束。 摘要明确说明 JOVE 通过求解一系列逐查询混合整数线性规划来做出执行与验证决策,并列出随机、初始未知的服务质量、调用成本与执行时间这一设定。

用验证反馈在线更新任务相关的 LLM 质量估计,并加入信息增益奖励把学习价值纳入分配决策。 把“探索”以信息增益项的形式直接写进分配目标,使系统在利用当前最优执行器与获取未来有用信息之间做显式取舍。 摘要说明在线学习更新任务相关质量估计、信息增益奖励纳入分配决策,并在自然假设下建立次线性的质量学习遗憾。

在四个推理基准上,JOVE 相对标准推理基线取得竞争性准确率,同时把平均成本与延迟降低至少 3.17 倍。 把准确率之外的资源指标(成本与延迟)作为与准确率并列的评估维度,给出量化的资源节省幅度。 摘要报告四个推理基准上的结果,并给出“至少 3.17 倍”的成本与延迟下降幅度;摘要未列出各基准名称、基线配置细节或逐项数值。

启示与展望

该工作面向把复杂推理查询分解为有向无环任务图、并跨异构 LLM 执行的在线服务场景,适用于存在长期预算上限与单查询延迟约束、且各 LLM 对具体子任务的服务质量、调用成本与执行时间初始未知的部署环境。它使系统能够在执行与付费验证之间分配资源,并让验证反馈持续改善后续分配,因此对需要控制推理成本与响应时间、又希望借助较小模型完成复杂任务的工程团队具有直接参考价值。理论结果是在“一组自然假设”下建立的次线性质量学习遗憾,实证结论来自四个推理基准上与标准推理基线的对比。

摘要未说明四个推理基准的具体名称、标准推理基线的具体配置,也未给出准确率、成本与延迟的逐项数值,因此“至少 3.17 倍”的降低幅度在何种基准与何种预算、延迟约束下取得,仍需在正文中确认。次线性质量学习遗憾所依赖的“自然假设”具体内容、验证费用的量级与验证频率的设定,摘要中未展开。此外,验证本身可能出错这一情形对分配决策的影响,以及长期预算与单查询延迟约束之间的取舍边界,属于读者可继续关注的方向。

来源