arXiv 2026年10月5日JOVE 是一个在线框架,把复杂推理查询分解为有向无环任务图并分配到异构 LLM 上执行,同时联合决定哪些中间输出送去付费验证;它通过求解逐查询的混合整数线性规划做执行与验证决策,用验证反馈在线更新任务相关的 LLM 质量估计,并以信息增益奖励把学习价值纳入分配,在长期预算与单查询延迟约束下取得次线性的质量学习遗憾,在四个推理基准上准确率与标准推理基线相当,平均成本与延迟至少降低 3.17 倍。JOVE 是一个在线框架,把复杂推理查询分解为有向无环任务图并分配到异构 LLM 上执行,同时联合决定哪些中间输出送去付费验证;它通过求解逐查询的混合整数线性规划做执行与验证决策,用验证反馈在线更新任务相关的 LLM 质量估计,并以信息增益奖励把学习价值纳入分配,在长期预算与单查询延迟约束下取得次线性的质量学习遗憾,在四个推理基准上准确率与标准推理基线相当,平均成本与延迟至少降低 3.17 倍。JOVE 联合分配执行模型与付费验证,在四个推理基准上保持竞争性准确率的同时把平均成本与延迟降低至少 3.17 倍JOVE 是一个在线框架,把复杂推理查询分解为有向无环任务图并分配到异构 LLM 上执行,同时联合决定哪些中间输出送去付费验证;它通过求解逐查询的混合整数线性规划做执行与验证决策,用验证反馈在线更新任务相关的 LLM 质量估计,并以信息增益奖励把学习价值纳入分配,在长期预算与单查询延迟约束下取得次线性的质量学习遗憾,在四个推理基准上准确率与标准推理基线相当,平均成本与延迟至少降低 3.17 倍。JOVE 是一个在线框架,把复杂推理查询分解为有向无环任务图并分配到异构 LLM 上执行,同时联合决定哪些中间输出送去付费验证;它通过求解逐查询的混合整数线性规划做执行与验证决策,用验证反馈在线更新任务相关的 LLM 质量估计,并以信息增益奖励把学习价值纳入分配,在长期预算与单查询延迟约束下取得次线性的质量学习遗憾,在四个推理基准上准确率与标准推理基线相当,平均成本与延迟至少降低 3.17 倍。