跳到主要内容
返回时间线
arXiv来源发表:

研究团队发布 JEVal 双语决策基准并训练出 InnerJev-27B,在 11,257 道题上准确率 79.24% 超过 Jev 的 78.38%,单次前向约 0.1 秒

相关研究与后续进展

核心概要

该工作提出 JEVal 双语决策基准(36 个数据集、10 个领域、11,257 个实例),评测 25 种配置后发现通用决策模型在证据充分时接近强思考型 LLM,但在专业知识、概率校准、精确计算与长上下文上较弱,且局部决策优势在长程智能体与社会模拟中会被系统级误差抵消;作者进一步用首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 训练出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,典型查询约 0.1 秒。

Source-provided article image: General Decision Models: Benchmarking and Insights Beyond Jev
Figure 1 ·

Figure 1: A conceptual view of general and decisional intelligence. The left panel contrasts open-ended language capabilities with decision-making in constrained output spaces. The right panel illustrates the evolution from expert systems and task-specific models to encoder models, chat and reasoning LLMs, and general decision models represented by Jev.

arXiv

深度剖析

提出 JEVal:一个把多样任务统一为有限决策空间(choice、noul、score 三种格式)的双语基准,含 11,257 个实例、36 个数据集、58 个子任务、10 个领域,其中英文 9,457 条、中文 1,800 条。 以往对决策模型的评测多集中在单一任务或单一可靠性维度,JEVal 把知识推理、长上下文、智能体动作选择、医学、法律、金融、个性化偏好等统一到同一决策接口下,并配以准确率、ECE、概率向量平方误差与延迟四类指标。 基准构建过程包含两位人类专家审核任务定义与样本、剔除不适合决策形式化的实例、仅保留参考答案经人工核验的数据集,并用精确字符串匹配去重后从 202K 候选中按子任务最多 200 条重采样;输入长度控制在 20,480 token 预算内,候选选项上限 255。

系统刻画了通用决策模型的能力边界:在证据包含于输入时最具竞争力,在需要专业知识、忠实不确定性估计与精确计算时明显减弱。 此前对 Jev 类模型的评测多停留在单任务层面,本文通过 JEVal 与四个各 100 题的受控诊断任务,把“选对最可能结果”与“估准其概率”区分开来。 在 JEVal 上,最强决策模型与领先思考型 LLM 的总体准确率相差三点以内;在医学、金融、法律领域,最佳决策模型比最佳生成式 LLM 低三到六分。在概率任务中,Jev 在全部 100 个先验题上选中众数,但平均给真实众数分配 89.35% 概率,而真实分布为 35.60%;后验题上其两个最高概率选项合计占 90.30%。在重复小数除法与面积反演上,Jev 精确答对 44% 与 39%,但分别有 97% 与 73% 的答案落在金标准一个整数以内。

把评测从静态基准推进到动态系统:在 -bench 工具调用智能体中,用 Jev 做下一步动作选择把中位回合时间从 267.1 秒降到 156.1 秒,但任务成功率从 77.6% 降到 66.1%,P95 延迟从 695.5 秒升到 1,009.5 秒;在大规模社会模拟中,决策模型以极低推理成本接近强生成式 LLM 的个体预测,但聚合估计误差与系统性偏差更大。 以往工作很少同时考察局部决策精度与系统级行为,本文用同一套匹配协议(相同用户模拟器、温度 0、环境与奖励校验器)分离出动作选择组件的影响,并在 ElectionSim 中把约 33 万选民交给 InnerJev-27B 驱动。 智能体实验覆盖 Retail 115 个任务与 Airline 50 个任务,共 330 个交互回合,每回合最多 30 轮;失败轨迹显示错误来自动作选择不当或后续工具参数生成错误,二者都会触发重复查询与重试。社会模拟中 InnerJev-27B 正确判定 51 州中的 47 个与 15 个摇摆州中的 12 个,各比原 GPT-4o-mini 流水线多一个,但票份额 MAE 为 6.52 对 3.06,偏差 +3.73 对 +2.31。个体调查预测上 InnerJev-27B 总体准确率 39.87%,仅比最佳配置低 0.54 分,而平均延迟为 8.36 秒对 211.65 秒。

提出首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 构建出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,且 ECE 与概率向量平方误差为全部 25 种配置中最低。 Jev 仅通过托管 API 提供且训练配方未公开;本文证明无需标注答案或更强教师,仅用模型自身推理链末端的答案分布即可把推理内化到单次前向的首 token 决策中,且冻结嵌入与输出层使推理成本与未训练读出相同。 训练使用 39,279 道题、单轮 epoch、BF16 精度、全秩更新注意力与 MLP 投影(LoRA 版本结果相差不到一分);在单张 H100 上,InnerJev-4B 与 InnerJev-27B 的中位延迟分别约 58.7 毫秒与 112.2 毫秒。在未参与训练与模型选择的新构造问题上,InnerJev-27B 比未训练读出提升约七分。

启示与展望

该结果面向需要在有限输出空间上做结构化判断与选择的研究者与工程团队:当决策可从输入证据直接判定时,通用决策模型与 InnerJev 系列可作为低延迟、低成本的组件替换 Jev;当需要专业知识、精确数值计算或忠实概率估计时,应保留生成式 LLM 的思考模式或采用异构组合。InnerJev 的读出适用于 choice、noul、score 三种格式,训练数据只需带明确选项集的问题,因此可直接迁移到意图识别、有害请求判断、情感分类等标签选择类任务。社会模拟场景下,每个选民只需两次前向且不生成 token,适合需要成千上万并行智能体的宏观模拟。

读者仍需关注几点:JEVal 中金融领域仅 59 个实例、社会科学的 GlobalOpinionQA 与个性化偏好类任务准确率普遍偏低,这些领域的结论受样本规模与任务难度影响较大;智能体实验只覆盖 Retail 与 Airline 两个环境,作者也说明轨迹审计识别出动作错误与集成层空响应但未分离出主导原因;社会模拟中 InnerJev-27B 的票份额误差约为原流水线的两倍,且所有运行都高估民主党份额,这一偏差与生成式智能体一致,说明从生成转向决策并未消除该倾向;训练集规模曲线显示 39,279 题之后增益停滞,作者将其归因于自写题目偏易且难以自检,因此进一步扩展自我蒸馏可能依赖更难且更可靠的问题来源;此外开发集参与检查点选择使绝对分数偏乐观,曲线支持总体趋势但不支持拟合缩放律。

来源