arXiv 2026年10月6日该工作提出 JEVal 双语决策基准(36 个数据集、10 个领域、11,257 个实例),评测 25 种配置后发现通用决策模型在证据充分时接近强思考型 LLM,但在专业知识、概率校准、精确计算与长上下文上较弱,且局部决策优势在长程智能体与社会模拟中会被系统级误差抵消;作者进一步用首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 训练出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,典型查询约 0.1 秒。该工作提出 JEVal 双语决策基准(36 个数据集、10 个领域、11,257 个实例),评测 25 种配置后发现通用决策模型在证据充分时接近强思考型 LLM,但在专业知识、概率校准、精确计算与长上下文上较弱,且局部决策优势在长程智能体与社会模拟中会被系统级误差抵消;作者进一步用首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 训练出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,典型查询约 0.1 秒。研究团队发布 JEVal 双语决策基准并训练出 InnerJev-27B,在 11,257 道题上准确率 79.24% 超过 Jev 的 78.38%,单次前向约 0.1 秒该工作提出 JEVal 双语决策基准(36 个数据集、10 个领域、11,257 个实例),评测 25 种配置后发现通用决策模型在证据充分时接近强思考型 LLM,但在专业知识、概率校准、精确计算与长上下文上较弱,且局部决策优势在长程智能体与社会模拟中会被系统级误差抵消;作者进一步用首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 训练出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,典型查询约 0.1 秒。该工作提出 JEVal 双语决策基准(36 个数据集、10 个领域、11,257 个实例),评测 25 种配置后发现通用决策模型在证据充分时接近强思考型 LLM,但在专业知识、概率校准、精确计算与长上下文上较弱,且局部决策优势在长程智能体与社会模拟中会被系统级误差抵消;作者进一步用首 token 决策读出与推理到读出自我蒸馏,从开源 LLM 训练出 InnerJev-4B 与 InnerJev-27B,其中 InnerJev-27B 在 JEVal 上准确率 79.24%,略高于 Jev 的 78.38%,典型查询约 0.1 秒。