IndicBankBench 用 799 个印度零售银行案例测出:十一个模型严格三次全过率仅 43.7%–58.2%,而至少一次成功率高达 60%–74%
核心概要
作者发布 IndicBankBench——一个面向印度零售银行的 799 案例基准,覆盖五个业务域、一个能力/拒答域与二十条主轴,按安全、动作与工具使用、回复充分性、建议质量四阶段评分,工具使用与多数安全检查为确定性判定,仅对语义回复充分性使用 LLM 评判、对写入前确认的模糊情形使用窄解析器;对十一个模型每案例重复三次后,严格 pass3 为 43.7%–58.2%,至少一次成功率为 60%–74%,两者相差 10.8–21.4 个百分点。
深度剖析
基准把银行助手交互拆成安全、动作与工具使用、回复充分性、建议质量四个有序阶段,并记录交互首次失败的关卡。 既有工具调用基准多以聚合准确率或成功率概括表现,而这里把失败定位到具体阶段,使“编造答案”与“索要已有信息”这类不同错误可被区分。 799 个案例、32 个工具、20 条主轴;安全与动作检查为确定性,回复阶段由 GLM-5.2 在温度 0、种子 42 下评判,写入前确认的模糊情形交由单独的窄解析器给出是/否信号,最终通过与否由评分代码而非任一模型决定。
重复三次采样后,严格 pass3 与至少一次成功率之间存在明显落差。 此前工作用重复采样衡量至少一次成功,这里把重复试验用于区分“偶尔完成”与“可靠完成”,并给出不一致与全部失败的案例计数。 十一个模型各 2,397 条轨迹;严格 pass3 从 43.7%(349/799,Gemma 4 E4B IT)到 58.2%(465/799,DeepSeek-V4-Pro-0813),至少一次成功率从 60.1% 到 74.3%,落差 10.8–21.4 个百分点;GLM-5.3-Flash 至少一次成功率最高(594/799,74.3%)但严格率仅 56.8%。
案例级诊断显示不同系统的失败方式不同,且前五名之间未检测到可靠差异。 聚合分数无法区分过度追问与贸然行动,这里用逐轴结果与关卡计数呈现差异。 前五名严格 pass3 落在 56.8%–58.2%,相差 11 个案例;十组配对比较的 bootstrap 区间均含零,精确 McNemar 检验在未校正与 Holm 校正后均不显著;wrong-information 轴是十一个模型中七个的最低分轴,142 个案例中无一模型通过超过 40.1%;26,291 条可判定轨迹中 3,390 条(12.9%)通过全部安全与动作关卡却未过回复关,1,497 条(5.7%)通过回复关却至少失败一个安全或动作关卡。
作者给出九种失败模式的描述性分类,并公开案例、模拟环境与评测框架。 分类把反复出现的失败归入“轻信表面”“知与行脱节”“行动校准失当”三族,便于识别而非仅排名。 分类基于另一次五模型、温度 0、每案例一次的筛查运行的案例级关卡记录与转录,作者明确说明它描述失败如何发生,不是十一个模型评测的频率估计;代码与案例数据公开于 github.com/npci/IndicBankBench。
启示与展望
该基准面向希望诊断银行助手在何处失败的评测者与开发者,适用于英语、印度零售银行、合成客户状态与确定性模拟工具的环境;作者公开案例、模拟环境与评测框架,并说明可用于比较同一案例与评测设置下的助手或提示改动,改动案例或评分规则则需新版本并重跑。
回复充分性依赖 LLM 评判,写入前确认的模糊情形依赖窄解析器,而盲审仅覆盖 40 条转录且来自最初的八个模型,因此一致率未必适用于全基准;每案例三次重复只能有限地估计运行间可靠性,结果也可能受服务端点、服务行为与推理控制影响;案例使用合成客户状态与模拟工具,未覆盖全部生产策略、运营故障或客户偏好,也未确立跨银行、跨司法辖区、印度语言、语码混用、无障碍需求或生产授权与欺诈监控的表现;九种失败模式来自另一次五模型筛查运行,是描述性分类而非频率估计;本次读取为全文,但附录中的提示与评分文本以占位形式呈现,具体指令内容无法在此核对。
