复旦团队用千万级中文决策数据训练Chinese-Jev,通用任务准确率69.20%并比Jev快约20倍
核心概要
该工作提出Chinese-Jev:用统一数据处理流程把异构中文标注转成候选选项上的概率目标,先以1000万条通用中文决策预训练轻量编码器模型,再分别针对医疗、法律、金融微调,并发布含307,900条留出决策的CJ-Bench;预训练后在通用任务上准确率69.20%,相对闭源Jev提升1.24%,期望校准误差从11.45%降至3.78%,延迟14毫秒,医疗微调后准确率比Jev高4.0%,三个专业领域平均达到Jev的92%,平均延迟15毫秒,INT8量化模型可在手机浏览器上约1秒完成一次决策。
深度剖析
提出Chinese-Jev,一个面向中文决策的System One模型,支持choice(选项选择)、noul(命题判断)和score(有序评分)三类决策,通用模型与医疗、法律、金融三个专家模型共享同一架构与决策接口,单次前向即可输出候选概率。 此前Jev类模型以英文为主,中文方向已有发布多集中在足球问答或双语编码器;该工作把统一决策接口扩展到覆盖八个任务类别的通用中文场景并独立适配三个专业领域。 论文给出架构细节:以mmBERT-base为骨干(22层、隐藏维度768),加两层决策Transformer与共享候选打分器,约3.22亿参数,在八张NVIDIA H200上全参数微调。
设计可复用的数据构建流程,把单答案题与类别标签、真假与命题标注、离散与连续评分、多答案题分别转换为候选选项上的概率分布,并做决策级去重与类型预算配比,最终得到1000万条通用中文决策(choice、noul、score各约三分之一)以及医疗300万、法律与金融各2.4万条领域语料。 已有中文资源(如CLUE、C-Eval、CMMLU、COIG-CQIA)提供的是分类标签、指令数据或评测题,而该流程把类别标签、命题判断与有序评分统一到同一候选打分形式,并对连续评分保留评分者均值与分歧的软目标。 论文列出20个公开来源的贡献占比(如T2Ranking占23.28%、ASAP占13.19%)以及10,700条规则合成决策,并说明同一来源材料被划入同一数据划分以降低泄漏。
发布CJ-Bench,含307,900条留出决策(通用100,000、医疗200,000、法律4,300、金融3,600),在统一协议下评测准确率、校准与延迟。 此前中文评测多聚焦生成式模型的知识与推理,该基准把决策准确率、期望校准误差与端到端延迟放在同一协议下比较,并覆盖通用与三个专业领域。 论文说明通用子集按choice、noul、score约等预算从测试池无放回抽取,单一来源最多占15%,并按候选数、标签与输入长度分层;ECE用15个等宽分箱计算。
实验显示:预训练后通用准确率69.20%,比闭源Jev高0.85个百分点(相对1.24%),ECE从11.45%降至3.78%,延迟14毫秒;领域微调后医疗准确率87.65%,比Jev高3.36个百分点(相对4.0%),法律60.10%、金融64.72%,三域平均达到Jev的92%,平均延迟15毫秒;INT8量化模型在iPhone 15 Pro上约1秒完成一次决策。 相对多语言初始化Laya Multilingual,中文预训练把准确率从40.22%提升到69.20%(+28.98个百分点),ECE从23.04%降到3.78%;领域微调相对通用模型在医疗、法律、金融分别提升47.88、21.34、29.33个百分点。 结果来自CJ-Bench各子集,所有模型使用相同保留上下文与候选;延迟为单张H200、批大小1、预热后的中位端到端时间,与托管Jev API的比较包含网络往返,论文对此作了说明。
启示与展望
该工作面向需要从候选中做选择、判断命题真假或给出有序评分的中文应用,例如请求路由、相关性判断与答案选择;通用模型适用于八个任务类别的中文决策,医疗、法律、金融三个专家模型分别适用于对应领域,且共享同一接口,便于在不改变调用方式的前提下替换领域模型。INT8量化版本面向手机浏览器本地推理,输入文本不出设备。论文表示将开源模型、训练数据、基准与数据构建代码,因此后续工作可在同一数据流程上扩展新的中文任务或领域,也可在CJ-Bench上继续比较准确率、校准与延迟。
法律与金融专家模型准确率仍低于Jev,论文把这一点列为后续工作方向;领域微调后校准改善并不一致,法律领域ECE从15.37%升至17.45%,专家模型平均ECE为12.08%,高于Jev的5.57%。与托管Jev API的延迟比较包含网络往返,论文说明这反映端到端响应时间而非纯模型推理速度。去重的近重复筛查只覆盖检查时可获得的留出文本,跨全量训练语料的改写未被穷尽合并。移动端结果基于单一机型与系统版本的浏览器原型,约1秒的延迟是否在其他设备上保持,以及软目标评分决策未纳入准确率与校准统计所带来的影响,都是读者可以继续关注的问题。
