OmniEdu 用 6.9999 万条能力导向指令微调 4B/9B/27B 模型,在课程定位、K12 解题与教学辅导三类基准上全面超过各自基座
核心概要
北京大学、中国科学院大学与中关村学院的研究者构建了面向 K–12 学习与教学的开源基础模型家族 OmniEdu,用围绕学科能力、课程定位、诊断推理、教学行动与支架四类能力组织的指令微调语料(最终 69,999 条样本、15.96M 监督回复 token,其中教育专用 60,951 条、约 12.0M token),对 4B、9B、27B 三个基座做全参数监督微调,并在课程定位、K–12 解题与教学辅导基准上报告了各规模一致提升,其中 OmniEdu-27B 在 K12-Bench 达 63.12% EM / 76.69% F1、MathFish 85.89%、EDUMATH 86.95% MaC、MathTutorBench Scaffold 78
深度剖析
提出以四类能力(学科能力、课程定位、诊断推理、教学行动与支架)组织教育监督的开源模型家族 OmniEdu,覆盖 4B、9B、27B 三个规模。 此前教育模型多专攻解题或辅导之一,训练混合常按来源或任务组织,未显式平衡这些能力;该工作把能力分类学同时作为数据构建与评测的共同语言。 论文给出完整的能力定义、数据来源映射与三规模模型,并在三类教育基准上做基座对照;评测遵循各基准官方协议与指标。
构建可复现的能力导向数据流水线:确定性清洗与评测去污染、LLM 语义审计与改写、任务特定质量打分、token 预算的多样性选择、教学指令分配,把约 1.34M 教育样本压缩为 60,951 条高质量样本(约 12.0M 监督回复 token),再加 9,048 条通用指令样本,合计 69,999 条、15.96M token。 相对按来源或学科混合数据的做法,该流水线为每条样本指定单一主能力与 20 类教学系统指令之一,把“内容”与“期望的回复行为”分离。 论文逐阶段报告样本量变化(870,711 → 440,100 → 121,318 → 60,951),并说明审计用 Qwen3.5-122B-A10B-FP8、细粒度打分用 GPT-5.6-Terra、多样性选择用 BGE-M3 上的 k-center 贪心。
跨规模评测显示教育导向微调在课程定位、K–12 解题、教学辅导三个维度上对每个规模都优于对应基座。 提升不限于答案正确率:K12-Bench 的 EM 由 52.11% 升至 63.12%(27B),EDUMATH MaC 在 4B/9B/27B 上分别提升 20.80、15.40、16.35 分,MathTutorBench Scaffold 胜率在 4B 与 9B 上分别提升 55.37 与 61.26 分,LongTutor 证据均值在 27B 上由 36.80% 升至 78.20%。 结果以基座—微调配对呈现,覆盖 K12-Bench、MathFish、EDUMATH、GAOKAO-Bench、EXAMS-V、MDK12-Bench、MathTutorBench、TutorBench、LongTutor,并附完整分项表。
用 IFEval、GPQA、MMMU-Pro 做通用能力辅助诊断,报告教育专精未伴随通用能力的普遍损失。 把“专精的代价”作为可审计的对照项,而非只报告教育基准增益。 MMMU-Pro 总体准确率在 4B、9B、27B 上分别由 50.46%→52.60%、58.38%→60.75%、64.97%→67.98%;论文同时说明各学科变化不一。
启示与展望
该工作面向 K–12 学习与教学场景,模型规模为 4B、9B、27B,训练为全参数监督微调(LLaMA-Factory,最大序列长度 32,768,3 个 epoch)。它适用于需要课程定位、错误诊断与支架式辅导的教育助手构建者,以及希望复用其数据流水线的研究者;论文同时公开了项目网站、数据集与三个模型权重。评测范围限于论文所列的课程定位、K–12 解题与教学辅导基准,以及 IFEval、GPQA、MMMU-Pro 三项通用诊断。
论文指出知识状态诊断仍相对困难,OmniEdu-27B 与 OmniEdu-9B 的诊断准确率为 54.04% 与 53.55%,作者称“relatively low accuracies indicate that knowledge-state diagnosis remains comparatively challenging”。MMMU-Pro 的变化按学科而异,论文只给出总体提升。此外,部分开源教育基线不支持图像输入,图像相关样例只接收文本部分,这一设置对跨模型比较的影响值得读者留意。数据流水线中语义审计与细粒度打分依赖特定大模型(Qwen3.5-122B-A10B-FP8、GPT-5.6-Terra),其可复现性取决于这些模型的可获得性。论文正文提到完整分项结果放在附录,若只读正文摘要,部分子集细节需回到附录核对。
