arXiv 2026年10月5日GRAFT 提出一种持续多教师知识蒸馏框架,把已蒸馏模型当作教师以保留旧能力,同时让当前学生联合学习旧模型与新到教师,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 来调和异构教师的表示几何,从而得到一个可持续扩展的单一骨干,统一图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言五个领域,且每获得一项新能力只需一次蒸馏而非对全部教师重新联合蒸馏。GRAFT 提出一种持续多教师知识蒸馏框架,把已蒸馏模型当作教师以保留旧能力,同时让当前学生联合学习旧模型与新到教师,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 来调和异构教师的表示几何,从而得到一个可持续扩展的单一骨干,统一图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言五个领域,且每获得一项新能力只需一次蒸馏而非对全部教师重新联合蒸馏。GRAFT 用持续多教师蒸馏让单一骨干依次吸收五个视觉基础模型能力,新增能力只需一次蒸馏GRAFT 提出一种持续多教师知识蒸馏框架,把已蒸馏模型当作教师以保留旧能力,同时让当前学生联合学习旧模型与新到教师,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 来调和异构教师的表示几何,从而得到一个可持续扩展的单一骨干,统一图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言五个领域,且每获得一项新能力只需一次蒸馏而非对全部教师重新联合蒸馏。GRAFT 提出一种持续多教师知识蒸馏框架,把已蒸馏模型当作教师以保留旧能力,同时让当前学生联合学习旧模型与新到教师,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 来调和异构教师的表示几何,从而得到一个可持续扩展的单一骨干,统一图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言五个领域,且每获得一项新能力只需一次蒸馏而非对全部教师重新联合蒸馏。