GRAFT 用持续多教师蒸馏让单一骨干依次吸收五个视觉基础模型能力,新增能力只需一次蒸馏
相关研究与后续进展核心概要
GRAFT 提出一种持续多教师知识蒸馏框架,把已蒸馏模型当作教师以保留旧能力,同时让当前学生联合学习旧模型与新到教师,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 来调和异构教师的表示几何,从而得到一个可持续扩展的单一骨干,统一图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言五个领域,且每获得一项新能力只需一次蒸馏而非对全部教师重新联合蒸馏。
深度剖析
提出持续多教师蒸馏框架 GRAFT,使统一骨干能从开放式序列的基础模型中逐步获取能力。 既有方法假设教师集合固定,加入新教师需对整个教师集合重复昂贵的联合蒸馏;GRAFT 改为在新教师到来时把先前已蒸馏模型作为教师以保留已学能力,学生同时向旧模型与新教师学习。 摘要层面给出框架设计与动机,说明其把增量获取新能力的代价降为一次蒸馏而非完整重蒸馏;未提供具体数据集、指标数值或消融结果。
提出 Teacher Specific Readout Tokens,为每个教师提供对共享编码器的独立读出。 针对异构教师之间表示几何不兼容的问题,用教师专属读出而非共享读出接口来承载不同教师的表示。 摘要将其列为方法组件并说明其作用是调和表示几何差异;未给出该组件的定量对比。
提出 Geometry Agnostic Relational Loss,通过匹配图文相似度结构而非原始特征值来对齐视觉-语言教师。 把视觉-语言教师的对齐目标从原始特征值匹配改为关系结构匹配,以绕开几何不兼容。 摘要说明该损失的对齐对象是图像-文本相似度结构;未报告具体损失数值或对齐效果指标。
给出 GRAFT 模型,单一可持续扩展骨干统一五个领域并均取得强性能。 相对分别维护多个专用基础模型的现状,GRAFT 把图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言能力汇聚到一个骨干中。 摘要称其在全部五个领域均表现强劲,但未列出任何基准名称、数值或与各专用教师的逐项比较。
启示与展望
该工作面向需要把多个视觉基础模型能力整合进单一骨干、且教师会陆续加入的场景,例如图像理解、2D 稠密预测、3D 人体姿态估计、3D 视觉与视觉-语言的统一建模。按摘要所述,其设计目标是让新增能力只需一次蒸馏而非对全部教师重新联合蒸馏,因此适用于教师集合开放、增量扩展比一次性固定集合更常见的工程与研究环境。摘要未说明适用模型规模、数据规模或算力条件,这些需以原文为准。
摘要未给出任何基准名称、性能数值、教师数量与顺序、蒸馏轮次或计算开销,因此无法判断“强性能”的具体幅度,也无法确认新增能力时旧能力保持的程度。Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 各自的贡献大小、以及教师到达顺序对结果的影响,均需在正文中查看。若只依据当前文本,读者应把结论视为作者报告的设计目标与总体表现,而非已量化的对比结论。
