arXiv 2026年10月5日该工作提出自适应互蒸馏(AMD),联合训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重的候选调整,并用逐任务验证分数为每个任务和迁移方向选择调整,在六个基准和三个 LLM 骨干上两个 AMD 模型均高于同采样策略的 SFT 基线并优于所评估的任务平衡方法,合并两模型可进一步提升平均基准分数并得到单一推理模型,合并模型在三个骨干上平均超过多任务 SFT 2.91 分。该工作提出自适应互蒸馏(AMD),联合训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重的候选调整,并用逐任务验证分数为每个任务和迁移方向选择调整,在六个基准和三个 LLM 骨干上两个 AMD 模型均高于同采样策略的 SFT 基线并优于所评估的任务平衡方法,合并两模型可进一步提升平均基准分数并得到单一推理模型,合并模型在三个骨干上平均超过多任务 SFT 2.91 分。AMD 用双模型互蒸馏与逐任务权重选择,在六个基准和三个骨干上超过多任务 SFT,合并后平均提升 2.91 分该工作提出自适应互蒸馏(AMD),联合训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重的候选调整,并用逐任务验证分数为每个任务和迁移方向选择调整,在六个基准和三个 LLM 骨干上两个 AMD 模型均高于同采样策略的 SFT 基线并优于所评估的任务平衡方法,合并两模型可进一步提升平均基准分数并得到单一推理模型,合并模型在三个骨干上平均超过多任务 SFT 2.91 分。该工作提出自适应互蒸馏(AMD),联合训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重的候选调整,并用逐任务验证分数为每个任务和迁移方向选择调整,在六个基准和三个 LLM 骨干上两个 AMD 模型均高于同采样策略的 SFT 基线并优于所评估的任务平衡方法,合并两模型可进一步提升平均基准分数并得到单一推理模型,合并模型在三个骨干上平均超过多任务 SFT 2.91 分。