跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

MaskCoFT 用可学习掩码联合微调路由器与专家,使 Mixtral-8x7B 每 token 专家取数减少 23.7%、DeepSeek-V2-Lite 减少 10.1%

该工作提出 MaskCoFT,一种仅用交叉熵损失同时训练路由器与专家的掩码协同自适应微调方法:微调时用可学习二值掩码把每层 Top-K 路由限制到专家子集,使专家适应被重定向的 token,推理时该掩码作为软先验对专家重排序且所有专家仍可被选中;在模拟每层 4 个专家缓存的 Mixtral-8x7B 与 12 个的 DeepSeek-V2-Lite 上,每 token 专家取数相对基座模型分别减少 23.7% 与 10.1%,真实卸载系统服务中每输出 token 时间最多降低 16.4% 与 5.5%,九个基准上的平均准确率分别高出基座模型 0.92 与 0.53 分。