CogAdapt用人类EEG与眼动信号选择代码模型适配模块,在LiveCodeBench上比全块微调提升10.86个百分点并减少约87%可训练适配参数
相关研究与后续进展核心概要
CogAdapt从人类阅读代码时的EEG与眼动数据中提取程序级与词元级先验,结合冻结MoE模型对每个编程任务的响应,为每个任务动态选择少量transformer块进行稀疏微调;在Qwen与GLM上,人类阅读行为与MoE计算呈现一致对应,方法在LiveCodeBench与BigCodeBench上取得最佳pass@1,其中LiveCodeBench较匹配的常规全块微调提升10.86与6.29个百分点,同时将可获梯度的适配参数减少86.21–87.21%。
Figure 1. Human attentional hotspots coincide with MoE computation at the same code regions
arXiv深度剖析
人类阅读代码时的注意力与EEG theta响应,与MoE代码模型在同一语义代码区域的计算强度呈正相关。 此前工作多将认知信号用于词元级损失加权或扫描路径模拟,本文首次系统检验人类响应与MoE路由及表示变化在相同代码区域上的对应关系。 在NoviceVsExpert语料(37名被试、32个Java程序、81个语义代码区域)上,跨两种MoE架构与四类代码类别,75.0%–83.3%的分析区域显示正相关(Spearman相关)。
人类处理需求与MoE计算的对应关系沿模型深度呈结构化分布,且不同架构由不同内部信号承载。 该结果说明并不存在单一普遍对齐的层,从而为按任务动态选择适配块提供了实证依据,而非固定选择某一层或全部层。 深度–时间热图比较五个模型计算信号与12个阅读阶段的EEG theta,并控制程序长度;Qwen在隐状态变化与残差整合上对应更清晰,GLM在专家选择置信度与MoE写入上对应更清晰。
将认知先验用于任务相关的稀疏适配,可在只更新约六个块的情况下提升代码生成准确率。 相比全块微调、固定CKA选块与随机选块,CogAdapt按任务选择不同块,并同时用EEG先验加权训练样本、用注意力先验加权代码词元。 在Qwen3-Coder-30B-A3B-Instruct与GLM-4.7-Flash上,LiveCodeBench pass@1由18.86%升至29.71%(Qwen)与由17.71%升至24.00%(GLM);BigCodeBench上达到37.73%与31.82%,均为最佳或并列最佳。
认知引导的稀疏适配在减少可获梯度参数的同时,也小幅降低训练时间与GPU能耗。 消融显示增益并非仅来自稀疏微调:全块、固定随机块与仅用模型信号选块的变体均低于完整方法,去除EEG或注视引导在多数设置下也降低性能。 每任务平均选择约6.1–6.6个块(对比47–48个),可获梯度适配参数由25.95–27.06M降至3.32–3.73M,减少86.21–87.21%;训练墙钟时间减少2.53–5.87%,估计GPU能耗减少2.12–4.55%。
启示与展望
该工作面向使用MoE架构的代码生成模型适配场景,适用于已有可迁移人类阅读语料、且下游任务为Python代码生成的情形;先验在训练前一次性构建,推理阶段不需要EEG、眼动或参考解,因此可直接用于标准部署流程。其结论针对所研究的Qwen与GLM两种骨干及LiveCodeBench与BigCodeBench两个基准,方法本身可被后续工作扩展到其他模型与任务。
人类–模型对应关系在不同架构间由不同内部信号承载,这一差异如何在更多模型家族中表现仍是开放问题;先验从Java阅读语料迁移到Python任务依赖句法对应,其覆盖范围值得进一步考察;此外,适配参数大幅减少但前向仍执行完整骨干,因此时间与能耗的下降幅度明显小于参数下降幅度,如何把适配稀疏性进一步转化为计算稀疏性(如条件块激活或早退)是后续方向。
