跳到主要内容
返回时间线
arXiv来源发表:

多模态情感基础模型的情感适配研究:FFN 比注意力模块更高效,门控投影在联合优化中形成专门化通路

相关研究与后续进展

核心概要

该工作对 13 个情感模型实例(涵盖九种模型设计、多种规模、任务与训练范式)做模块级分析,并在代表性模型上做受控功能分析,发现情感适配呈现一致但非排他的功能组织:在匹配可训练参数预算下仅调 FFN 一致优于仅调注意力模块并接近调全部主要 Transformer 投影,且 gate、up、down 投影在联合优化后功能分化,gate_proj 尤为突出,据此提出的 GET 方法以 19.3-24.5% 的可训练参数保留 96.2-98.0% 的性能。

Source-provided article image: Understanding Affective Adaptation in Multimodal Foundation Models: Emergent Functional Specialization
Figure 1 ·

Figure 1 : Schematic of the Transformer block analyzed in this work. Colored boxes denote the projection pathways considered in our module-level analysis.

arXiv

深度剖析

情感适配在模块层面呈现一致但非排他的功能组织:在匹配可训练参数预算下,仅适配前馈网络(FFN)在所有评估设置中一致优于仅适配注意力模块,并在平均意义上接近调优全部主要 Transformer 投影的性能。 此前对多模态情感基础模型内部架构中情感能力如何涌现缺乏系统认识,该工作以跨 13 个模型实例、九种设计、多规模、多任务与多训练范式的模块级分析,把 FFN 识别为特别高效的适配基底。 证据来自跨 13 个情感模型实例、九种模型设计的模块级比较,并在匹配可训练参数预算下进行对照,覆盖多种规模、任务与训练范式。

gate、up、down 三个投影在单独适配时容量相当,但在联合优化后其学习到的功能贡献出现分化;模块恢复与定向干预识别出 gate_proj 是尤为突出的通路,检查点分析显示这种分化随训练过程逐步形成。 该工作将这一现象刻画为“涌现功能分化”:通路层面的不同角色无法由单独适配容量完全解释,而是在联合情感适配中产生,这为理解情感微调是弥散改变还是组织为功能专门化通路提供了证据。 证据来自模块恢复、定向干预与检查点分析等受控功能分析,在代表性模型上进行,并显示分化随训练进程发展。

基于上述发现提出的 Gate-Focused Efficient Tuning(GET)在仅使用 19.3-24.5% 可训练参数的情况下,保留了调优全部主要 Transformer 投影所获性能的 96.2-98.0%。 该结果把对功能分化的机制性认识转化为一种参数高效的适配策略,说明聚焦门控通路可在显著降低可训练参数量的同时维持接近全投影调优的性能。 证据为 GET 与调优全部主要 Transformer 投影之间的性能与可训练参数量对比,报告了 96.2-98.0% 的性能保留与 19.3-24.5% 的参数占比。

启示与展望

该工作面向多模态情感基础模型的适配机制研究与参数高效调优:其结论适用于所分析的 13 个情感模型实例、九种模型设计及相应规模、任务与训练范式,并在代表性模型上通过受控功能分析加以验证。对希望降低情感适配可训练参数量、或希望理解 FFN 与门控通路在情感适配中作用的研究者与工程师,GET 提供了可直接参照的适配策略。

所加载文本为摘要级内容,未包含具体数据集、评价指标、模型规模细节与统计检验信息,因此无法判断不同任务与规模下结论的稳健程度;涌现功能分化在训练过程中的形成时点与 gate_proj 突出性的机制解释仍有待展开;GET 在情感任务之外或其他模态组合上的表现尚属开放问题。

来源