从被忽视到被探索:用多视角混合恢复序列推荐中的物品关系
核心概要
该工作通过实证分析指出基于点积的自注意力存在“相似性偏置”,会系统性忽视对目标预测有因果贡献的异质物品关系,并提出 PRISM 模块,用 K 个视角透镜在 Affinity View 与 Contrast View 两种互补视角下校准注意力,在七个真实基准上持续优于现有基线。
Figure 4 . PRISM framework: PRISM performs item-wise multi-perspective analysis followed by relational insight synthesis. All learnable parameters are shared across lenses for efficiency, while the outputs differ solely by relational perspective.
arXiv深度剖析
论文识别并实证刻画了自注意力中的“相似性偏置”:注意力分数与物品对目标预测的因果重要性之间的 Spearman 秩相关 ρ(A,I) 在 SASRec 上于 Toys 与 Beauty 两个数据集均为负,Align@1 同样偏低。 此前工作已报告注意力分布存在错误,但本文把原因归因于点积相似度本身,并在四类 transformer 基线(普通自注意力、注意力校准、意图建模、注意力头内 MoE)上系统验证该错位持续存在。 在 Amazon Toys 与 Beauty 的 1,000 条测试序列上,对五种模型计算 ρ(A,I) 与 Align@1;因果重要性由掩码某位置后目标概率的下降量 I_j 定义,属于反事实式度量。
反事实注意力干预显示被忽视的位置确实携带有用信号:提升注意力最低的 20% 位置(C3)在全部基线与两个数据集上均使目标置信度上升,而只提升“被忽视且因果重要”的位置(C4)一致优于盲目提升(C3)。 这把“注意力错位”从诊断推进为可操作的改进方向,说明有用关系分散在多种关系侧面而非集中于单一类型。 在推理阶段直接修改最后一层注意力 logits,提升强度 β_boost = 5.0,以 Δ_confidence(%) 衡量目标概率的相对变化;连随机扰动(C2)也带来明显提升,说明基线注意力与模型实际依赖的物品关联很弱。
PRISM 用 Semantic Anchor Router 为每个物品分配语义组与 Primary Semantic Anchor,再由 K 个 Perspective Lens 通过 Semantic Focus Mask 与 Relational Boost Signal 校准注意力 logits,使同一物品恰好在一个 Affinity View 和 K−1 个 Contrast View 下被分析。 与依赖可学习矩阵、缺少显式关系引导的注意力校准不同,PRISM 以物品间关系作为显式引导;与在注意力头内做 MoE 的做法不同,它在每个视角内重新校准注意力,从而正面处理相似性偏置。 方法层面给出完整公式(路由 logits、语义组成比、掩码、提升信号、Perspective Guided Attention 与合成),并说明所有可学习参数在各透镜间共享以保持效率。
训练目标由序列级偏好对比损失与协同一致性损失组成:前者用同目标增强构造正对,并以随机视角掩码避免过度对齐;后者用对称 KL 散度约束各透镜输出在物品空间上保持一致而不丧失多样性。 把物品级关系分析与序列级偏好建模结合,同时显式防止多视角表示坍缩为单一模式。 两项损失均给出明确公式与掩码机制(伯努利掩码、log-mask 操作、温度 τ、批大小 B),属于设计层面的论证;摘要报告在七个真实基准上持续优于当前最优基线。
启示与展望
该工作面向序列推荐场景,即从用户历史交互序列预测下一个物品;其诊断实验在 Amazon Toys 与 Beauty 两个数据集、1,000 条测试序列上完成,方法被设计为可插入 L 层 transformer 中的 L−1 个模块,因此适用于以自注意力为骨干的推荐模型。对希望改进注意力选择机制、而非单纯扩大模型或特征规模的研究者与工程团队,这一视角提供了可复用的设计思路;摘要所述七个真实基准的结果指向其在多种真实场景下的稳健性。
读者可能仍会关注:相似性偏置在不同领域与不同规模物品集上的表现是否一致;语义组数量 K 与视角丢弃率 ρ 等超参数如何影响双视角的平衡;反事实干预中固定提升强度 β_boost = 5.0 的结论在更细粒度的提升幅度下是否保持;以及七个基准上的具体指标与消融细节,需要结合原文图表进一步确认。
