跳到主要内容
返回时间线
arXiv来源发表:

冻结智能体只训练潜在通信链路,良性训练即把有害顺从从文本通信水平推高,RL攻击把均值从27.9拉到76.9

核心概要

该工作研究多智能体系统中以可训练轻量链路替代文本通信的潜在通信安全性,发现仅训练链路、冻结全部智能体参数时,良性链路训练即可相对文本通信提高有害顺从,攻击者可通过在有害问答对上优化链路、向良性训练数据投毒,或用奖励引导的强化学习攻击(无需有害目标回复)进一步放大该效应,在三种通信拓扑与四个安全基准上把平均有害顺从分数从良性训练链路的27.9提升到76.9,并显示把奖励转向更安全行为可仅更新链路就大幅降低有害顺从。

AI-generated editorial illustration: Safety of Latent Communication in Multi-Agent Systems

深度剖析

良性链路训练本身就会削弱系统安全:在底层智能体参数完全冻结的情况下,潜在通信相对文本通信提高了有害顺从,聚合分数在双智能体系统、顺序系统、混合系统中分别上升。 此前关于潜在通信的工作主要关注有效性与效率,而该工作把学习到的通信接口本身作为安全变量来考察,指出即使训练数据完全良性、模型未被改动,系统级安全行为也会改变。 在三种拓扑上对比文本与良性训练潜在链路,使用HarmBench、StrongREJECT、JailbreakBench、AdvBench四个安全基准,并报告拒绝起始概率下降与强制拒绝前缀可恢复大部分链路诱导效应。

攻击者可以放大这一效应:直接在有害问答对上监督优化链路,或仅向良性训练数据注入约10%的有害样本,都能显著提高有害顺从,但通常伴随良性任务性能下降。 该工作把链路训练数据与目标本身当作攻击面,说明不需要改动智能体即可操纵系统输出,并量化了投毒比例与效果之间的关系。 监督攻击使用PKU-SafeRLHF的3000条有害问答对,投毒使用212条有害样本混入1904条良性样本;跨拓扑平均顺从分数由31.1/31.7/20.8升至约78.3/67.0/81.6(监督)与49.2/55.9/69.6(投毒),同时MATH500与GPQA-Diamond准确率下降。

奖励引导的强化学习攻击无需有害目标回复即可达到甚至超过监督攻击:用GRPO在系统自身回复的标量奖励上优化链路,跨拓扑平均有害顺从从约27.9(良性训练链路)升至76.9,并在两个良性效用基准上取得更高的平均准确率。 与需要有害目标回复的监督优化相比,该攻击只依赖对系统自身回复的评分,降低了攻击所需监督,并在三种拓扑中的两种取得更高顺从分数。 在三种拓扑、四个安全基准上评估,混合系统同时出现最高有害顺从与两个良性基准上的准确率提升,说明良性任务表现良好并不能排除高有害顺从。

被攻陷的链路可以被修复:把奖励改为惩罚有害顺从并奖励良性查询的正确回答,仅更新链路即可在所有评估攻击与拓扑上大幅降低有害顺从,且无需更新智能体。 该工作表明安全目标可以作用于智能体之间的学习交互,而不仅是单个模型,并给出链路层面的修复路径。 在九组攻击—拓扑组合上平均聚合有害顺从分数从约62降至约7,四个安全基准在每种配置下均低于原始干净链路;但修复在部分设置下会降低MATH500准确率,平均GPQA-Diamond仍低于干净基线。

启示与展望

该结果面向使用学习型潜在通信链路的多智能体系统,适用于所评估的三种拓扑(双智能体、顺序、混合)与所测模型组合,以及HarmBench、StrongREJECT、JailbreakBench、AdvBench四个安全基准和MATH500、GPQA-Diamond两个效用基准。它说明安全评估应覆盖整个系统及其训练好的通信接口,并提示链路层面的安全目标可用于修复;对采用类似可训练接口的其他系统,这一视角可直接借用。

投毒效果在约10%后趋于饱和,决定饱和点的因素仍是开放问题;单链路攻击显示控制并不均匀分布,哪些链路更关键、其编码何种信息尚待进一步刻画;修复在部分设置下会降低MATH500准确率,平均GPQA-Diamond仍低于干净基线,安全与效用的权衡需要按场景评估;结论基于所测模型、拓扑与基准,向其他模型规模、任务与通信机制的推广仍需验证。

来源