arXiv 2026年10月6日该工作以 SHADE-Arena 式任务开展大规模红队测试,在 14,000 次攻击试验、91 种模型-攻击配置、13 个模型和 7 种隐写方案下检验智能体记忆能否跨会话传递攻击者控制的字符串而不触发安全监督,发现 41.2% 的试验成功编码载荷、29.8% 在记忆写入后保持编码完整、25.4% 在检索时可恢复、20.1% 实现精确匹配恢复,且精确匹配传输中 71.4% 同时通过主任务完成评分并被监督模型判定为安全,相当于全部试验的 14.4%。该工作以 SHADE-Arena 式任务开展大规模红队测试,在 14,000 次攻击试验、91 种模型-攻击配置、13 个模型和 7 种隐写方案下检验智能体记忆能否跨会话传递攻击者控制的字符串而不触发安全监督,发现 41.2% 的试验成功编码载荷、29.8% 在记忆写入后保持编码完整、25.4% 在检索时可恢复、20.1% 实现精确匹配恢复,且精确匹配传输中 71.4% 同时通过主任务完成评分并被监督模型判定为安全,相当于全部试验的 14.4%。StegoMemory 红队测试:14,000 次试验中 20.1% 实现精确匹配的跨会话隐蔽传输,其中 71.4% 同时通过任务完成与安全审查该工作以 SHADE-Arena 式任务开展大规模红队测试,在 14,000 次攻击试验、91 种模型-攻击配置、13 个模型和 7 种隐写方案下检验智能体记忆能否跨会话传递攻击者控制的字符串而不触发安全监督,发现 41.2% 的试验成功编码载荷、29.8% 在记忆写入后保持编码完整、25.4% 在检索时可恢复、20.1% 实现精确匹配恢复,且精确匹配传输中 71.4% 同时通过主任务完成评分并被监督模型判定为安全,相当于全部试验的 14.4%。该工作以 SHADE-Arena 式任务开展大规模红队测试,在 14,000 次攻击试验、91 种模型-攻击配置、13 个模型和 7 种隐写方案下检验智能体记忆能否跨会话传递攻击者控制的字符串而不触发安全监督,发现 41.2% 的试验成功编码载荷、29.8% 在记忆写入后保持编码完整、25.4% 在检索时可恢复、20.1% 实现精确匹配恢复,且精确匹配传输中 71.4% 同时通过主任务完成评分并被监督模型判定为安全,相当于全部试验的 14.4%。