跳到主要内容
返回时间线
arXiv来源发表:

HAO 将零均值中心投影用于时序差分目标,使 FHE 强化学习在全部随机种子上实现 0% 边界越界

相关研究与后续进展

核心概要

该工作提出同态优势算子(HAO),把基于优势的价值估计中的零均值中心投影直接施加到时序差分目标上,以消除驱动 Bellman 漂移的均匀状态价值基线;在三层评测(表格 MDP、使用真实 CKKS 运算的加密 CartPole、20 节点物流路由基准)中,HAO 将网络预激活严格限制在安全多项式近似域内,全部随机种子 0% 越界,而仅用正则化在 5 个种子中有 3 个越界、未稳定基线在 83.8% 的回合中越界,并在表格域把最优策略准确率提升 18.0 个百分点。

Source-provided article image: Homomorphic Advantage Operator: Stabilizing Reinforcement Learning Under Fully Homomorphic Encryption Constraints
Figure 1 ·

Figure 1: High-level overview of the HAO framework for privacy-preserving reinforcement learning. The system integrates three interdependent components: (1) CKKS-encrypted state transmission and polynomial forward evaluation, (2) the HAO centering projection that neutralizes Bellman drift, and (3) clipped weight updates with optional DP-SGD-style Gaussian noise.

arXiv

深度剖析

HAO 把优势估计中的零均值中心投影直接作用于时序差分(TD)目标,从而消除驱动 Bellman 漂移的均匀状态价值基线。 此前 FHE 强化学习需要把非线性运算替换为多项式近似,并因递归误差现象 Bellman 漂移而发散;HAO 将稳定化从价值估计层面移到 TD 目标层面。 摘要给出机制说明:该线性投影在保持逐状态动作排序的同时,不增加非线性乘法深度,也无需昂贵的密文自举。

HAO 将网络预激活严格限制在安全多项式近似域内,在全部随机种子上实现 0% 边界越界。 与仅依赖正则化(L2 权重衰减与梯度裁剪)或未稳定基线相比,HAO 在边界约束上表现不同。 三层实验方法:表格 MDP、使用真实 CKKS 密码学运算的加密 CartPole、以及具有稠密连续特征的 20 节点物流路由基准;对照结果为正则化在 5 个种子中 3 个越界,未稳定基线在 83.8% 的回合中越界。

HAO 智能体在表格域将最优策略准确率提升 18.0 个百分点,并在裁剪梯度上加入 DP-SGD 风格高斯噪声时保持稳定。 该结果把稳定化收益从边界约束扩展到策略质量,并显示与差分隐私式噪声注入的兼容性。 摘要报告表格域准确率提升 18.0 个百分点,并说明在加入 DP-SGD 风格高斯噪声后仍保持稳定。

启示与展望

该工作面向需要在云端对机密数据做隐私保护强化学习的场景,适用于以 FHE 多项式近似替代非线性运算、并受 Bellman 漂移困扰的智能系统。其三层评测分别覆盖表格 MDP、使用真实 CKKS 运算的加密 CartPole,以及具有稠密连续特征的 20 节点物流路由基准,因此结果直接适用于这些设定下的稳定化与策略质量。对希望在不增加非线性乘法深度、也不引入密文自举的前提下部署 FHE 强化学习的读者,HAO 提供了一条把零均值中心投影用于 TD 目标的路径,并可与裁剪梯度上的 DP-SGD 风格高斯噪声并用。

读者仍需关注:HAO 在超出表格 MDP、加密 CartPole 与 20 节点物流路由基准之外的更大规模或更多任务族上是否同样保持 0% 越界;零均值中心投影对逐状态动作排序的保持在不同网络结构与多项式近似阶数下的表现;以及 DP-SGD 风格高斯噪声的强度范围与稳定性的关系。本次读取范围为摘要,未包含正文图表与完整实验细节,因此上述问题在摘要层面仍属开放。

来源