arXiv 2026年10月2日该工作提出同态优势算子(HAO),把基于优势的价值估计中的零均值中心投影直接施加到时序差分目标上,以消除驱动 Bellman 漂移的均匀状态价值基线;在三层评测(表格 MDP、使用真实 CKKS 运算的加密 CartPole、20 节点物流路由基准)中,HAO 将网络预激活严格限制在安全多项式近似域内,全部随机种子 0% 越界,而仅用正则化在 5 个种子中有 3 个越界、未稳定基线在 83.8% 的回合中越界,并在表格域把最优策略准确率提升 18.0 个百分点。该工作提出同态优势算子(HAO),把基于优势的价值估计中的零均值中心投影直接施加到时序差分目标上,以消除驱动 Bellman 漂移的均匀状态价值基线;在三层评测(表格 MDP、使用真实 CKKS 运算的加密 CartPole、20 节点物流路由基准)中,HAO 将网络预激活严格限制在安全多项式近似域内,全部随机种子 0% 越界,而仅用正则化在 5 个种子中有 3 个越界、未稳定基线在 83.8% 的回合中越界,并在表格域把最优策略准确率提升 18.0 个百分点。HAO 将零均值中心投影用于时序差分目标,使 FHE 强化学习在全部随机种子上实现 0% 边界越界该工作提出同态优势算子(HAO),把基于优势的价值估计中的零均值中心投影直接施加到时序差分目标上,以消除驱动 Bellman 漂移的均匀状态价值基线;在三层评测(表格 MDP、使用真实 CKKS 运算的加密 CartPole、20 节点物流路由基准)中,HAO 将网络预激活严格限制在安全多项式近似域内,全部随机种子 0% 越界,而仅用正则化在 5 个种子中有 3 个越界、未稳定基线在 83.8% 的回合中越界,并在表格域把最优策略准确率提升 18.0 个百分点。该工作提出同态优势算子(HAO),把基于优势的价值估计中的零均值中心投影直接施加到时序差分目标上,以消除驱动 Bellman 漂移的均匀状态价值基线;在三层评测(表格 MDP、使用真实 CKKS 运算的加密 CartPole、20 节点物流路由基准)中,HAO 将网络预激活严格限制在安全多项式近似域内,全部随机种子 0% 越界,而仅用正则化在 5 个种子中有 3 个越界、未稳定基线在 83.8% 的回合中越界,并在表格域把最优策略准确率提升 18.0 个百分点。