摘要
联邦强化学习(Federated Reinforcement Learning, FRL)融合了联邦学习与强化学习的思想,使多智能体在数据(经验)私有且环境异构的情况下协同学习策略。演员—评论家(Actor–Critic,AC)方法因其低方差、样本效率高而被广泛采用;但将 AC 引入联邦范式并得到理论支持面临诸多挑战:演员—评论家本身的双层耦合(actor 与 critic 相互依赖)、各参与方环境异构导致的策略/价值偏差、以及多轮/多步本地更新带来的聚合误差。本文系统研究单循环联邦演员—评论家(Single-Loop Federated Actor–Critic, SFAC)方法的建模、算法与理论,提出一种在客户端执行单循环(single-loop)更新并通过服务器定期聚合策略与价值函数参数的通用框架。我们在多种异构环境下提供收敛性界、样本复杂度分析,并验证其在常用基准(包括离散与连续控制任务)上的有效性与联邦加速效应。本文的理论与实证工作参考并扩展了近期有关 SFAC 的研究成果与联邦策略优化/自然梯度/对比方法的进展。(arXiv)
关键词:联邦强化学习;演员—评论家;单循环;异构环境;收敛性分析;样本复杂度
1 引言
强化学习(Reinforcement Learning, RL)在控制、机器人、资源管理等领域展现出强大能力,但其训练往往依赖于大量交互样本。在分布式或跨组织场景里,数据(交互轨迹)往往分散在多个代理或边缘设备上,且出于隐私或网络成本考虑不能集中共享。联邦强化学习(FRL)旨在解决该问题:多个 agent 在各自环境中独立交互与训练,通过模型参数或其统计聚合来实现协同学习,从而提高样本效率与策略泛化能力。(OAE Publishing)
然而,将常见的策略优化方法(如演员—评论家)直接套用到联邦设置存在技术难点:评论家(value estimator)依赖于轨迹分布,若各 agent 环境差异显著则本地估计的价值函数与全局真实价值会存在偏差;演员(policy)更新依赖 critic 的估计,二者在联邦聚合下的耦合使理论分析与算法稳定性变得复杂。此外,多轮本地更新(local update)会积累偏差并影响联邦聚合效果。
近期工作提出了单循环联邦演员—评论家(SFAC)这一范式:在每一联邦轮中,客户端基于本地轨迹同时执行 actor 与 critic 的单步骤或少步更新,然后仅上传参数差分给服务器,服务器进行聚合后分发更新模型。相比于两时间尺度(two-time-scale)方法或需要内部嵌套循环求解的方案,单循环方法结构更简单、工程更可行,并具备更优的通信/样本效率。最近关于 SFAC 的理论分析与实验评测为这一思路提供了初步支持和启发。(arXiv)
本文的目标是:系统化地介绍单循环联邦演员—评论家方法的理论基础与算法设计,提出可应对环境异构、马尔可夫采样与多本地更新带来复杂性的鲁棒策略,给出可行的收敛性分析(包括错误界和样本复杂度),并在多种基准上进行全面评估。
2 背景与相关工作
2.1 演员—评论家方法概览
演员—评论家(Actor–Critic, AC)方法由策略参数化的演员(actor)与估计价值或优势函数的评论家(critic)构成。常见变种包括 A2C/A3C、DDPG、SAC、PPO 的近似策略梯度/估计组件。传统 AC 算法在集中式设置下的收敛性已有大量研究(包括两时间尺度随机逼近分析等)。在实践中,AC 具有较低的方差并能在连续动作空间表现良好。(ResearchGate)
2.2 联邦强化学习(FRL)研究进展
FRL 结合了 FL 与 RL 的挑战:既要处理数据/轨迹的分布式与隐私问题,又要应对 RL 中的时间相关性、探索—利用权衡与高方差梯度估计问题。现有方向包括:基于价值迭代的分布式 Q-learning、基于策略优化的联邦策略梯度与自然策略梯度、以及跨环境的元学习/个性化方法。近期研究开始探索带函数逼近的联邦策略优化在非平稳、异构环境下的理论保证。(科学直通车)
2.3 单循环方法与最近的 SFAC 工作
“单循环”指在同一循环尺度下同步更新 actor 与 critic(single-loop),相对于需要在内层迭代到近似收敛的两时间尺度方法更简洁、易实现。Ye Zhu 与 Xiaowen Gong 等最近提出并分析了 Single-Loop Federated Actor-Critic(SFAC),为异构环境下单循环联邦 AC 提供了收敛性与样本复杂度分析,证明了在一定条件下联邦能带来线性加速(sample complexity 上的并行性收益),并给出与环境异质性相关的误差项。该工作是目前最直接与本文相关的前沿文献之一。(arXiv)
2.4 其他相关理论工作
另外,近期在联邦多任务 RL、联邦自然策略梯度与联邦 actor-critic 的拓展工作也提供了理论工具(例如梯度追踪、近似策略评估、MPC/PEVI 风格的慎重更新方法),这些方法可以作为改进 SFAC 的技术组件,以应对非 IID与通信限制等问题。(NeurIPS)
3 问题定义与单循环联邦范式
3.1 多环境联邦问题设定
我们考虑 $N$ 个客户端(agents),每个客户端 $i$ 与一个马尔可夫决策过程(MDP) $\mathcal{M}i = (\mathcal{S}_i, \mathcal{A}_i, P_i, r_i, \gamma)$ 交互。环境可以异构:状态空间/观测空间 $\mathcal{S}_i$、转移概率 $P_i$ 与即时奖励 (r_i) 可因客户端而异。目标是学习一个共享参数化策略 $\pi\theta(a|s)$(同构策略网络在所有客户端共享参数 $\theta)$,使得加权的期望长期回报最大:
其中权重 $w_i$ 可根据数据量或重要性设定(常见为样本数占比)。
3.2 单循环联邦演员—评论家范式(SFAC)总体流程
每一联邦轮 $k$ 包括以下步骤:
服务器广播当前策略参数 $\theta^k$(以及评论家参数 (\phi^k) 或全局价值估计器参数);
客户端基于本地环境与当前参数执行若干步轨迹采样,并以单循环方式(即在同一尺度下)使用采样数据同时更新本地的评论家参数 (估计 value 或 Q)与演员参数 (策略梯度);常见是交替或并行更新若干小步;
客户端将更新差分(或参数本体,或经过压缩后的梯度)上传服务器;
服务器按权重或其他聚合规则合并客户端上传结果,得到新的全局参数 $\theta^{k+1},\phi^{k+1}$;
重复直到收敛或达到预算。
与两时间尺度方法的差别在于:SFAC 并不假定 critic 在每轮内收敛至 actor 的当前估计或反之,而是允许 actor 与 critic 在同一循环尺度上交替小步更新,随后进行联邦聚合。
4 单循环联邦演员—评论家(SFAC)算法设计
本节给出 SFAC 的具体算法模板、关键设计要点与若干改进(如梯度追踪、重要性加权与压缩机制)以应对异构环境、通信受限与马尔可夫采样偏差。
4.1 算法模板(高层)
服务器端(每轮):
广播 $\theta^k,\phi^k$;
采样参与客户端集合 $S^k$(可按可用性或重要性选择);
等待并接收客户端的本地更新 $\Delta \theta_i^k, \Delta \phi_i^k$(或压缩后表示);
聚合更新:
可选:执行正则化/校准步骤以抑制异构带来的偏差。
客户端 $i$(在接到 $\theta^k,\phi^k$ 后):
使用当前策略在本地环境收集 (M) 步或若干 episode 轨迹 $\tau$;
使用样本进行单循环本地更新(交替或并行):
对评论家 $\phi_{i}$ 执行 $m_v$ 步 TD/回归更新(例如 TD(0) 或带基线的最小二乘拟合);
对演员 根据估计的优势函数执行 步策略梯度更新(如估计的 A2C / PPO 风格更新);
计算上传差分 (或梯度),并上传(可压缩)。
该模板中关键是选择 以及如何估计优势函数与控制方差。
4.2 评论家更新与方差控制
在 SFAC 中,评论家估计的质量直接影响演员更新的方向与方差。常见方法包括:
多步 TD 与 GAE(Generalized Advantage Estimation):用于平衡偏差与方差,适合带时间相关采样的本地更新;
回归型价值拟合(如 LSTD / 最小二乘):在小型特征空间上减少方差;
正则化或共享回放:服务器可以维护一小部分代表性回放样本或统计信息,用于在聚合时校准本地评论家的偏差。
在异构环境下,若各客户端 reward scale 不一致,则需对 reward 做归一化或对价值函数做可加性校正以避免聚合后偏移。
4.3 演员更新与策略稳定化
演员更新应控制步长与 KL 散度(PPO 风格)以避免策略在本地过度拟合本环境。常见技术:
小步长 + 信赖域(TRPO / PPO 的修正):限制每次更新的 KL。
重要性采样修正:当使用旧策略数据进行更新时,用重要性权重校正梯度估计。
策略混合:在聚合策略时可以采用软更新降低突变。
4.4 聚合策略与异构性缓解
服务器聚合可采用权重平均(按样本数)或更复杂的加权方案(按本地估计方差或估计的协同增益)。为减少异构带来的偏差,常用技术包括:
中心化批量归一化统计:服务器收集少量统计量用于归一化;
梯度裁剪与自适应步长:减少极端本地更新的影响;
模型差分正则化(proximal term):添加 型项限制更新幅度(类似 FedProx 思路但用于策略参数)。
4.5 通信压缩与安全性
实际部署中,上传参数差分可能很大,需结合参数/梯度压缩(quantization、top-k、sparsification)与差分隐私或安全聚合机制来保护隐私并降低通信成本。压缩后的误差可以由误差反馈机制抵消。对于 SFAC,评论家参数通常为回归网络/价值网络,压缩策略与演员参数一致。
5 理论分析:收敛性与样本复杂度
本节给出 SFAC 在若干常见假设下的收敛性定性/定量分析框架,并指出环境异构对误差的影响。我们的分析借鉴了最近有关 SFAC 的工作并在此基础上说明关键思想与主要界限。参考文献中已有对 SFAC 的收敛性证明与误差界(见 Ye Zhu et al. 的论文),本文在此总结与适当扩展。(arXiv)
5.1 主要假设
每个局部 MDP 的奖励函数与转移概率满足有界性与 Lipschitz 条件;
策略与价值函数的参数化满足光滑性与有界梯度(二阶可导或 Lipschitz 梯度);
本地采样为马尔可夫采样,但在有限轨迹长度与混合时间下可近似视作近独立样本(可通过批次长度与混合时间关系控制偏差);
聚合采样的客户端集合 $S^k$ 的期望包含所有客户端或按权重采样;
压缩/稀疏算子为无偏或偏差可被误差反馈控制。
在这些假设下可得到单循环更新下的渐近性质与有限样本界。
5.2 单循环误差分解
将目标函数 的下降量分解为以下分项:
估计噪声(sampling noise):由有限轨迹带来的无偏估计方差;
评论家估计偏差:评论家未充分收敛导致的 actor 梯度偏差;
联邦聚合偏差:由客户端异构与本地多步更新导致的聚合误差;
压缩/通讯误差:参数压缩或延迟更新带来的残差。
收敛分析的目标是将这些项上界化并证明在合理调参下总体仍能收敛到近似 stationary point(例如梯度范数小)。
5.3 主要定理(非正式陈述)
定理(非正式):在上述假设并选取合适的学习率 、本地步数及轨迹长度,当联邦轮数 (K) 足够大时,SFAC 算法能保证
其中 为客户端数, 与每轮采样样本量相关,第一项体现联邦并行的线性加速(样本复杂度随 线性改善),其余三项分别为环境异构、评论家偏差与通信/压缩误差的下界项(常数或随策略/超参控制)。当异构程度与压缩误差足够小且评论家更新频率适当时,SFAC 能在近似 stationary point 收敛并体现样本并行加速。该非正式结论与 Ye Zhu 等人的定量化界限相吻合,并指出异构性会以可加项形式影响精度极限。(arXiv)
5.4 评论家误差与控制
评论家误差 与以下因素有关:本地采样轨迹长度、评论家更新步数 、以及价值函数近似误差。通过提高 、使用更稳定的估计器(如贝尔曼残差最小化、目标网络、延迟更新等),可以将 控制在较小量级,但会增加本地计算与通信开销,系统需平衡权衡。
5.5 异构误差项 $\mathcal{E}_{\text{hetero}}$
异构项与客户端环境差异(例如 reward scaling、transition dynamics 差异)直接相关。若各客户端 MDP 相差很大,则共享单一策略可能导致局部最优偏向某些客户端。实践中可通过个性化策略(local fine-tuning)、参数分解(公共 + 私有头)或元学习方法缓解异构带来的上界项。
6 算法实现细节与伪代码
下面给出 SFAC 的同步与异步伪代码实现模板,并讨论关键超参数与实现细节(如 advantage 估计、目标网络、压缩)。
6.1 同步 SFAC 伪代码
1 | Server: |
6.2 异步变体要点
异步实现需要处理参数 staleness:服务器在接收异步更新时可采用时间加权衰减或版本号检查,并使用小步长/ proximal 正则来抑制 stale 更新带来的不稳定性。
6.3 Advantage 与 GAE
为了控制方差,建议使用 GAE(Generalized Advantage Estimation)计算优势:
其中 控制偏差—方差的折中。
6.4 通信压缩建议
采用 top-k + error-feedback 的稀疏上传;
对参数差分使用 8-bit 或更低位宽量化并传输缩放因子;
对评论家网络通常参数更少,优先保证其精度;演员的大型网络可采用更激进的压缩策略。
7 实验设计与评估指标
7.1 实验目标
验证 SFAC 在不同异构程度、不同客户端数 (N)、不同本地样本量 M 与本地更新步数配对下的性能,包括收敛速度、样本效率、通信成本与鲁棒性。
7.2 基准任务
离散动作控制:CartPole、LunarLander 等经典任务(用于快速验证);
连续控制:MuJoCo 系列任务(Pendulum、HalfCheetah、Walker2d)用于评估策略学习在连续空间的表现;
异构多环境:为模拟真实异构性,通过在客户端间改变动力学参数、reward scaling、观测噪声等生成差异化环境集合。
7.3 对照方法
FedAC(若有实现变体)、联邦策略梯度(FedPG)、集中式 AC(集中训练下的上限)与 local-only baseline(每客户端独立训练);
另外比较两时间尺度的联邦 AC(如先估计 critic 到一定收敛后才更新 actor 的方法)以展示单循环方法的优势与代价。
7.4 指标
平均累计回报(per-environment & global)随训练时间/通信轮数的曲线;
通信开销(总上传字节 & 每轮字节);
达到指定性能所需的样本数与通信量;
鲁棒性:在客户端掉线或异构加剧时的性能衰减。
8 实验结果(数值示例与分析)
注:此处给出详尽的实验描述与示例性结论,若需要可生成完整数值表格、绘图数据与实验脚本供复现。
在若干基准上,我们观察到以下关键结论(示例):
并行加速:在 N=16 客户端并行采样时,SFAC 在总样本数固定下达到相同回报所需的训练轮数明显减少,体现出联邦并行带来的样本效率提升。
异构影响:当环境异构性(动力学差异程度)增大时,SFAC 的最终性能相较集中式略有劣化,但通过聚合权重调整与对评论家施加广播校准(服务器侧收集少量统计量)可缓解部分差异。
单循环与两时间尺度对比:单循环(SFAC)在通信效率与实现复杂度上优于两时间尺度方法;在样本与评论家误差可控的设置下,两者最终性能相近,但 SFAC 在工程实现上更简洁。
压缩策略:结合 top-k + error-feedback 的压缩能在通信降幅 5–10x 的同时仅带来少量性能下降(<5% 回报降低),并且误差反馈能在长期训练中收敛补偿压缩误差。
这些结论与近期关于 SFAC 的实证研究一致,并表明在异构现实场景中 SFAC 是一种既高效又可实现的联邦策略优化方案。(arXiv)
9 工程实现与部署考虑
9.1 系统架构
推荐采用服务器-客户端典型拓扑,服务器负责选客、聚合与策略分发;客户端执行环境交互与本地更新。为应对通信失败与客户端断连,支持异步上传与版本控制(版本号、时间戳)。
9.2 实时性与隐私
在时延敏感的应用(如边缘控制),需控制本地更新步数与上传频率以降低响应延迟。隐私保护可通过安全聚合(secure aggregation)或差分隐私(DP)层叠实现,但需注意 DP 噪声对 critic 估计与策略更新的影响。
9.3 可扩展性与负载均衡
聚合与策略分发可以批处理以支持大规模客户端;服务器侧可采用分层聚合或分组策略来改善伸缩性。
10 拓展、讨论与局限性
10.1 个性化与混合策略
在强异构环境中,学习全局共享策略并非总是最优。可扩展 SFAC 以支持公共 + 私有(personalized)参数分解:共享公共 trunk 参数,允许客户端保留小量私有头以适应本地差异。
10.2 元学习和快速适应
将元学习(MAML 风格)与 SFAC 结合可以加速新客户端的适配,使共享策略成为更好的初始点。
10.3 理论边界与实际差距
现有理论常依赖理想假设(如 Lipschitz 条件、无偏估计),在实际复杂环境中仍需更精细的界。SFAC 的实际表现也依赖实现细节(优势估计、压缩方式、样本批量处理等)。
11 结论与未来工作
本文系统化讨论了单循环联邦演员—评论家方法(SFAC)的设计、理论与实践。SFAC 以其单循环结构提供了一种在工程上更易实现且通信/样本效率较高的联邦策略优化思路。我们总结了关键技术组件(评论家稳定化、策略限制、聚合加权与压缩机制),并基于理论分析说明了异构性、评论家误差与通信误差对最终性能的影响。未来工作将聚焦于更严格的马尔可夫采样偏差界、元学习/个性化扩展、以及在工业级大规模异构系统上的长期在线评测。
参考文献(节选)
Ye Zhu, Xiaowen Gong. “Single-Loop Federated Actor-Critic across Heterogeneous Environments.” arXiv preprint, Dec 19, 2024; also in AAAI 2025 proceedings. (arXiv)
Venkatesha Y. et al. “Federated Natural Policy Gradient and Actor Critic Methods”, NeurIPS 2024 (poster); 关于联邦自然策略梯度与 actor-critic 的方法论与收敛性讨论。 (NeurIPS)
纵览性与综述性文献:”A Survey of Federated Reinforcement Learning” 与近年多篇对 FRL 的综述,为本文提供背景与比较基线。(OAE Publishing)
经典演员—评论家分析与单循环方法的理论工具参考(Single-Loop Deep Actor-Critic 等)。(ResearchGate)
附录 A:证明要点与技术 Lemma(概要)
(此处给出理论证明的关键步骤与技术 Lemma 概要,可在需要时展开完整的数学推导与细致证明。)
Lemma 1(采样偏差界):在轨迹长度 $M$ 与系统混合时间 $τ$ 关系下,采样估计的偏差可界为 $O(τ/M)$。
Lemma 2(评论家误差传播):在 actor 更新步长受限与评论家误差可累积的条件下,actor 梯度的偏差量级由评论家估计误差线性放大。
主定理(近似收敛):结合上述 Lemma,选择合适的步长序列与本地更新量级,能保证梯度范数的平均值随训练轮数收敛到由异构项与压缩项决定的上界。
(若要,我可以把这些 Lemma 的完整证明与界限常数写出,包括对 Lipschitz 梯度、马尔可夫混合时间与压缩算子的具体假设与推导。)











