Command Palette
Search for a command to run...
WarpSAC:通过重新思考探索与利用迈向可扩展离策略强化学习的巅峰
WarpSAC:通过重新思考探索与利用迈向可扩展离策略强化学习的巅峰
摘要
通过大规模并行模拟扩展离策略强化学习(RL)改变了数据机制假设,而 RL 算法正是基于这些假设设计的。经典稳定器源于数据受限训练,其中回放缓冲区提供狭窄的状态-动作覆盖。相比之下,大规模并行模拟以高吞吐量提供多样化的经验,自然挑战了这些稳定器在新数据机制中的经典角色。通过在涵盖 CPU 尺度运动、GPU 并行机器人模拟、灵巧操作、人形全身控制的八个基准家族中进行全面且受控的实证研究,我们发现这些稳定器强烈依赖于数据机制:参数归一化在窄回放覆盖下有帮助,但在数据丰富时限制值拟合;在高吞吐量操作中可以安全地放宽裁剪双 Q;年龄偏置回放加权在提高学习效率方面广泛有用,尤其是在网络容量有限的情况下。将这一分析转化为处方,我们构建了 WarpSAC,一个机制感知的离策略 RL 算法家族。WarpSAC 使用样本权重衰减作为机制无关的组件以实现高效利用,并为每种机制匹配规定的变体:WarpSAC-L(归一化开启,裁剪双 Q)用于数据受限的 CPU 尺度训练,WarpSAC-A(归一化关闭,单 Q)用于数据丰富的 GPU 并行训练。WarpSAC 在九个 CPU 尺度环境中将归一化分数-步长 AUC 相对于 FlashSAC 提高了 4.5%,在十四个 GPU 并行环境中提高了 23.1%;将 UnitreeG1TransportBox-v1 的成功率从 19.8% 提升至 96.4%,并在 MuJoCo Playground 上平均归一化墙钟时间 AUC 提升了 19.1%;在 Unitree G1 上实现比 FlashSAC 快 36.4% 的模拟到现实部署(以墙钟时间计)。这些结果表明,可扩展离策略 RL 应使其稳定器适应可用数据机制。在此原则下,WarpSAC 推进了可扩展离策略 RL 的最新技术水平,在不同数据机制下相对于 FlashSAC 提供了一致的增益。
一句话总结
来自天津大学、山西大学和帝国理工学院的研究者提出了 WarpSAC,一个基于数据体制感知的离策略强化学习算法家族,通过样本权重衰减以及预设变体 WarpSAC-L 和 WarpSAC-A 将稳定器适配到数据可用性上。相比 FlashSAC,在九个 CPU 规模环境中归一化得分-步数 AUC 提升 4.5%,在十四个 GPU 并行环境中提升 23.1%,将 UnitreeG1TransportBox-v1 的成功率从 19.8% 提升至 96.4%,并在 Unitree G1 上实现了 36.4% 的墙钟时间加速,加速了仿真到现实的部署。
核心贡献
- 形式化了离策略强化学习的数据体制假设,表明稳定器效用(参数归一化、裁剪双 Q)取决于回放覆盖范围,并通过跨八个基准家族(涵盖 CPU 规模运动控制、GPU 并行机器人仿真、灵巧操作和人形全身控制)的受控消融实验加以验证。
- 提出了 WarpSAC,一个数据体制感知的离策略强化学习算法家族,包含两个变体:WarpSAC-L(归一化开启、裁剪双 Q)用于数据受限的 CPU 规模训练,WarpSAC-A(归一化关闭、单 Q)用于数据充足的 GPU 并行训练,并以样本权重衰减作为体制无关的核心组件。
- WarpSAC 在九个 CPU 规模环境中将归一化得分-步数 AUC 相比 FlashSAC 提升 4.5%,在十四个 GPU 并行环境中提升 23.1%,将 UnitreeG1TransportBox-v1 成功率从 19.8% 提升至 96.4%,在 MuJoCo Playground 上平均归一化墙钟时间 AUC 提升 19.1%,并在 Unitree G1 上实现 36.4% 更快的仿真到现实部署墙钟时间。
引言
现代机器人控制的强化学习越来越依赖 GPU 加速仿真器和大规模并行环境,这些环境产生的交互数据远超传统单环境设置。这种数据丰富性使得软演员-评论家(Soft Actor-Critic)等离策略演员-评论家方法更具吸引力,然而大多数现有稳定器,如熵正则化、裁剪双 Q 目标和参数归一化,都是针对窄回放覆盖范围设计的,此时探索和保守价值估计至关重要。在数据丰富的体制中,这些组件可能限制表达自由度、引入悲观偏差并增加计算开销,但可扩展流水线仍然不加质疑地继承它们。
作者通过使用 FlashSAC 进行受控的组件级分析,研究了这些稳定器何时有帮助、何时有阻碍。他们隔离了三个轴:通过样本权重衰减实现的回放侧数据利用、参数投影归一化,以及裁剪双 Q 与单 Q 目标之间的评论家多重性。跨八个基准家族和 67 个环境,他们发现归一化有助于窄回放但会限制宽回放下的价值拟合,裁剪双 Q 在高吞吐操作中可以放宽,而 SWD 始终有用。基于此,他们构建了 WarpSAC,一个数据体制感知的算法家族,将稳定器选择与数据可用性匹配,在不改变训练主干的情况下,相比 FlashSAC 在得分-步数 AUC、成功率和墙钟时间上取得了显著改进。
方法
方法
预备知识
作者基于标准折扣马尔可夫决策过程(MDP)公式构建连续控制强化学习,目标是最大化期望折扣回报。他们的研究扩展了软演员-评论家(SAC),一种最大熵离策略演员-评论家算法。SAC 在回报目标中加入熵奖励,并维护回放缓冲区、随机策略和两个评论家,通过裁剪双 Q 目标来抵消过估计。裁剪双 Q 算子抑制覆盖不佳动作上虚高的 Q 估计,但引入了第二个评论家和悲观偏差;单 Q 变体移除最小化操作,仅使用一个评论家。
FlashSAC 将 SAC 扩展到大规模机器人控制,结合了高吞吐数据收集、更大模型、降低的更新频率以及用于稳定评论家学习的范数控制机制。参数投影归一化作为关键组件,在每次优化器步骤后将每层权重矩阵约束到 Frobenius 范数球内。这限制了谱范数,对于具有 1-Lipschitz 激活的网络,可得到整个网络的 Lipschitz 上界。这种归一化起到探索和稳定性导向的约束作用:它控制有效函数类,但当回放覆盖已经充分时可能限制表达自由度。
作者还形式化了加权回放,其中每个转移以与样本权重成比例的概率被采样。不同的权重选择可恢复均匀采样和优先回放。样本权重衰减(SWD)以年龄感知权重实例化这一思想,最初被提出作为一种轻量级回放侧方法,用于缓解可塑性损失。作者将 SWD 既作为保持可塑性的方法,也作为促进离策略学习过程中数据利用的机制进行研究。
数据体制假设
作者认为经典离策略稳定器是在 CPU 规模假设下开发的,此时回放覆盖范围窄,价值外推脆弱。GPU 并行仿真改变了这种数据体制:数千个 actor 以高吞吐量向缓冲区填充多样化轨迹,瓶颈从获得足够覆盖转向从丰富数据中拟合和利用高价值行为。作者假设这种转变改变了经典稳定器的相对价值。在数据受限体制中,参数归一化和裁剪双 Q 通过约束有效函数类并抑制覆盖不佳动作上虚高的 Q 值来提供帮助,而回放侧机制应更好地利用窄缓冲区。在数据丰富体制中,同样的保守机制可能限制价值拟合或引入不必要的悲观偏差,而回放侧的收益仍然存在,因为针对策略相关转移的采样与覆盖范围正交。
三个轴
基于这一假设,作者隔离了三个设计轴,全部叠加在 FlashSAC 之上:
- 回放权重 wt(i):转移是均匀采样还是使用年龄相关权重。
- 参数投影归一化:是否在每次优化器步骤后应用 FlashSAC 的列式权重重归一化(归一化开启)或禁用(归一化关闭)。
- 评论家多重性:使用裁剪双 Q 目标(两个评论家)还是替换为单个评论家(单 Q)。
作者固定数据收集吞吐量和优化器调度以干净地比较体制,仅在单独的规模消融中变化网络容量。独立变化这三个轴可以实现体制感知配对,而不是将 WarpSAC 归结为单一的“强”或“弱”SAC 配方。
样本权重衰减
在三个轴中,回放权重是唯一无论数据体制如何都应用的。SWD 通过使用线性年龄衰减将小批量采样偏向近期转移来实现这一轴。对于在时间 ti 插入的转移,其在训练步骤 t 的年龄为 At(i)=t−ti。SWD 为每个转移分配年龄相关权重
wt(i)=max(wmin,1−TdecayAt(i)),pt(i)=∑jwt(j)wt(i),其中 Tdecay 是衰减范围,wmin>0 是防止旧转移被完全丢弃的下限。设置 Tdecay=0 可恢复均匀回放。SWD 在回放缓冲区内部实现,无需辅助网络、额外的 Bellman 目标或损失更改。
作者指出,策略性能主要由当前策略访问的状态-动作区域以及高价值轨迹沿线区域的 Bellman 误差主导。均匀回放忽略这种结构,将相同的更新概率分配给来自更旧策略的转移。SWD 通过仅改变小批量分布,将固定更新预算重定向到更具策略相关性的转移,而不改变名义更新-数据比或更新规则;非零下限 wmin 保留了覆盖范围。由于这一论点依赖于策略年龄而非数据量,SWD 在两种体制中都被保留。
体制感知变体与处方
在 SWD 被确立为体制无关的回放组件后,剩余的设计问题是如何为每种数据体制设置归一化和评论家多重性。作者定义了两种预设变体:WarpSAC-L 用于数据受限(CPU 规模)体制,保留归一化和保守性以在窄回放覆盖下稳定价值外推;WarpSAC-A 用于数据丰富(GPU 并行)体制,移除归一化和保守性以释放评论家利用广泛且快速刷新的回放数据。还定义了一个中间消融点 WarpSAC w Norm OFF。FlashSAC(无 SWD、归一化开启、裁剪双 Q)作为共享基线。
这些变体形成一个保守性谱系,从完全(归一化开启、双 Q)到最小(归一化关闭、单 Q),全程应用 SWD。WarpSAC 的一个关键特征是 GPU 并行配方通过移除组件而非添加组件来实现增益:移除归一化释放评论家拟合丰富数据,移除第二个评论家将评论家侧计算减半。结果是算法既比完全稳定化的基线更简单又更强。这与常见的为鲁棒性堆叠机制的模式形成对比;WarpSAC 表明将稳定器与数据体制匹配比统一继承更有效。实践者指南很直接:数据受限体制使用 WarpSAC-L,数据丰富体制使用 WarpSAC-A,并始终启用 SWD。
实验
实验在 CPU 规模和 GPU 并行设置中跨八个基准家族验证了 WarpSAC 家族的数据体制假设。在数据受限环境中,WarpSAC-L 将 SWD 与归一化配对,通过在稀缺回放下稳定价值学习而表现出色,而在数据丰富设置中,WarpSAC-A 表明归一化和裁剪双 Q 等保守稳定器变得具有限制性,可以放宽。Unitree G1 上的仿真到现实案例研究表明,WarpSAC 比 FlashSAC 实现更快的部署,机制分析显示,SWD 在 CPU 规模训练中补偿了有限网络容量,而归一化在 GPU 并行设置中限制了表达性,最佳结果来自将 SWD 与减少的归一化相结合。
WarpSAC 根据数据体制调整其归一化和评论家设置,所有变体均应用 SWD 回放。在数据受限设置中,保留归一化和双评论家,而在数据丰富设置中,禁用归一化并使用单个评论家,减少计算并提升性能。这种体制感知设计持续优于统一稳定器继承。SWD 在低容量设置中提供最大增益,某些任务上相对改进超过 2 倍。在容量有限的 GPU 并行设置中,禁用归一化显著提升性能,并随容量增长保持竞争力。将 SWD 与减少的归一化配对在数据丰富环境中产生最强配置。WarpSAC 通过移除组件而非添加组件实现增益,简化算法同时增强强度。
WarpSAC 使用数据体制感知配置,在低数据设置中保留归一化和双评论家,但在数据丰富时禁用归一化并使用单个评论家,从而削减计算并提升性能。这种自适应方法持续优于统一稳定器继承,SWD 回放在低容量任务中提供最大增益,有时相对性能提升超过一倍。在容量有限的 GPU 并行设置中,移除归一化显著改善结果并随容量增长保持竞争力,而将 SWD 与减少的归一化结合在数据丰富环境中产生最佳结果。总体而言,WarpSAC 通过简化算法而非添加组件来改进。