- 0
- 0
- 约4.36千字
- 约 5页
- 2026-10-01 发布于江苏
- 举报
基于保守策略的强化学习离线到在线微调中的安全探索研究综述
一、离线到在线微调的安全风险核心来源
强化学习的离线预训练阶段依赖固定历史数据集完成策略初始化,能够避免与真实环境交互的初期风险,但进入在线微调阶段后,策略需要通过与环境的动态交互优化性能,此时安全风险会集中爆发。风险首先来源于分布偏移问题:离线数据集的状态-动作对分布通常与在线交互过程中策略探索产生的分布存在显著差异,当策略为了追求更高回报尝试数据集未覆盖的动作时,很容易进入未被验证的危险状态空间。例如在自动驾驶场景中,离线数据集可能仅包含正常路况下的驾驶数据,微调阶段策略若尝试极端变道动作,就可能触发碰撞风险,而这类风险在离线训练阶段完全无法被感知。
第二类风险来自于回报函数的拟合偏差。离线训练过程中,价值网络是基于历史数据的回报标签训练得到的,对于离线分布外的状态-动作对,价值估计往往存在过高估计的问题。这种偏差会导致策略错误地将高风险动作判定为高回报动作,进而引导策略持续向危险区域探索。在工业机器人控制场景中,这类偏差可能导致机械臂错误判断负载重量,执行超出硬件承受能力的操作,最终造成设备损坏甚至人员伤害。
第三类风险源于探索过程的不可逆性。很多真实场景中,某些状态一旦进入就无法恢复,或者恢复成本极高。例如电力系统调度场景中,错误的机组启停操作可能引发电网振荡,即使后续立刻修正策略,也已经造成了大面积停电的经济损失;
原创力文档

文档评论(0)