基于最大熵的强化学习探索策略在连续动作空间中的应用研究综述.docVIP

  • 1
  • 0
  • 约5.29千字
  • 约 6页
  • 2026-10-02 发布于江苏
  • 举报

基于最大熵的强化学习探索策略在连续动作空间中的应用研究综述.doc

基于最大熵的强化学习探索策略在连续动作空间中的应用研究综述

一、连续动作空间强化学习的探索困境

在机器人控制、自动驾驶、智能电网调度等连续决策场景中,强化学习智能体需要在高维、非结构化的连续动作空间内输出精确的控制指令,其决策精度直接决定任务完成效果。传统强化学习框架以累积回报最大化为核心目标,智能体倾向于快速收敛到已知的次优策略,对未知状态动作对的探索意愿极低,在连续动作空间中极易出现三类典型问题:其一,维度诅咒导致的探索覆盖不足,连续动作空间的维度每提升一阶,需要采样的状态动作组合数量呈指数级增长,传统ε-贪婪、高斯噪声注入等随机探索策略仅能在低维空间中有效,面对关节数大于6的机械臂控制、多自由度无人机导航等高维任务时,随机采样的有效样本占比不足0.1%,大部分探索动作无法获得有效回报信号;其二,探索-利用权衡失衡引发的策略坍塌,当任务存在稀疏回报或局部最优陷阱时,传统策略会过早收敛到局部最优解,例如在四足机器人行走任务中,智能体可能会找到一种小步幅慢走的稳定策略,但始终无法探索到更高效的奔跑步态;其三,分布偏移导致的泛化能力缺失,训练环境与部署环境的微小差异会让传统策略的表现骤降,因为训练过程中智能体仅探索了状态空间的极小区域,无法应对环境的动态变化。

最大熵强化学习框架的出现为解决上述问题提供了全新思路,其核心是在传统回报函数中加入策略熵正则项,目标函数变为$J(\thet

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档