- 0
- 0
- 约5.91千字
- 约 7页
- 2026-10-03 发布于江苏
- 举报
基于熵正则化的强化学习策略多样性探索与控制研究综述
强化学习作为智能体通过与环境交互实现序贯决策优化的核心范式,已在游戏AI、机器人控制、自动驾驶等领域取得突破性进展。传统强化学习方法以累积回报最大化为单一优化目标,往往倾向于收敛到确定性的单峰策略,在面对非平稳环境、多模态奖励、多任务迁移等场景时存在显著局限性:当环境存在局部最优陷阱时,单一策略容易陷入次优解无法跳出;当奖励函数存在多重均衡解时,模型难以覆盖所有可行的最优策略空间;当任务分布发生偏移时,缺乏多样性的策略泛化能力不足,无法快速适应环境变化。熵正则化技术通过在强化学习目标函数中引入策略熵项,在最大化累积回报的同时鼓励策略输出的随机性,为策略多样性的定量调控与有效探索提供了统一的理论框架,近年来已成为深度强化学习领域的研究热点。
一、熵正则化强化学习的基础理论框架
熵正则化强化学习的核心思想是将信息论中的熵概念引入策略优化目标,在传统的回报最大化目标基础上增加策略熵的加权项,形成兼顾“回报性能”与“策略随机性”的双目标优化问题。其标准目标函数可表示为:$$J(\theta)=\mathbb{E}{\tau\sim\pi\theta}\left[\sum_{t=0}^Tr(s_t,a_t)+\alpha\mathcal{H}(\pi_\theta(\cdot|s_t))\right]$$其中$\mat
原创力文档

文档评论(0)