- 1
- 0
- 约5.53千字
- 约 6页
- 2026-10-09 发布于江苏
- 举报
基于内在奖励稀疏化的强化学习在长时序决策任务中的探索效率研究综述
一、长时序决策任务的核心挑战与传统强化学习的适配瓶颈
长时序决策任务是指智能体需要在数十乃至上万个时间步的交互序列中完成目标的决策场景,典型任务包括自主机器人长距离导航、多步骤复杂工业控制、开放式游戏关卡通关、长对话系统策略优化等。这类任务的共同特征在于,外部奖励信号仅在序列末端或极少数关键节点出现,智能体在绝大多数交互步中无法获得有效反馈,即外部奖励的天然稀疏性。传统深度强化学习算法如DQN、PPO等,依赖密集的奖励信号引导策略更新,在长时序任务中普遍面临探索效率低下的问题:智能体需要在近乎无反馈的状态空间中随机试错,导致样本复杂度呈指数级上升,往往需要数十亿次交互才能收敛到次优策略,无法适配真实场景中交互成本高昂的应用需求。
内在奖励机制是缓解外部奖励稀疏问题的核心思路,其核心思想是为智能体的每一步交互额外设计一个由自身状态、行为或认知过程产生的奖励信号,作为外部奖励的补充引导探索。早期内在奖励设计主要围绕新奇性检测展开,如基于计数的探索方法通过统计状态访问频率,为访问次数更少的状态赋予更高的内在奖励,驱动智能体探索未知区域。但这类方法在高维连续状态空间(如视觉输入的机器人导航任务)中面临维度灾难,无法对高维状态进行有效计数。后续研究者提出基于状态表示的新奇性度量方法,如通过自编码器的重建误差、对比学习的特征相似
原创力文档

文档评论(0)