基于内在动机的强化学习技能发现研究综述.docVIP

  • 2
  • 0
  • 约5.14千字
  • 约 6页
  • 2026-10-02 发布于江苏
  • 举报

基于内在动机的强化学习技能发现研究综述.doc

基于内在动机的强化学习技能发现研究综述

一、内在动机与强化学习技能发现的核心关联

强化学习作为智能体通过与环境交互自主学习最优策略的范式,在游戏AI、机器人控制、序列决策等领域已取得突破性进展,但传统强化学习依赖人工设计的外部奖励信号,在奖励稀疏、环境复杂的场景中容易陷入样本效率低下、策略泛化能力不足的困境。内在动机借鉴认知心理学中生物自发探索环境、获取技能的行为机制,将“好奇心”“能力提升”“信息增益”等内生性奖励引入强化学习框架,为智能体无需外部指导即可自主发现可复用、层级化的技能提供了可行路径。

技能发现的核心目标是将复杂的长程决策任务拆解为若干具有语义一致性、可独立执行的子策略,这类子策略通常具备时间抽象性、目标导向性和迁移复用性三个关键特征:时间抽象性指技能是包含多步动作的序列,无需逐帧决策即可完成特定子目标;目标导向性指技能的执行始终指向某个明确的状态空间区域,具备可预测的效果;迁移复用性指技能可在不同任务、不同环境中被重复调用,降低新任务的学习成本。内在动机为技能发现提供了搜索方向——智能体不再仅仅追求外部奖励最大化,而是主动探索能带来最大内生奖励的行为模式,这些模式往往对应着环境中具有高价值的可复用技能。

当前主流的内在动机驱动的技能发现研究,可根据内生奖励的设计逻辑分为三类:信息增益类、能力提升类和结构一致性类。信息增益类动机以“减少环境不确定性”为核心,鼓励智能

文档评论(0)

1亿VIP精品文档

相关文档