基于内在奖励的强化学习探索增强研究综述.docVIP

  • 1
  • 0
  • 约4.52千字
  • 约 6页
  • 2026-10-02 发布于江苏
  • 举报

基于内在奖励的强化学习探索增强研究综述.doc

基于内在奖励的强化学习探索增强研究综述

一、内在奖励的核心定义与理论基础

强化学习作为智能体通过与环境交互实现策略优化的学习范式,长期受限于稀疏奖励场景下的探索效率瓶颈。外在奖励由环境任务直接定义,通常仅在智能体完成特定目标、达到关键状态时才会触发,在机器人自主导航、复杂游戏决策、连续控制等任务中普遍存在反馈延迟、密度极低的问题。内在奖励则是智能体根据自身对环境的观测、认知过程自主生成的奖励信号,其核心价值在于弥补外在奖励的稀疏性缺陷,为智能体的每一步交互行为提供即时反馈,引导智能体主动探索环境中具有高信息价值、高新奇性的区域。

内在奖励的理论根基可追溯至心理学中的内在动机理论——人类的探索行为并非完全由外部物质激励驱动,对未知事物的好奇心、对知识的获取欲本身就是行为的核心动力。20世纪50年代,心理学家Berlyne提出的“好奇心驱动探索”理论首次为计算领域的内在奖励设计提供了心理学依据,该理论将人类的探索行为分为感知性好奇与认知性好奇两类:前者由感官层面的新奇刺激触发,后者则源于知识层面的认知冲突。这一分类直接对应了当前内在奖励设计的两大主流方向:基于新奇性检测的内在奖励与基于知识增益的内在奖励。

从计算视角来看,内在奖励的本质是对“探索价值”的量化。理想的内在奖励函数需要满足三个核心特性:一是即时性,能够在智能体每一步交互后快速生成奖励信号,避免外在奖励的延迟问题;二是适应性

文档评论(0)

1亿VIP精品文档

相关文档