强化学习概述.docxVIP

  • 14
  • 0
  • 约2.18万字
  • 约 23页
  • 2023-09-07 发布于上海
  • 举报
此文档收集于网络,如有侵权请联系网站删除 第四章 强化学习 强化学习概述 智能系统的一个主要特征是能够适应未知环境,其中学习能力是智能系统的关键技术之一。在机器学习范畴内,根据反馈的不同,学习技术可以分为监督学习( Supervised learning)、非监督学习(Unsupervised learning )和强化学习(Reinforcement learning )三大类。其中强化学习是一种以环境反馈作为输入的、特殊的、适应环境的机器学习方法。 强化学习又称为增强学习、加强学习、再励学习或激励学习,是一种从环境状态到行为映射的学习,目的是使动作从环境中获得的累积回报值最大。强化学习的思想来源于动物学习心理学。观察生物(特别是人)为适应环境而进行的学习过程,可以发现有两个特点: 一是人从来不是静止地被动等待而是主动对环境做试探,二是环境对试探动作产生的反馈是评价性的,人们会根据环境的评价来调整以后的行为。强化学习正是通过这样的试探— —评价的迭代,在与环境的交互中学习,通过环境对不同行为的评价性反馈信号来改变强化学习系统(RLS 或者称为 Agent)的行为选择策略以实现学习目标。来自环境的评价性反馈信号通常称为奖赏值(reward)或强化信号(reinforcement Signal),强化学习系统的目标就是极大化(或极小化)期望奖赏值。 强化学习技术是从控制理论、统计学

文档评论(0)

1亿VIP精品文档

相关文档