Q-learning与DQN算法详解及实战应用.pdfVIP

  • 3
  • 0
  • 约2.82千字
  • 约 23页
  • 2026-04-17 发布于北京
  • 举报

一张图解释Q-learning

干一件事包括:眼前的瞬时+记忆经验

瞬时:做了一个动作就能获得的

记忆经验:按照训练时的经验,上一个动作发生后,接下来怎么做才能

获得更大的(补刀。。。)

DQN就是用神经网络来预测了,先来看看Q-learning是咋玩的

Q-learning要做什么?(的期望)

收集数据:(就是玩游戏记录)

令目标等于:

目标函数:

如何知道下一步做什么才能使得更大呢?查表来迭代更新!

准备密室逃脱

状态:0,1,2,3,4,5(其中5是出口)

目的就是能逃出去

不是每个状态都互通的(2只能到3)

迭代让机器人能逃出去

密室地图

由于5是出口,所以能到5就会获得比较大的,其余均为0

初始化Q和R

Q现在看起来是一个空表,要不断进行填充(行为state,列为action)

开始迭代

假设:初始化状态为1

根据右表,action只能选择3和5

此时选择3还是5呢?当前的Q为空表,先随机选一个,例如5

接下来就到了状态5,此时有三种选择(1,4,5

文档评论(0)

1亿VIP精品文档

相关文档