《强化学习理论与应用》基于AC框架的深度强化学习方法.pptVIP

  • 0
  • 0
  • 约8.53千字
  • 约 10页
  • 2026-09-10 发布于重庆
  • 举报

《强化学习理论与应用》基于AC框架的深度强化学习方法.ppt

目录行动者-评论家架构14.114.3A3C算法的实验结果及分析14.2A3C算法14.5A2C算法的实验结果及分析14.4A2C算法114.6小结

2在基于随机策略的AC(Actor-Critic,AC)框架深度强化学习系列方法中,一个最核心的算法是由Mnih等人提出的异步优势行动者评论家算法(AsynchronousAdvantageActorCirtic,A3C):该算法基于异步强化学习(AsynchronousReinforcementLearning,ARL)思想,在AC框架中加入异步操作,使多个AC网络异步并行地工作,加快算法运行速度,使深度强化学习算法能够在CPU上快速地运行。此外,A3C算法不再使用经验回放机制,节省了内存,实现了完全在线式的强化学习方式。引言(1)

3优势AC算法(AdvantageActorCirtic,A2C):但由于A3C采用了多个异步并行的网络结构,所以参数多,占用内存空间大。针对A3C算法存在的问题,提出了优势AC算法(AdvantageActorCirtic,A2C)算法,该算法不再使用异步并行的网络结构,只用一个AC网络,其异步并行结构只用于收集样本,每次样本收集完成后再进行更新网络。引言(2)

14.1行动者-评论家架构(1)行动者-评论家(Acto

文档评论(0)

1亿VIP精品文档

相关文档