Q-Learning 函数相关知识.ppt

Q-Learning by毛毛 图1 2010-12-1 * 目标 学习选择动作使下式最大化 Agent的任务是学习一个控制策略 2010-12-1 * (1) 是一个常量,它确定了延迟回报和立即回报的相对比例。 被称为由策略 从初始状态 获得的折算累积回报 2010-12-1 * (2) 最优策略 2010-12-1 * (3) 看图2 2010-12-1 * (4) 2010-12-1 * (5) 2010-12-1 * (6) 2010-12-1 * (7) 2010-12-1 * (8) 2010-12-1 * 公式总结 2010-12-1 * 图2 2010-12-1 * 图3 2010-12-1 * * * * * * *

文档评论(0)

1亿VIP精品文档

相关文档