具身智能导论_第3章 强化学习.pptxVIP

  • 1
  • 0
  • 约1.74千字
  • 约 122页
  • 2026-09-16 发布于山东
  • 举报

;;强化学习特点;学习目标;本章目录;;3.1强化学习:通过互动学习最佳行动方案;不同学习方式的关注点;强化学习基本思路:状态—动作—奖励;强化学习框架的基本组成;状态与动作:描述“在哪里”与“做什么”;奖励Reward;策略Policy:智能体“如何选择动作”;价值函数:从“即时奖励”走向“预期长期收益”;状态价值函数Vπ(s);动作价值函数Qπ(s,a);V与Q的关系;MDP与POMDP;Episode与Trajectory:交互形成“经验”的过程;探索—利用之间的权衡;ε-贪婪策略:用概率机制协调探索与利用;例:4×4网格世界“觅食”问题;例:把问题写成(S,A,P,R);例:奖励函数;例:策略:从起点的动作序列;例:策略评估;例:最短路径不一定等于最优策略;强化学习发展的代表性节点;3.1.2原理与数学框架:马尔可夫性质;贝尔曼方程;贝尔曼最优方程;模型已知VS模型未知;学习率与探索率;;3.2Q学习:直接估计状态—动作价值;离策略学习;Q学习的核心:时序差分(Temporal?Difference,TD)更新;TD目标、TD误差与更新步长;单步自举;Q学习算法流程;Q学习中的探索;从Q表和DQN;Q学习的优势;Q学习的局限与缓解思路;Q学习在机器人任务中的应用;3.2Q学习小结;;3.3策略梯度:直接针对策略进

文档评论(0)

1亿VIP精品文档

相关文档