强化学习决策.docxVIP

  • 0
  • 0
  • 约3.72万字
  • 约 54页
  • 2026-08-24 发布于浙江
  • 举报

PAGE5/NUMPAGES5

强化学习决策

TOC\o1-3\h\z\u

[标签:子标题]0 3

[标签:子标题]1 3

[标签:子标题]2 3

[标签:子标题]3 3

[标签:子标题]4 3

[标签:子标题]5 3

[标签:子标题]6 4

[标签:子标题]7 4

[标签:子标题]8 4

[标签:子标题]9 4

[标签:子标题]10 4

[标签:子标题]11 4

[标签:子标题]12 5

[标签:子标题]13 5

[标签:子标题]14 5

[标签:子标题]15 5

[标签:子标题]16 5

[标签:子标题]17 5

第一部分强化学习基础

关键词

关键要点

马尔可夫决策过程

1.马尔可夫性质是强化学习的核心假设,即系统下一状态仅依赖于当前状态和动作,与历史状态无关。数学上表示为P(s_t+1|s_t,a_t,s_t-1,...,a_1)=P(s_t+1|s_t,a_t),这一性质显著简化了问题建模,使决策过程可被马尔可夫链描述。

2.状态价值函数V^π(s)和动作价值函数Q^π(s,a)是评估策略π的关键工具,分别表示从状态s开始遵循策略π的期望累积奖励和从状态s执行动作a后遵循策略π的期望累积奖励。根据Bell

文档评论(0)

1亿VIP精品文档

相关文档