- 0
- 0
- 约3.72万字
- 约 54页
- 2026-08-24 发布于浙江
- 举报
PAGE5/NUMPAGES5
强化学习决策
TOC\o1-3\h\z\u
[标签:子标题]0 3
[标签:子标题]1 3
[标签:子标题]2 3
[标签:子标题]3 3
[标签:子标题]4 3
[标签:子标题]5 3
[标签:子标题]6 4
[标签:子标题]7 4
[标签:子标题]8 4
[标签:子标题]9 4
[标签:子标题]10 4
[标签:子标题]11 4
[标签:子标题]12 5
[标签:子标题]13 5
[标签:子标题]14 5
[标签:子标题]15 5
[标签:子标题]16 5
[标签:子标题]17 5
第一部分强化学习基础
关键词
关键要点
马尔可夫决策过程
1.马尔可夫性质是强化学习的核心假设,即系统下一状态仅依赖于当前状态和动作,与历史状态无关。数学上表示为P(s_t+1|s_t,a_t,s_t-1,...,a_1)=P(s_t+1|s_t,a_t),这一性质显著简化了问题建模,使决策过程可被马尔可夫链描述。
2.状态价值函数V^π(s)和动作价值函数Q^π(s,a)是评估策略π的关键工具,分别表示从状态s开始遵循策略π的期望累积奖励和从状态s执行动作a后遵循策略π的期望累积奖励。根据Bell
原创力文档

文档评论(0)