制定复杂决策.pptxVIP

  • 3
  • 0
  • 约2.57千字
  • 约 17页
  • 2022-07-27 发布于上海
  • 举报
制定复杂决策会计学第1页/共17页延续式决策问题 延续式决策问题:智能体的效用值取决于一个决策序列。效用函数不是由单一状态决定,取决于环境历史的一个状态序列。0.8+10.10.1- 1[up, up, right, right, right] 0.85 = 0.32768成功概率: 0.14*0.8+0.85 = 0.32776转移模型 T(s, a, s’): 在状态s完成行动a时到达状态s’的概率完全可观察环境随机行为一阶马尔可夫转移效用函数取决于状态序列第2页/共17页延续式决策问题回报:智能体在一个状态s中得到的一个可正可负的有限值,即回报R(s)。马尔可夫决策过程:使用马尔可夫链转移模型和累加回报的延续式决策过程(MDP) MDP不确定环境的延续式决策问题通过指定行动的概率结果的转移模型和指定每个状态回报的回报函数来定义。 初始状态S0,转移模型, 回报函数。策略π:MDP问题的解,即指定在智能体可能到达的任何状态下,智能体应当采取的行动。π(s):策略π为状态s推荐的行动。最优策略π* :产生最高期望效用的策略.第3页/共17页延续式决策问题(例)+1最优策略:- 1R(s)-1.63+1+1- 1- 1-0.43R(s)-0.09+1◆◆+1- 1◆- 1◆◆◆-0.02R(s)-0R(s)0平衡风险和回报是MDP问题的关键。第4页/共17页延续式决策

文档评论(0)

1亿VIP精品文档

相关文档