- 0
- 0
- 约9.46千字
- 约 12页
- 2026-04-04 发布于上海
- 举报
强化学习工程师考试试卷
一、单项选择题(共10题,每题1分,共10分)
以下哪项是马尔可夫决策过程(MDP)的核心假设?
A.未来状态仅依赖当前状态,与历史状态无关
B.奖励函数必须是线性的
C.策略必须是确定性的
D.环境模型(转移概率)未知
答案:A
解析:MDP的核心是马尔可夫性质,即未来状态的概率分布仅依赖当前状态(S?),与历史状态(S?,S?,…,S???)无关(A正确)。奖励函数可以是任意形式(B错误);策略可以是随机或确定性的(C错误);MDP允许环境模型已知(如动态规划问题)或未知(如无模型学习)(D错误)。
状态值函数Vπ(s)的定义是:在策略π下,从状态s出发的()?
A.即时奖励期望
B.累计奖励的期望
C.最大可能奖励
D.折扣累计奖励的期望
答案:D
解析:值函数定义为折扣累计奖励的期望,即Vπ(s)=Eπ[Σ?=0^∞γ?R???|S?=s],其中γ是折扣因子(D正确)。即时奖励(A)是R???,累计奖励无折扣(B错误),最大可能奖励是最优值函数的目标(C错误)。
策略梯度方法的优化目标是()?
A.最大化状态值函数的方差
B.最小化动作值函数的误差
C.最大化期望累计奖励
D.最小化策略的熵
答案:C
解析:策略梯度直接优化策略π的参数θ,目标是最大化期望累计奖励J(θ)=Eπ[Σ?=0^∞γ?R???](C正确)。方
您可能关注的文档
最近下载
- 小学三年级下册综合实践活动节水小达人课件.pptx VIP
- 节水小达人课件.pptx VIP
- 试验一森林调查数据预处理11样地数据.pdf VIP
- 2025贵州化工建设有限责任公司第一批次招聘148人笔试备考试题及答案解析(完整版).docx VIP
- 5.3 凸透镜成像的规律(课件)八年级物理上册(人教版).pptx VIP
- 2026年4399游戏策划管培生笔试题及答案.doc VIP
- T_ZZB 2142-2021 作训鞋标准规范.docx VIP
- 设计与人文当代公共艺术超星尔雅学习通答案100分最新版.doc VIP
- Unit 3 课时4 Section 3 Writing(教学课件)2026-2027学年九年级英语上册(沪教版2024).pptx
- 工业机器人离线编程与仿真(ABB)高职全套教学课件.pptx VIP
原创力文档

文档评论(0)