- 2
- 0
- 约8.08千字
- 约 10页
- 2026-04-14 发布于上海
- 举报
强化学习工程师考试试卷
一、单项选择题(共10题,每题1分,共10分)
马尔可夫决策过程(MDP)的核心组成不包括以下哪项?
A.状态空间S
B.动作空间A
C.环境奖励函数R
D.监督学习标签
答案:D
解析:MDP的标准定义包含状态空间S、动作空间A、转移概率P、奖励函数R和折扣因子γ。监督学习标签是监督学习的输入,与MDP无关,因此选D。
在Q-learning中,更新Q值的目标是以下哪项?
A.Q(s,a)←Q(s,a)+α[r+γmax_a’Q(s’,a’)-Q(s,a)]
B.Q(s,a)←Q(s,a)+α[r+γQ(s’,π(s’))-Q(s,a)]
C.Q(s,a)←E[R+γV(s’)]
D.π(s)←argmax_aQ(s,a)
答案:A
解析:Q-learning是Off-policy算法,使用max操作选择下一状态的最优动作(不依赖当前策略),对应公式A;B是Sarsa(On-policy)的更新公式;C是值函数的定义式;D是策略改进的贪心策略,因此选A。
以下哪种算法属于基于策略的强化学习方法?
A.DQN
B.PPO
C.Q-learning
D.Sarsa
答案:B
解析:基于策略的算法直接优化策略π(a|s),PPO(近端策略优化)是典型的策略梯度类算法;DQN、Q-learni
您可能关注的文档
- 2026年信用管理师考试题库(附答案和详细解析)(0308).docx
- 2026年广播电视播音员主持人资格考试题库(附答案和详细解析)(0310).docx
- 2026年普通话水平测试考试题库(附答案和详细解析)(0216).docx
- 2026年注册合规师(CRCMP)考试题库(附答案和详细解析)(0311).docx
- 2026年注册地质工程师考试题库(附答案和详细解析)(0309).docx
- 2026年注册投资项目分析师(CIPA)考试题库(附答案和详细解析)(0216).docx
- 2026年注册景观设计师考试题库(附答案和详细解析)(0305).docx
- 2026年注册机械工程师考试题库(附答案和详细解析)(0202).docx
- 2026年注册结构工程师考试题库(附答案和详细解析)(0303).docx
- 2026年注册船舶工程师考试题库(附答案和详细解析)(0313).docx
最近下载
- 有机磷农药中毒的急救(课件PPT).pptx VIP
- 湖北省第一届人教杯创新教学设计大赛.doc VIP
- 临床医学各类导管种类及护理.pptx VIP
- KORG科音Pa3X用户手册.pdf
- 老年共病管理临床应用专家共识(2025版).docx VIP
- 中医经典大字拼音诵读本-黄帝内经灵枢69(简体).pdf VIP
- 西门子S7-1200 PLC编程及应用(第二版):S7-1200PLC编程指令PPT教学课件.pptx
- 2025重庆江津区华信资产经营(集团)有限公司公开招聘笔试备考题库附答案解析.docx VIP
- 《中国道教(第四卷)(三)》青少年经典文学读本.pdf VIP
- 中华古籍集藏四库别集 青山集(元赵文).pdf VIP
原创力文档

文档评论(0)