- 1
- 0
- 约8.97千字
- 约 12页
- 2026-04-22 发布于上海
- 举报
强化学习工程师考试试卷
一、单项选择题(共10题,每题1分,共10分)
马尔可夫决策过程(MDP)的核心假设是:
A.未来状态仅依赖当前状态,与历史无关
B.奖励函数必须是确定性的
C.策略必须是随机的
D.状态空间必须是有限的
答案:A
解析:马尔可夫性质的核心是“当前状态包含所有历史信息”,因此未来状态仅由当前状态决定(与历史无关)。B错误,奖励函数可以是随机的;C错误,策略可以是确定性或随机的;D错误,状态空间可以是连续或无限的。
Q-learning算法中,Q值的更新公式为:
A.(Q(s,a)Q(s,a)+)
B.(Q(s,a)Q(s,a)+)(其中(a’)由当前策略选择)
C.(Q(s,a)[^tr_t|s,a])
D.(Q(s,a)(a|s)V(s))
答案:A
解析:Q-learning是离线策略算法,更新时使用下一状态的最大Q值((_{a’}Q(s’,a’)))。B是SARSA的更新公式(在线策略,使用当前策略选择的(a’));C是Q值的定义式而非更新式;D是策略与值函数的关系,非更新公式。
以下哪种算法属于“策略梯度方法”?
A.DQN
B.PPO
C.SARSA
D.DDPG(深度确定性策略梯度)
答案:B
解析:PPO(近端策略优化)是典型的策略梯度算法,直接优化策略函数。A(DQN)
您可能关注的文档
- 共享出行平台的用户留存策略设计.docx
- “双碳”目标下的新能源汽车产业布局.docx
- 5G+边缘计算在智能电网中的latency优化.docx
- 2025年智慧城市设计师考试题库(附答案和详细解析)(1230).docx
- 2026年AI产品经理考试题库(附答案和详细解析)(0307).docx
- 2026年电工资格证考试题库(附答案和详细解析)(0116).docx
- 2026年儿童发展指导师考试题库(附答案和详细解析)(0219).docx
- 2026年强化学习工程师考试题库(附答案和详细解析)(0311).docx
- 2026年人工智能工程师考试题库(附答案和详细解析)(0127).docx
- 2026年一级建造师考试题库(附答案和详细解析)(0129).docx
最近下载
- 红旗杯班组长题库.pdf VIP
- Excel在会计中的应用(第三版)(喻竹)全套PPT课件.pptx
- 苍蝇小子绘本There Was An Old Lady Who Swallowed FLY GUY.pdf VIP
- Siemens 西门子家电 西门子干衣机 WT46E301TI 13 使用说明书 安装说明 程序表.pdf
- 《烹饪营养与配餐》中职烹饪专业全套教学课件.pptx
- 艺术本科新生及转学申请.ppt VIP
- Leapfrog-Geo地质建模使用说明.docx VIP
- 外墙抹灰施工方案(完整版).docx
- 机电工程安装细部节点做法(2025年).docx
- 电力建设施工测量控制方案.docx
原创力文档

文档评论(0)