2026年强化学习工程师考试题库(附答案和详细解析)(0207).docxVIP

  • 1
  • 0
  • 约8.97千字
  • 约 12页
  • 2026-04-22 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0207).docx

强化学习工程师考试试卷

一、单项选择题(共10题,每题1分,共10分)

马尔可夫决策过程(MDP)的核心假设是:

A.未来状态仅依赖当前状态,与历史无关

B.奖励函数必须是确定性的

C.策略必须是随机的

D.状态空间必须是有限的

答案:A

解析:马尔可夫性质的核心是“当前状态包含所有历史信息”,因此未来状态仅由当前状态决定(与历史无关)。B错误,奖励函数可以是随机的;C错误,策略可以是确定性或随机的;D错误,状态空间可以是连续或无限的。

Q-learning算法中,Q值的更新公式为:

A.(Q(s,a)Q(s,a)+)

B.(Q(s,a)Q(s,a)+)(其中(a’)由当前策略选择)

C.(Q(s,a)[^tr_t|s,a])

D.(Q(s,a)(a|s)V(s))

答案:A

解析:Q-learning是离线策略算法,更新时使用下一状态的最大Q值((_{a’}Q(s’,a’)))。B是SARSA的更新公式(在线策略,使用当前策略选择的(a’));C是Q值的定义式而非更新式;D是策略与值函数的关系,非更新公式。

以下哪种算法属于“策略梯度方法”?

A.DQN

B.PPO

C.SARSA

D.DDPG(深度确定性策略梯度)

答案:B

解析:PPO(近端策略优化)是典型的策略梯度算法,直接优化策略函数。A(DQN)

文档评论(0)

1亿VIP精品文档

相关文档