2026年强化学习工程师考试题库(附答案和详细解析)(0129).docxVIP

  • 2
  • 0
  • 约7.94千字
  • 约 11页
  • 2026-03-07 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0129).docx

强化学习工程师考试试卷

一、单项选择题(共10题,每题1分,共10分)

马尔可夫决策过程(MDP)的核心假设是?

A.未来状态仅依赖当前状态,与历史状态无关

B.奖励函数必须是确定性的

C.状态空间必须是连续的

D.策略必须是随机的

答案:A

解析:马尔可夫性的核心是“未来仅依赖当前状态”(无后效性),因此A正确。奖励函数可以是随机的(B错误);状态空间可以是离散或连续(C错误);策略可以是确定性或随机(D错误)。

以下哪种算法属于“离线策略”(Off-Policy)强化学习?

A.策略梯度(PolicyGradient)

B.Q-learning

C.SARSA

D.REINFORCE

答案:B

解析:离线策略指学习策略(目标策略)与生成数据的策略(行为策略)不同。Q-learning使用贪心策略作为目标策略,行为策略可以是ε-贪心,属于离线策略(B正确)。SARSA是在线策略(C错误);策略梯度和REINFORCE均为在线策略(A、D错误)。

深度Q网络(DQN)中“经验回放”(ExperienceReplay)的主要作用是?

A.减少样本间的相关性

B.加速梯度下降

C.提高策略的探索能力

D.优化奖励函数设计

答案:A

解析:经验回放通过存储历史经验并随机采样,打破连续样本的强相关性,避免模型过拟合(A正确)。加速梯度下降是优化器的作用(B错误)

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档