2026年强化学习工程师考试题库(附答案和详细解析)(0818).docxVIP

  • 2
  • 0
  • 约9.05千字
  • 约 8页
  • 2026-10-03 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0818).docx

强化学习工程师

一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程中,“回报(Return)”的标准定义是A.智能体当前动作获得的即时奖励B.从当前时刻开始到终止状态的所有折扣奖励之和C.整个交互周期内所有即时奖励的加和D.状态动作对对应的期望长期奖励值答案:B解析:正确选项依据强化学习经典定义,回报是从当前时刻起未来折扣奖励的累计和。A选项是即时奖励的定义,C选项未引入折扣因子不符合标准回报定义,D选项是状态动作值函数的定义。2.下列算法中属于On-Policy(同策略)类深度强化学习算法的是A.DQNB.DoubleDQNC.SARSAD.DDPG答案:C解析:SARSA使用当前正在更新的策略生成样本进行学习,属于同策略算法。其余三个选项均属于异策略算法,使用行为策略生成的样本训练目标策略。3.DQN算法引入经验回放机制的核心作用是A.提升神经网络的前向推理速度B.打破训练样本的时序相关性,提升样本利用率C.避免目标值估计过高的偏差问题D.减小神经网络参数的更新步长,保证收敛答案:B解析:经验回放将历史交互样本存储在缓冲池中,随机采样训练,打破了时序样本的强相关性,同时可以重复利用样本。A选项无对应逻辑,C选项是DoubleDQN的作用,D选项是目标网络更新机制的作用。4.ε-gre

文档评论(0)

1亿VIP精品文档

相关文档