2026年强化学习工程师考试题库(附答案和详细解析)(0717).docxVIP

  • 0
  • 0
  • 约9.03千字
  • 约 8页
  • 2026-08-03 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0717).docx

强化学习工程师

一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程(MDP)的核心马尔可夫性要求,下一时刻的状态概率分布仅由以下哪项直接决定?A.当前状态和所有历史动作序列B.当前状态和当前执行的动作C.未来状态的预估分布和当前奖励D.历史所有状态的累积奖励总和答案:B解析:马尔可夫性的核心定义是状态转移概率仅依赖当前状态和当前动作,与历史状态动作无关。A选项违背马尔可夫性的无后效性,C选项将未来状态作为转移依据逻辑倒置,D选项累积奖励与状态转移概率无直接关联。2.贝尔曼最优方程的求解目标是得到以下哪一项的全局最大值?A.任意策略下的状态价值函数B.最优策略下的状态价值函数C.经验回放池的样本利用率D.策略梯度的方差答案:B解析:贝尔曼最优方程的核心作用是推导所有可能策略中能获得最高期望累积奖励的最优状态价值函数。A选项对应普通贝尔曼期望方程的求解对象,C、D选项与贝尔曼最优方程的定义无关。3.以下哪种算法属于同策略(on-policy)的时序差分学习算法?A.SarsaB.Q-learningC.DQND.DDPG答案:A解析:Sarsa使用当前正在执行的动作更新价值函数,属于典型同策略算法。B、C、D均使用目标策略与行为策略分离的离线策略设计。4.DQN算法中引入目标网络的核心作用是?

文档评论(0)

1亿VIP精品文档

相关文档