2026年强化学习工程师考试题库(附答案和详细解析)(0724).docxVIP

  • 1
  • 0
  • 约1.02万字
  • 约 9页
  • 2026-09-04 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0724).docx

强化学习工程师

一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程(MDP)的核心马尔可夫性质是指,下一个状态的概率分布仅取决于以下哪一项?A.当前状态和之前所有历史状态B.当前状态和当前执行的动作C.未来状态和当前动作D.所有历史动作的累计奖励答案:B解析:马尔可夫性的核心定义是状态转移概率仅和当前状态、当前动作相关,与历史状态动作序列完全无关。选项A违背马尔可夫性假设;选项C逻辑倒置,状态转移是从当前指向未来而非反向;选项D的累计奖励和状态转移的概率分布无直接关联。2.贝尔曼最优方程的核心求解目标是得到以下哪一项?A.任意策略下的状态价值函数B.最优状态价值函数和最优动作价值函数C.随机策略的状态转移概率D.所有策略的累计奖励均值答案:B解析:贝尔曼最优方程是基于最优性原理推导而来,用于求解所有状态下能获得最大长期回报的价值估计,即最优状态价值和最优动作价值。选项A对应的是普通贝尔曼期望方程的求解目标;选项C、D均不属于贝尔曼最优方程的求解范畴。3.以下关于ε-贪心探索策略的描述,正确的是?A.以1-ε的概率随机选择动作,ε的概率选择当前最优动作B.ε的取值必须固定为1才能保证充分探索C.以ε的概率随机选择动作,1-ε的概率选择当前最优动作D.ε越大,智能体的利用占比越高答案:C解析:ε-贪

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档