2026年强化学习工程师考试题库(附答案和详细解析)(0903).docxVIP

  • 0
  • 0
  • 约1.05万字
  • 约 9页
  • 2026-09-21 发布于上海
  • 举报

2026年强化学习工程师考试题库(附答案和详细解析)(0903).docx

强化学习工程师

一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程(MDP)的核心特征是哪一项?A.下一时刻的状态仅由当前状态和当前动作决定,与历史状态无关B.下一时刻的状态由所有历史状态的加权和决定C.状态转移过程不存在任何随机性D.奖励信号的生成仅和历史动作序列相关答案:A解析:正确选项依据是MDP的马尔可夫性定义:未来状态仅依赖当前状态和动作,与过去无关。错误选项B违背马尔可夫性的核心定义;错误选项C,MDP分为确定型和随机型,转移函数可以包含随机采样过程;错误选项D,MDP的奖励函数通常由当前状态、动作和下一状态共同决定,而非仅关联历史动作序列。2.下列关于Q-learning算法的描述,正确的是?A.属于在线策略(on-policy)算法,更新的是当前执行策略的价值B.属于离线策略(off-policy)算法,通过目标策略的最优动作选择更新价值C.只能处理连续动作空间的强化学习任务D.不需要维护Q值表,直接拟合价值函数答案:B解析:正确选项依据是Q-learning的核心逻辑:通过记录目标策略下的最大Q值来更新当前Q表,属于典型的off-policy算法。错误选项A,Q-learning并非on-policy,SARSA才是on-policy时序差分算法;错误选项C,原生Q-learning仅能处理离散动作空

文档评论(0)

1亿VIP精品文档

相关文档