- 0
- 0
- 约9.45千字
- 约 8页
- 2026-08-11 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程(MDP)的核心性质是指当前状态仅依赖于哪一项要素?A.所有历史状态的总和B.上一时刻的状态与当前执行的动作C.未来时刻的所有奖励D.智能体的初始策略答案:B解析:马尔可夫性质的定义是下一个状态的转移概率仅由当前状态和当前执行的动作决定,与更早的历史状态无关。A选项违背马尔可夫性质的核心定义,C选项的未来奖励是后验要素,D选项的初始策略是智能体的预设参数,均不符合要求。2.ε-greedy策略在强化学习训练中的核心作用是?A.完全消除探索行为B.平衡探索与利用的关系C.大幅降低算法的计算复杂度D.保证策略100%收敛到全局最优答案:B解析:ε-greedy以ε的概率随机探索动作、1-ε的概率选择当前最优动作,核心作用是平衡探索(尝试新动作发现更高奖励路径)和利用(选择已知最优动作获取即时收益)。A选项与ε-greedy的设计初衷完全相反,C选项ε-greedy不会降低计算复杂度,D选项ε-greedy仅能提升收敛到全局最优的概率,无法100%保证。3.下列算法中属于on-policy类时序差分算法的是?A.Q-LearningB.DQNC.SARSAD.DDPG答案:C解析:SARSA使用当前策略执行得到的动作来更新值函数,属于典
原创力文档

文档评论(0)