- 0
- 0
- 约1.05万字
- 约 9页
- 2026-08-29 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)1.以下不属于马尔可夫决策过程(MDP)核心五元组要素的是A.状态集合SB.动作集合AC.特征提取器FD.奖励函数R答案:C解析:MDP的标准五元组为S,A,P,R,γ,其中P是状态转移概率矩阵,γ是折扣因子,特征提取器是深度强化学习中可选的辅助组件,不属于MDP的原生定义要素。选项A、B、D都是MDP的标准核心构成部分。2.ε-贪心策略中,随着训练迭代逐步减小ε的核心作用是A.完全消除探索行为B.平衡训练后期的探索与利用比例,逐步收敛到最优策略C.提升智能体的随机动作占比D.增大策略的熵值答案:B解析:ε-贪心策略中ε代表随机探索的概率,训练初期设置较大ε鼓励探索,后期逐步降低ε,让智能体更多选择当前已知最优动作,最终收敛到最优策略。选项A错误,ε不会降到0的话不会完全消除探索;选项C错误,ε减小会降低随机动作占比;选项D错误,ε减小会降低策略熵值。3.Q-learning算法属于以下哪类学习范式A.on-policy时序差分学习B.off-policy时序差分学习C.on-policy蒙特卡洛学习D.off-policy蒙特卡洛学习答案:B解析:Q-learning的更新过程使用目标策略(贪心策略)的最大Q值计算目标值,和当前生成样本的行
原创力文档

文档评论(0)