- 0
- 0
- 约8.85千字
- 约 8页
- 2026-08-31 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)1.下列选项中,不属于马尔可夫决策过程(MDP)固有核心组成要素的是A.状态集合与动作集合B.状态转移概率与即时奖励函数C.折扣因子参数D.确定性最优执行策略答案:D解析:MDP的固有要素为状态集、动作集、转移概率、奖励函数、折扣因子,最优策略是通过算法求解得到的输出结果,不属于MDP本身的定义要素。A、B、C选项均为MDP标准定义中的固有组成部分,描述符合知识点要求。2.对于ε-greedy探索策略,当ε取值为0时,智能体的行为模式是A.100%选择随机动作进行探索B.100%选择当前估计价值最高的动作执行C.以等概率随机选择所有动作D.探索概率与当前状态价值正相关答案:B解析:ε-greedy策略的逻辑为以ε的概率随机探索动作,以1-ε的概率选择当前价值最高的动作,ε=0时探索概率为0,完全执行贪婪动作。A选项是ε=1时的行为,C选项是均匀随机策略的特征,D选项不符合ε-greedy的定义逻辑。3.Q-learning算法属于以下哪种强化学习范式A.在线策略(On-policy)的值函数算法B.离线策略(Off-policy)的值函数算法C.在线策略的策略梯度算法D.离线策略的策略梯度算法答案:B解析:Q-learning通过观测其他策略产生的样
您可能关注的文档
最近下载
- 中医药基础(第2版)课件 第1--10章 绪论---中药总论.pptx
- 2026使用危险化学品实验室安全管理规范指引.docx VIP
- 性传播性疾病(STD).ppt VIP
- GB_T 5097-2020无损检测 渗透检测和磁粉检测 观察条件.docx VIP
- 2025年秋季新人教版英语八年级上册全册同步课件.pptx
- 2026年监理副高级职称答辩问题及答案.docx VIP
- 铸造安全培训课件.pptx VIP
- 电气原理图符号大全实用参考手册.pdf
- 2024游戏IP文旅共创新可能研究报告-中国旅游研究院.pdf VIP
- 初中历史 2025-2026学年四川省成都市双流区七年级(下)期末历史试卷附解答.pdf VIP
原创力文档

文档评论(0)