- 0
- 0
- 约1.01万字
- 约 10页
- 2026-09-08 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)
下列选项中,不属于马尔可夫决策过程(MDP)标准核心要素的是A.状态空间SB.动作空间AC.反向传播梯度矩阵GD.奖励函数R答案:C解析:MDP的标准核心要素为状态空间、动作空间、转移概率矩阵、奖励函数、折扣因子,反向传播梯度矩阵是深度学习训练的中间产物,不属于MDP的固有要素。选项A、B、D均为MDP标准组成部分,C为干扰项。
ε-贪心策略中,当ε取值为0时,智能体的行为模式是A.以1-ε概率选择当前最优动作,ε概率随机探索B.完全随机选择所有动作,无任何倾向性C.始终选择当前估值最高的动作,完全不进行探索D.每轮动作选择完全由环境奖励决定答案:C解析:ε-贪心策略的定义是以1-ε概率选取当前最优动作,ε概率随机探索,当ε=0时随机探索的概率为0,智能体始终选择估值最高的动作。选项A是ε0时的常规模式,选项B对应ε=1的情况,选项D不符合策略定义逻辑。
下列算法中,属于时序差分(TD)类强化学习算法的是A.蒙特卡洛策略评估B.Q-LearningC.动态规划值迭代D.策略迭代答案:B解析:Q-Learning通过单步时序差分项更新状态动作值,是典型的TD类算法。蒙特卡洛需要完成完整轨迹采样后再更新,动态规划类的值迭代、策略迭代需要环境转移概率的完整先验知识,
您可能关注的文档
最近下载
- 2025注册消防工程师继续教育考题:重大火灾隐患判定规则.doc VIP
- 【六年级下册数学】【人教版】知识总结.pdf VIP
- 工程竣工移交书.doc VIP
- 小学信息技术《Scratch编程》校本教材.pdf VIP
- 大学计算机基础(Windows10+WPSOffice2019)PPT完整全套教学课件.pptx
- 5G移动通信课件:5G基本原理与网络架构.pptx
- ISPE 控温箱温度分布试验和监测 中英文.pdf VIP
- 《机械制图》完整版电子教案最全精品课件整本书课件全套教学教程(最新).ppt VIP
- Skopos and Commission in Translational Action翻译行为的目的与委托.doc VIP
- (2026版)银行金融科技招聘笔试题及答案.docx VIP
原创力文档

文档评论(0)