- 2
- 0
- 约9.05千字
- 约 8页
- 2026-10-03 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程中,“回报(Return)”的标准定义是A.智能体当前动作获得的即时奖励B.从当前时刻开始到终止状态的所有折扣奖励之和C.整个交互周期内所有即时奖励的加和D.状态动作对对应的期望长期奖励值答案:B解析:正确选项依据强化学习经典定义,回报是从当前时刻起未来折扣奖励的累计和。A选项是即时奖励的定义,C选项未引入折扣因子不符合标准回报定义,D选项是状态动作值函数的定义。2.下列算法中属于On-Policy(同策略)类深度强化学习算法的是A.DQNB.DoubleDQNC.SARSAD.DDPG答案:C解析:SARSA使用当前正在更新的策略生成样本进行学习,属于同策略算法。其余三个选项均属于异策略算法,使用行为策略生成的样本训练目标策略。3.DQN算法引入经验回放机制的核心作用是A.提升神经网络的前向推理速度B.打破训练样本的时序相关性,提升样本利用率C.避免目标值估计过高的偏差问题D.减小神经网络参数的更新步长,保证收敛答案:B解析:经验回放将历史交互样本存储在缓冲池中,随机采样训练,打破了时序样本的强相关性,同时可以重复利用样本。A选项无对应逻辑,C选项是DoubleDQN的作用,D选项是目标网络更新机制的作用。4.ε-gre
您可能关注的文档
最近下载
- HOLLiAS_MACS_V7_系统历史数据查询手册.pdf VIP
- 山东海关系统录用公务员考试(机械自动化类)在线试题解析+考点知识分析(2026年).docx VIP
- 镍冶炼中的湿法冶金技术.pptx VIP
- 平顶山市2025年县以下和部分市直事业单位公开招聘联考笔试历年典型考题及考点剖析附带答案详解.docx
- 数字描红(1-10打印).doc VIP
- 班组长竞聘报告.ppt VIP
- 新22D4 常用风机、水泵控制新22系列图集 建筑.docx VIP
- 鱼c小甲鱼零基础学python全套课后题.pdf
- 【2024.一模】顺义高三英语试题及答案.pdf VIP
- 2、跨引江济汉特大桥96m钢桁梁拖拉施工计算书.docx VIP
原创力文档

文档评论(0)