- 1
- 0
- 约6.9千字
- 约 7页
- 2026-07-21 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)
在强化学习框架中,智能体在环境中执行动作后获得的标量数值奖励,通常被称为()。A.状态转移概率B.价值函数C.回报D.策略梯度答案:C解析:回报是强化学习的核心目标,指智能体在某一状态下执行动作后立即获得的标量数值。状态转移概率用于描述环境动力学;价值函数是评估状态或动作的长期期望回报;策略梯度是优化策略的方法。
以下哪种算法属于基于策略梯度的算法?()A.Q-LearningB.DQNC.A3CD.SARSA答案:C解析:A、B、D均属于基于价值的方法(Q-Learning系列)。A3
您可能关注的文档
最近下载
- YD_T 3843-2021 接入型光传送网(OTN)设备技术要求.docx VIP
- 雨课堂学堂在线《材料现代分析测试技术(东北)》学堂云单元测试考核答案.pdf
- 《姑妄言》与江阴.pdf VIP
- 老友记台词剧本第一季第1集中英双语左右对照.pdf VIP
- GB_T 2423.5-2019 中文版(环境试验 第 2 部分:试验方法 试验 Ea:冲击).docx VIP
- 11G329-2 建筑物抗震构造详图.pdf
- JJF_2210-2025_取水计量数据质量控制技术规范(2025年实施新规范).pdf VIP
- 化学竞赛培训课件 分析化学(第七版)竞赛用.pptx VIP
- 时间有多长 第4课时 了解更多有趣的钟表知识(分层作业)苏教版数学二年级下册2026.docx VIP
- 麦可思2025年中国大学生就业报告(完全详细版).docx
原创力文档

文档评论(0)