- 4
- 0
- 约8.44千字
- 约 12页
- 2026-04-22 发布于上海
- 举报
强化学习工程师考试试卷
一、单项选择题(共10题,每题1分,共10分)
马尔可夫决策过程(MDP)的核心组成不包括以下哪项?
A.状态空间S
B.动作空间A
C.状态价值函数V(s)
D.折扣因子γ
答案:C
解析:MDP的标准组成包括状态空间S、动作空间A、转移概率P(s’|s,a)、奖励函数R(s,a,s’)和折扣因子γ。状态价值函数V(s)是MDP的衍生概念(用于评估策略价值),而非MDP的原始组成部分,因此选C。
以下哪种算法属于基于策略梯度的强化学习方法?
A.Q-learning
B.DQN
C.PPO
D.SARSA
答案:C
解析:PPO(近端策略优化)是典型的策略梯度算法,直接优化策略参数;Q-learning、DQN、SARSA均属于值函数方法(通过估计动作价值函数间接优化策略),因此选C。
强化学习中“探索(Exploration)”与“利用(Exploitation)”的平衡目标是?
A.最大化当前已知最优动作的收益
B.最小化策略更新的方差
C.兼顾发现新的高收益动作与利用已有知识
D.降低环境交互的样本复杂度
答案:C
解析:探索是尝试新动作以发现潜在更高收益,利用是执行当前已知最优动作,二者平衡的目标是长期累积奖励最大化,因此选C。A仅描述利用,B是策略梯度优化目标,D是样本效率目标,均不正确。
贝尔曼方程的本质是?
A.状态
您可能关注的文档
- 共享出行平台的用户留存策略设计.docx
- “双碳”目标下的新能源汽车产业布局.docx
- 5G+边缘计算在智能电网中的latency优化.docx
- 2025年智慧城市设计师考试题库(附答案和详细解析)(1230).docx
- 2026年AI产品经理考试题库(附答案和详细解析)(0307).docx
- 2026年电工资格证考试题库(附答案和详细解析)(0116).docx
- 2026年儿童发展指导师考试题库(附答案和详细解析)(0219).docx
- 2026年强化学习工程师考试题库(附答案和详细解析)(0207).docx
- 2026年人工智能工程师考试题库(附答案和详细解析)(0127).docx
- 2026年一级建造师考试题库(附答案和详细解析)(0129).docx
最近下载
- 大疆嵌入式面试题及答案解析.doc VIP
- 第四讲阿尔弗雷德马歇尔经济学原理.ppt VIP
- 大疆嵌入式软件笔试题.docx VIP
- SEL-751A_美国SEL公司751A中文版说明书.PDF VIP
- 水平四(九年级)《1、选项训练(跳绳、三级蛙跳、立定跳远、投掷)2、耐力跑训练》教案.docx VIP
- 2026粤北人民医院招聘编外人员67人(广东)笔试备考试题及答案解析.docx VIP
- 2026年全国安全生产月:人人讲安全、个个会应急 —— 排查整治风险隐患(纺织行业)PPT课件.pptx VIP
- 初中实心球体育课教案.doc VIP
- GB 6441-2025事故分类与编码实施疑难解答.docx VIP
- 1分钟跳绳教案.doc VIP
原创力文档

文档评论(0)