- 1
- 0
- 约1.26万字
- 约 29页
- 2026-08-20 发布于上海
- 举报
2026年强化学习试题及分析
一、单项选择题(共10题,每题1分,共10分)
在强化学习中,智能体(Agent)通过与环境交互来学习,其根本目标是:
A.最小化每一步的即时成本
B.最大化从环境中获得的即时奖励
C.最小化长期的总成本
D.最大化长期累积的期望回报
答案:D
解析:强化学习的核心是智能体通过采取行动与环境交互,以最大化长期累积的期望回报(通常称为“回报”或“折扣回报”),而非仅仅关注单步的即时奖励或成本。选项A和C强调了成本最小化,与最大化回报的核心目标不符。选项B只关注了即时奖励,忽略了长期规划的重要性。
以下哪个概念是马尔可夫决策过程(MDP)的核心假设?
A.状态转移概率仅依赖于当前状态和动作
B.奖励函数是确定性的
C.策略必须是确定性的
D.状态空间必须是有限的
答案:A
解析:马尔可夫决策过程(MDP)的核心假设是“马尔可夫性”,即下一状态的状态转移概率仅依赖于当前状态和采取的动作,与历史状态和动作无关。选项B错误,奖励函数可以是确定性的,也可以是随机的。选项C错误,策略可以是确定性的,也可以是随机性的。选项D错误,MDP的状态空间可以是有限的,也可以是无限的。
在策略迭代(PolicyIteration)算法中,策略评估(PolicyEvaluation)步骤通常使用哪种方法求解给定策略下的状态价值函数?
A.蒙特卡洛方法
B.
原创力文档

文档评论(0)