- 0
- 0
- 约5.87千字
- 约 9页
- 2026-09-29 发布于河北
- 举报
PAGE/NUMPAGES
2026年人工智能算法基础强化学习考试卷
考试时间:______分钟总分:______分姓名:______
一、选择题(每题2分,共20分)
1.在强化学习中,Agent从状态s采取行动a后,转移到状态s并接收奖励r,这一过程通常表示为?
A.(s,a)-(s,r)
B.P(s|s,a)
C.V(s)
D.Q(s,a)
2.下列哪个方法属于基于价值函数的强化学习算法?
A.PolicyGradient
B.REINFORCE
C.Q-Learning
D.Actor-Critic
3.蒙特卡洛方法(MC)在更新价值函数时,其估计值是基于?
A.时序差分
B.样本回报的期望
C.策略梯度的方向
D.状态转移概率
4.TD(0)方法与蒙特卡洛方法的主要区别在于?
A.TD(0)使用折扣因子,MC不用
B.TD(0)使用经验回放,MC不用
C.TD(0)利用了下一时刻的信息进行更新,MC只用当前和初始信息
D.TD(0)只适用于离散动作空间,MC适用于连续动作空间
5.在贝尔曼方程V*(s)=max_a[R(s,a)+γV*(s)|
原创力文档

文档评论(0)