- 9
- 0
- 约4.48千字
- 约 13页
- 2026-04-10 发布于山东
- 举报
2026年人工智能工程师《强化学习》真题
姓名:_____?准考证号:_____?得分:______
一、单选题(总共10题,每题2分)
1.强化学习中的值函数V(s)表示的是在状态s下,按照策略π所能获得的期望累积奖励,以下哪种说法是正确的?
A.V(s)是针对任意策略π的
B.V(s)只针对最优策略π
C.V(s)是状态s的固有属性,与策略无关
D.V(s)只考虑单步奖励,不考虑未来奖励
2.在Q-learning算法中,更新规则Q(s,a)←Q(s,a)+α[r+γmax_aQ(s,a)-Q(s,a)],其中α是学习率,γ是折扣因子,以下哪种情况会导致学习率α的选择变得困难?
A.状态空间较小且动作空间有限
B.状态空间和动作空间都很大
C.环境变化缓慢且奖励信号明确
D.环境变化快速且奖励信号模糊
3.蒙特卡洛方法在强化学习中主要用于估计策略的期望回报,以下哪种说法是正确的?
A.蒙特卡洛方法需要知道环境的动态方程
B.蒙特卡洛方法只能用于离散状态空间
C.蒙特卡洛方法通过多次模拟来估计期望回报
D.蒙特卡洛方法不需要记忆历史状态
4.在深度Q网络(DQN)中,使用经验回放机制的主要目的是什么?
A.提高学习效率
B.减少过拟
原创力文档

文档评论(0)