2026年人工智能算法基础测试卷强化学习策略.docxVIP

  • 1
  • 0
  • 约9.93千字
  • 约 12页
  • 2026-09-23 发布于北京
  • 举报

2026年人工智能算法基础测试卷强化学习策略.docx

PAGE/NUMPAGES

2026年人工智能算法基础测试卷强化学习策略

考试时间:______分钟总分:______分姓名:______

一、选择题(每题2分,共20分)

1.在马尔可夫决策过程中,假设当前状态为S,采取动作A转移到状态S,获得奖励R(S,A,S)。若折扣因子γ∈[0,1],则基于单步回报的期望累积奖励(即Q值的更新目标)可以表示为:

A.R(S,A,S)+γ*Q(S,A)

B.R(S,A,S)+γ*V(S)

C.R(S,A,S)+γ*Q(S,A)

D.R(S,A,S)*γ*Q(S,A)

2.下列哪种强化学习算法属于无模型(Model-free)方法?

A.贝尔曼最优方程

B.策略迭代

C.Q-Learning

D.值迭代

3.在ε-greedy探索策略中,参数ε的主要作用是:

A.控制价值函数的更新步长

B.定义状态转移概率

C.在每一步决策中,以ε的概率选择随机动作,以(1-ε)的概率选择当前认为最优的动作

D.设置奖励函数的折扣因子

4.蒙特卡洛方法(MC)与时序差分方法(TD)相比,其主要区别在于:

文档评论(0)

1亿VIP精品文档

相关文档