- 1
- 0
- 约9.93千字
- 约 12页
- 2026-09-23 发布于北京
- 举报
PAGE/NUMPAGES
2026年人工智能算法基础测试卷强化学习策略
考试时间:______分钟总分:______分姓名:______
一、选择题(每题2分,共20分)
1.在马尔可夫决策过程中,假设当前状态为S,采取动作A转移到状态S,获得奖励R(S,A,S)。若折扣因子γ∈[0,1],则基于单步回报的期望累积奖励(即Q值的更新目标)可以表示为:
A.R(S,A,S)+γ*Q(S,A)
B.R(S,A,S)+γ*V(S)
C.R(S,A,S)+γ*Q(S,A)
D.R(S,A,S)*γ*Q(S,A)
2.下列哪种强化学习算法属于无模型(Model-free)方法?
A.贝尔曼最优方程
B.策略迭代
C.Q-Learning
D.值迭代
3.在ε-greedy探索策略中,参数ε的主要作用是:
A.控制价值函数的更新步长
B.定义状态转移概率
C.在每一步决策中,以ε的概率选择随机动作,以(1-ε)的概率选择当前认为最优的动作
D.设置奖励函数的折扣因子
4.蒙特卡洛方法(MC)与时序差分方法(TD)相比,其主要区别在于:
您可能关注的文档
最近下载
- 建筑物防雷工程施工与质量验收规范 施工专业.pdf VIP
- 浙江省杭州市学军中学2023-2024学年上学期期末考试高一英语试题(含答案).docx VIP
- 教科版小学科学六年级上册单元检测试卷(含答案).pdf VIP
- 标准图集-2018沪G504 钢筋混凝土锚杆静压桩和钢管锚杆静压桩.pdf VIP
- 2025年河南省公务员省考《行测》真题(含答案).docx VIP
- 六年级修改病句大全及答案(可编辑).pdf VIP
- 2026《高一数学培优讲义》秋季(学生版).pdf VIP
- 天融信网络数据防泄漏系统(TopDLP-N)技术白皮书v4.1.doc VIP
- 10J301地下防水图集-10g301.docx VIP
- 网络安全等级保护2.0基础知识培训.pptx VIP
原创力文档

文档评论(0)