- 1
- 0
- 约3.77千字
- 约 16页
- 2026-09-10 发布于天津
- 举报
2025年强化学习探索与利用平衡考核试卷
一、单项选择题(每题1分,共30题)
1.强化学习的主要目标是什么?
A.最小化误差
B.最大化累积奖励
C.最小化计算复杂度
D.增加模型参数
2.哪种算法属于基于模型的强化学习?
A.Q-learning
B.SARSA
C.DDPG
D.Dyna-Q
3.在强化学习中,探索-利用困境指的是什么?
A.计算资源有限
B.状态空间巨大
C.策略选择困难
D.环境变化快
4.哪种方法常用于平衡探索和利用?
A.贪心策略
B.ε-greedy算法
C.动态规划
D.神经网络优化
5.MonteCarlo方法在强化学习中的应用是什么?
A.状态空间压缩
B
原创力文档

文档评论(0)