PAGE/NUMPAGES
2026年人工智能考研真题及强化学习
考试时间:______分钟总分:______分姓名:______
一、选择题(每小题2分,共20分。下列每小题给出的四个选项中,只有一项是符合题目要求的。请将正确选项前的字母填在答题卡相应位置。)
1.在马尔可夫决策过程中,贝尔曼方程V(s)=Σ_aΣ_p(r|s,a,s)[r+γV(s)](a)表示的是:
A.策略评估方程,评估使用策略π时的价值函数
B.策略改进方程,用于更新策略π
C.Q-Learning算法的更新规则
D.SARSA算法的更
原创力文档

文档评论(0)